找回密码
 立即注册
搜索
热搜: AI AGI ASI
查看: 0|回复: 0

但是 AI 的搜索引擎它背后肯定也有个引擎啊,或者它是聚合搜索,它总。不会自己去爬那些网站吧,那个是大工程

[复制链接]

1350

主题

24

回帖

3011

积分

管理员

积分
3011
发表于 4 小时前 来自手机 | 显示全部楼层 |阅读模式
问到点子上了——这个领域的格局其实是“三种模式并存”,而且比你想象的更分裂
你的直觉对了一半:确实很多 AI 搜索不自建索引。但另一半是:头部玩家真的在爬,而且爬得很凶,这确实是“大工程”,但大厂干得动。
一、当前主流的三种取数模式
1. 借用现成索引(你猜的模式)
早期和不少产品直接调用 Bing API——微软把搜索索引当商品卖,DuckDuckGo 也是这么起家的;
这个模式的好处是省掉了爬虫、存储、索引这整套基础设施(这确实是天文数字级别的工程);
坏处是受制于人: Bing 的索引质量、覆盖率、API 政策都攥在微软手里。
2. 自己爬(头部玩家正在做的事)
这恰恰是过去两年最大的变化——大厂发现租索引不划算,开始自建:
OpenAI:GPTBot、OAI-SearchBot 等爬虫,2024年起与 News Corp、美联社等签内容授权协议,SearchGPT 走的就是自有索引+授权混合路线;
Perplexity:从依赖 Bing 转向自建索引,同时因爬虫无视 robots.txt 引发过 Forbes、WIRED 等媒体的公开抗议;
Google:本来就是全球最大爬虫拥有者,AI Overviews 直接长在自家索引上,最省事;
腾讯、百度:搜狗/百度的存量索引直接喂给元宝、文心一言的搜索增强。
3. 授权合作(第三条路)
直接和出版商签协议拿内容:OpenAI-News Corp(据报道超2.5亿美元)、Perplexity-时代周刊、新闻集团等。这解决爬取的法律风险,但覆盖面窄,只覆盖愿意签约的站。
二、所以真实的架构通常是“三明治”
用户提问
   ↓
检索层:自有爬虫索引 + Bing API 兜底 + 授权内容库
   ↓
重排层:把候选页面按语义相关性重新排序
   ↓
生成层:LLM 读入选中的片段,合成答案+附引用
关键点:引用列表是生成时才决定的——即使底层索引来自 Bing,最终“引用谁、怎么排列”仍是 AI 侧的语义逻辑。这就解释了为什么同一批底层来源,AI 的引用分布和 Google 的排名差异那么大。
三、一个有意思的推论
正因为爬取+授权的成本极高,这个领域正在形成新的护城河逻辑:
有自己索引的(Google、百度)几乎零边际成本;
烧钱自建索引的(OpenAI、Perplexity)把爬虫当战略资产;
没有索引的中小 AI 搜索产品,永远付着“ Bing 税”或“Google 税”。
这也部分回答了你前面那个问题——为什么 AI 搜索会引用一堆 Google 上排名很低的小站?因为不同玩家的索引覆盖范围和抓取策略本来就不同,没有一个统一的“索引世界”,只有各自爬出来的、形状不一的数据池。
您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

手机版|ASI111-AI AGI ASI社区 |网站地图

GMT+8, 2026-8-25 21:37 , Processed in 0.062193 second(s), 22 queries .

Powered by Discuz! X3.5

© 2001-2026 Discuz! Team.

快速回复 返回顶部 返回列表