上世纪90年代中期,互联网正在爆炸式增长,但要在其中找到真正有价值的内容,却像是在和各种原始搜索引擎进行一场繁琐的谈判。与如今谷歌一统天下的格局不同,那时AltaVista、Lycos、Excite、HotBot、Ask Jeeves等网站各自承诺能驯服这片混沌,每一个都有着独特的个性、魅力与缺陷。
谷歌前时代搜索引擎的真实故事,并不在于早期引擎有多落后,而在于它们折射出一个截然不同的互联网——目录导航举足轻重,网络爬虫仍是一门艺术,排名机制脆弱易变,"搜索"这个概念尚未固化为某种单一的主导界面。
谷歌前互联网的第一个特点,是没有人理所当然地认为你可以搜索到一切。许多用户通过雅虎式的分类目录、书签、新闻组、邮件签名以及网站间的链接来发现页面——因为当时的网络规模还小,人工整理完全可以与机器索引一较高下。那是一个"狂野西部"式的内容发现时代。搜索引擎虽然存在,但只是融合了人工筛选与偶然发现的更大生态系统中的一部分。
在这些引擎成为公众访问网络的主要入口之前,Usenet等资源已经在教人们如何在网上组织和发现信息。Usenet诞生于1979年,提供基于话题的新闻组,以及一种分布式讨论的文化,让网络信息在第一批主流网络引擎出现之前就已具备社交与社群的属性。Usenet帮助人们养成了一种习惯:通过分类和社群而非单一搜索框,在庞杂的数字空间中穿行。
Nicole M. Radziwill在90年代曾担任系统管理员、程序员和项目经理等职务。她记得Usenet是挖掘网络有趣内容的门户。"那是发现感兴趣网站的途径,"她说,"我1990年在北卡罗来纳州达勒姆读书时就上了Usenet……非常有意思,尤其是alt.*和misc.*组。人们会在帖子末尾附上链接,知名度就这样自然而然地传播开来。如果你想要更安全可靠的推荐,还可以只看经过审核的小组。"
那是一个"发现"二字真正有分量的年代——你可能真的是第一批看到某篇内容的人,不论其质量高低,也不论它存在多久。那是一个惊喜与挫败并存的时代。
"再过几年,网络环就出现了,"Radziwill说,"你拿到一段代码,放在网站HTML页面底部,它就会嵌入一个指向相关网站的链接。有人负责管理这个列表,决定下一个链接到哪里,这是提升曝光度的好方法。管理网络环列表的人普遍比较靠谱,我们根本没想过会有人搞破坏。"
网络环是谷歌前时代的另一个遗迹,让人想起那个微型社群蓬勃兴起的年代——就像BBS时代一样,由一群有着共同小众兴趣的人聚集而成,有时甚至在现实中也是邻居。在Reddit这类庞大聚合平台出现之前,网络环是为数不多的几种找到特定主题网站的方式之一。
这一点之所以重要,是因为当时的网络还不是一台纯粹的检索机器,它仍然保有一种探索的文化,许多服务的设计初衷是帮助用户浏览话题分类,而非向一个通用索引发出查询。在那个世界里,网络环或目录不是妥协之举,往往才是主角。
"1995年和1996年,我是一家'电商'的系统管理员,"Radziwill告诉我,"每当我们为新客户建好网站,流程中最高光的时刻就是把网站提交给雅虎。雅虎就像黄页,只不过收录的是网站。你要填一张表,向雅虎的真人工作人员证明你提交的这家企业足够正规、足够重要,才能进入雅虎的主目录。"
这种人工筛选的方式,在今天几乎难以想象。
"我记得有一次提交美国癌症协会某地区分支机构的网站,结果被拒了,理由是'不够重要',"Radziwill说,"他们建议我们联系ACS总部,让总部在他们的页面上链接这个网站……而那时总部自己的页面还没建好。"
那个年代,能被雅虎的人工审核员收录进目录,是一种莫大的荣誉。但这种模式有其明显的局限。人工筛选无法无限扩展,随着网络膨胀、内容产出速度超过人工整理速度,它变得越来越昂贵,也越来越滞后。一旦页面数量超过了人们合理分类的能力,未来就属于爬虫和排名系统了。
那个时代的搜索引擎用软件来应对规模问题。AltaVista、Lycos、Excite、HotBot等最早的大型商业系统,大多使用爬虫和索引来自动绘制不断扩张的网络地图,而非依赖编辑逐一手工分类。这些引擎的工作方式各有不同,但共同的雄心是:尽可能多地抓取网络内容,让算法来整理这片混乱。
这在今天听来理所当然,但在当时却是一次飞跃。AltaVista尤其代表了一大步——它将快速爬虫与可扩展的索引软件相结合,上线后不久每天就能处理数百万次HTTP请求。它让搜索不再像翻阅目录,更像是在查询一台巨型机器。
AltaVista成为1990年代最具代表性的搜索引擎之一,因为它速度快、覆盖广,在当时能力超群。后来的版本支持自然语言式搜索,让用户感觉整个网络终于可以作为一个可索引的整体来对待,尽管结果仍然粗糙。在那个许多人还在摸索网络是什么、感叹其浩瀚无边的年代,这近乎奇迹。但与今天谷歌这样高度进化的引擎相比,它仍然是一个非常有限的工具。
IT支持公司Classroom365 Limited的总监Mark Friend,在90年代末曾担任系统操作员。他记得在谷歌出现之前,搜索网络既是一项技术活,也是一门艺术。
"大多数人已经完全忘记当时有多混乱了,"Friend说,"那时候,如果你在AltaVista里输入一个问题,想找到具体的东西,胜算很小。你会得到4万条结果,就像对着一屋子人大喊,出来的还是一片嘈杂。"
与谷歌曾经友好的界面和更相关的结果相比,翻阅AltaVista的结果页面需要耐心和真正的技巧,而这种技巧是随着时间磨练出来的。但AltaVista确实做到了一件重要的事:它树立了一个预期——搜索应该是即时的。这个预期意义深远。一旦用户体验过能快速扫描庞大索引的搜索引擎,他们就不再接受迟缓、残缺的系统。AltaVista没有赢得搜索大战,但它厘清了游戏规则。
Lycos和Excite占据着一个重要的中间地带。它们是搜索品牌,但也是门户网站,致力于成为目的地而非单纯的工具。搜索功能与新闻、邮件、体育、天气、财经等内容并列呈现,目的是把用户留在网站上,而不是让他们跳转到结果页面。
这些公司展示了这一品类有多么不稳定。有些引擎强调广度,有些强调速度,有些则将编辑频道与自动结果混合在一起,这种方式在今天看来颇为陌生。"搜索引擎"这个标签涵盖了五花八门的产品:从目录服务、爬虫,到把搜索作为附加功能的门户网站。
HotBot赢得了作为那个时代技术上较为严肃的搜索引擎之一的声誉。它出现的时候,用户已经开始意识到搜索质量既取决于索引的规模,也取决于背后排名系统的精密程度——其可扩展的后端由Inktomi提供。仅仅爬取速度快是不够的,人们想要的是相关、及时、不被明显操纵的结果。
这种张力暴露了早期机器搜索的一个弱点。如果系统过于依赖页面上的文本信号,人们就会在内容里堆砌关键词来人为提升排名。如果引擎主要依赖容易被操纵的页面信号,营销就能凌驾于质量之上。早期网络很快成了操纵手段的试验场,尽管那时还没有人用现代意义上的"搜索引擎优化"(SEO)这个词。
Ask Jeeves的与众不同在于,它试图让搜索变得像对话一样自然——这个想法在AI聊天机器人时代看来格外有先见之明,尽管Ask Jeeves显然无法提供任何接近今天基于大语言模型的对话界面。Mark Friend说,Ask Jeeves让人感觉真的来自未来,因为它不要求用户用关键词思考,而是邀请用户用自然语言提问,给人一种网络由一位博学助手打理的印象。
问题在于,自然语言很难处理。用户的提问并不总是清晰规范,而底层系统还不足以在大规模场景下可靠地推断用户意图。Ask Jeeves令人难忘,恰恰是因为在缺乏深度学习和大语言模型支撑的情况下,它声称能比当时的技术所能支撑的更好地理解用户体验。
谷歌前的网络,也是一个SEO尚未工业化的环境。网站主会尝试提升曝光度,但现代搜索优化还没有演变成后来那种庞大的专业化行业——没有整个部门的"专家"追逐谷歌飘忽不定的信号、试图预测它下一次神秘的算法调整。早期引擎相对容易通过关键词重复、元数据和提交技巧等明显手段来影响。
"那时候没人谈排名,"Friend回忆道,"大家提交自己的URL,然后耐心等待,看它会不会出现在搜索结果里。每个人都认真对待Meta关键词标签,'白底白字'——用白色文字在白色背景上隐藏关键词——是站长们用来向搜索引擎爬虫塞入关键词的正当手段。没有被惩罚的顾虑,你建好网站,祈祷好运,静待结果。"
"大多数人不愿面对的残酷真相是,抓取和排名把互联网变成了一座内容制造工厂,"Friend说,"网站从为人而写,变成了主要为搜索引擎爬虫而写。"
谷歌的关键贡献不在于发明了搜索,而在于改变了排名的逻辑。PageRank将链接视为权威性的信号,这使得相关性在一定程度上取决于网络本身如何指向一个页面。这是一次重大转变,因为它让结果看起来更值得信赖,也让简单的操纵变得更难——尽管显然并非不可能。
同样重要的是,谷歌将这种排名方式与简洁的界面和不喧宾夺主的结果页面相结合。干净的设计之所以重要,是因为它强化了一种感觉:搜索应该是一种实用工具,而不是门户游乐场。在实践中,谷歌让搜索框感觉像是整个网络的前门,就像前门对于一个家的那种本质性的、不可或缺的重要性。
回望过去,谷歌前的时代更慢、更乱,在许多方面效率更低。但它也有更多关于如何发现、分类和评判信息的竞争性想法,以及一种暗示着无限可能的无法无天的氛围。有些系统信任人,有些信任爬虫,有些信任目录,有些信任用普通英语提出的问题。
"互联网本身就带着一种杂乱与混沌,"Friend回忆道,"但与此同时,那时的它更有人情味。这就是为什么我们许多人会怀念那个时代。互联网有一种手工艺品的感觉,是真实的人用Notepad、Dreamweaver这样的文本编辑器做出来的。你可能从一个目的地出发,最后跑到某支冷门乐队的粉丝网站,然后又到了一个讨论复古合成器的论坛,最终落脚在NASA的页面上。"
这种多样性值得铭记,因为它说明搜索从来就不是注定要变成今天这个样子的。谷歌前的那些引擎不只是失败的先驱,它们是认真尝试解决一个网络使之迫切却尚无明显解法的问题。谷歌的胜利,在于它在互联网其余部分准备好抛弃旧秩序的恰当时机,将技术排名、可用性与规模三者完美结合。
Q&A
Q1:谷歌出现之前,人们是怎么在互联网上找到想要的内容的?
A:谷歌出现前,人们主要通过雅虎式的人工分类目录、Usenet新闻组、网络环、书签和网站间的链接来发现内容。AltaVista、Lycos、Excite等搜索引擎虽然存在,但只是更大生态系统的一部分,人工筛选与机器索引并行共存。
Q2:AltaVista当年为什么那么重要?
A:AltaVista是1990年代最具代表性的搜索引擎之一,它将快速爬虫与可扩展索引相结合,上线后不久每天就能处理数百万次请求。它让搜索感觉像是在查询一台巨型机器,并树立了"搜索应该即时响应"的用户预期,从而为整个行业厘清了竞争规则。
Q3:谷歌和之前的搜索引擎相比,最核心的区别是什么?
A:谷歌最核心的创新是PageRank算法,它将链接视为权威性信号,让相关性取决于网络本身如何指向某个页面,而非仅靠页面内的关键词堆砌。这使结果更可信,操纵难度更大。加上极简的界面设计,谷歌让搜索框成为进入整个网络的"前门"。
下一篇:没有了