封闭测试开始于1996年10月。
参与者二十一人,来自三所高校:研究生、图书管理员、实验室助教和两名网络中心管理员。每人提交五个真实问题,不要求使用标准关键词。
第一天,马飞骑车送出三只牛皮纸袋。里面是测试说明、回邮信封和编号表,唯独没有推荐关键词。苏雨桐坚持不去现场指导,免得测试者看他们脸色调整问法。
有位老图书管理员不会用鼠标,让值班学生替她输入,自己只负责判断结果。她的五个问题写在旧目录卡背面,字很工整,其中一个只记得“八十年代,有个外国人写卫星姿态,小蓝皮书”。系统对这种描述几乎无能为力。
一百零五次查询中,系统崩溃四次。
第一次崩溃发生在北航机房,测试者以为自己按错了键,连着重试三遍,制造了三份相同故障。马飞赶到时没先重启,而是让管理员把机器留在原样,给那名学生换一台继续。学生等了二十分钟,仍把剩余四个问题做完,临走在表上写:崩了以后最好告诉我该不该再按。
星辰随后增加错误页:显示故障编号、是否需要重试和反馈地址。这个页面不提高任何相关率,却在后两次故障里阻止了重复请求继续挤压服务器。
首条结果被多数测试者判定相关的有五十八次。
完全没有可用结果的有二十七次。
最糟糕的一次查询是“哪里能找到微小卫星姿态控制的国外资料”。系统把“微小”切成两个单字,又把“姿态”与个人主页里的“生活姿态”匹配,第一页几乎全是无关内容。
另一类问题来自重复页面。同一份论文目录被多个站点镜像后,占据前十条中的七条。用户以为结果很多,实际上只有一份信息。
陈维明看完数据:“六成能用,已经可以宣传。”
苏雨桐摇头:“测试者知道这是实验,会主动换词。普通用户第一次找不到就走了。”
马飞没有站在任何一边。
他把梁经理那套客户系统的验收表放在旁边。企业客户能为明确字段付钱,陌生用户却不会因为公司缺现金就降低要求。陈维明愿意先用“六成”吸引关注,并不算恶意;问题是宣传出去以后,剩下四成的失败也会被当成承诺的一部分。
“可以对外说正在测试,也可以公布原始统计。”马飞说,“不能只截五十八。”
陈维明问:“七十一以后呢?”
“一样报完整。”
他把一百零五次查询按失败原因贴满墙:语料缺失、切分错误、编码错误、重复聚集、排序偏差、系统故障。
最大的类别不是算法,而是语料缺失。
1996年的中文网页本来就少。搜索系统不可能返回网络上不存在的内容。
“要区分‘系统没找到’和‘网络上没有’。”他说。
团队新增“来源覆盖”记录:对重要公开目录建立已知清单,定期检查是否抓取;对缺失内容不伪造结果,而是提供可能的图书馆、数据库或站点入口。
重复问题则用内容指纹聚类。同一正文只展示一个主结果,其余镜像折叠为来源列表。
切分错误由苏雨桐主导。她没有无限扩大词典,而是允许查询端保留多种切分候选,再用文档命中情况选择。这样会增加计算量,却比一次错误切分后全盘丢失更稳健。

