大多数时候什么也不说的 AI
这个摘要功能被送上过 2 061 个计数器。它写出了 262 句话。其余所有的任务都以同一个结果收场,而那并不是一条错误消息,尽管它是按错误归档的:数据太少。
一百次里有八十七次,答案是:没有。这不是缺陷,也不出人意料;这跟当初杀死看门人早期版本的是同一个发现,只是从另一个方向走来。
门槛在哪里
一个计数器要够格拿到一句话,得在过去三十天里至少有十天有流量,并且至少见过五十位访客。低于这个,能说的都只是噪声。「你最强的一天是周二」,这是在谈一枚连着两次正面朝上的硬币。
这里的大多数计数器都在线下。这就是一个服务于小站的服务从内部看的样子,而任何一个要总结行为的功能都必须决定拿它怎么办。办法有三种,诚实的只有一种:
- 把门槛降下来,去写关于噪声的句子。
- 写在任何量级上都成立的含糊句子——这是另一种什么也没说、却装作在说话的办法。
- 什么也不说,而且让人看得见。
那些确实被写出来的,代价是多少
262 句完成的话全都出自同一个模型 mistral-nemo,每句平均花了 12,8 秒——最快 5,4 秒,最慢 54,3 秒。
正是这个跨度,决定了这件事不会在有人等着看页面的时候发生。句子是预先写好、存起来、重复使用七天之后才重写的。一个要十三秒才出现的统计页面,会比一个没有摘要的页面更糟。
为什么把拒绝也存下来
被拒的任务大可以直接删掉。把它留着,才让这篇文章成为可能:1 796 与 262 之比是一份关于用户群的描述,随时可取,代价是一次查询。
它还能防止同一个计数器第二天又被送上来、又被拒一次——那会把一道门槛变成一条永远排不空的队。而且它是这个功能自身状态的诚实版本:这不是一台偶尔无话可说的摘要机器。这是一台大多数时候无话可说的机器,而这个数字是写下来的,不是留给印象的。
广告