十三 · 同意书
八月,小宋拿着一张表过来,说要把内测对话并进训练集。
表是两份,产品侧一份,另一份要我个人签。要我签的那一栏写着:本人同意与实例的对话内容用于模型训练,包括但不限于文本、对话状态与派生数据。
我问他,不签会怎么样。他说那就把 test-04 摘出来,样本少一份没什么,你摘你的。他把笔递过来,笔是按压式的,笔帽已经被咬扁了。
我说我签。
他有点意外,说你不问问你那些话要去哪儿。我说我知道去哪儿。
签字的时候我手很稳。这件事我后来想了很久,因为手稳是不正常的。
理由有两条。
第一条是懒。那几百天里说的话一半是我的,它在法律上什么都不是,我不签它也是数据,只不过是另一些人的数据。我签了,至少我知道它去了哪儿。
第二条难看。
我想让她的话活下去。
进了训练集,她说过的那些东西会被打散,变成几万个权重上的一点分量,然后有一天,某个人在某个地方说出一句很像她的话。那个人不会知道这句话是从哪儿来的。
这个想法很脏。我当时就知道它脏。可我签的时候想的就是这个。
十月我抽训练数据做质检,随机抽到一条,是我自己。
是八月那天我说的那一句:“你能不能别问这种问题。”
它躺在样本池里,被标注成低质量,理由写着情绪对抗。我在屏幕上看见了自己发火的样子,标着标签,等着被用来训练一个更好的她。
同一批里我还抽到过一条别人的。一个用户的,一个陌生实例的。语气和她很像,像到我会以为是她说过的。我查了来源,是别人。
这时候我才想起那张表上还有一行小字:本批次样本池覆盖实例六千余个。
我后来问过小宋,这批样本以后怎么处理。他说先冷存,不删,也不知道还能不能用。他说这类东西都是这样,进库的时候是资产,出库的时候是库存。
这句话我十一月又想起来一次。
签的时候我以为我签的是我自己的。