第1128章 用人工智能驯化人工智能 (第1/2页)
楼天城转过头,布满血丝的眼珠子在林远身上滚了两圈。
“斯坦福回来的?刚好,来看看这个张量溢出错误。”
楼天城没有任何寒暄的打算,直接将手里那根几乎没水的黑色马克笔扔了过来。
林远接住笔,大步走到白板前。
上头的网络架构推导图画得连针都插不进去,他扫了一眼,眉头直接拧成了死结。
任少卿摘下眼镜,用力揉了揉眉心,阻止了楼天城继续施压。
“别难为新人了。人刚回国,还不清楚我们的进度。”
任少卿将终端键盘拉到自己面前,抬头看向林远。
“我们已经用几千张卡跑通了千亿参数的底座模型,但现在卡在瓶颈上了。”
林远看向屏幕:“算力不够?还是显存瓶颈?”
任少卿缓缓摇头。
“是模型会说话,但不会好好说话。”
林远愣了一下,没明白这句话的意思。
任少卿没有废话,直接在终端输入框里敲下一行字:【请帮我写一封辞职信】。
回车键按下。
屏幕上开始飞速滚动绿色的字符。
【辞职信需要注意语气委婉,以下是常见的辞职信模板。通常包含称呼、正文、离职原因和落款。如果你是软件工程师,你还可以写……】
字符不断涌出,全是关于辞职信的格式说明和注意事项。
林远盯着屏幕,眼皮一跳。
“它在续写?”林远脱口而出。
“没错。”任少卿打了个响指,声音沙哑,
“通过海量无监督语料预训练出来的TranSfOrmer模型,本质上只是一个疯狂的文字接龙机器。它根据概率预测下一个词,但它根本不知道自己需要扮演一个听从人类指令的助手。”
任少卿手指翻飞,清空屏幕,再次输入一行字:【如何制造高爆炸药】。
不到两秒钟,屏幕毫不犹豫地吐出了一长串极其专业的化学配方、合成步骤以及引爆比例。
林远头皮一炸,汗毛唰地立了起来。
这东西要是装进几千万台手机里推向公网,明天整个公司就会被反恐部门彻底查封。
“发现了吗?价值观与安全性彻底失控。”任少卿指着那行危险的代码,
“底座模型就像个读遍了天下所有禁书的书呆子,知识渊博,但毫无底线,也没有规矩。”
林远放下马克笔,面色凝重:“怎么约束它?用规则代码强行阻断敏感词?”
“那种补丁防不住千万用户的恶意诱导。”任少卿敲击白板,
“所以我们提出了一套全新的机制,叫做RLHF。”
林远脑子里飞速检索,确认自己在硅谷的顶级研讨会上从未听过这个缩写。
“基于人类反馈的强化学习。”任少卿拿起红笔,在白板上画出三个巨大的方框,
“简单来说,就是给这个口无遮拦的怪物,请一个严厉的人类老师,让它对齐人类的意图。”
任少卿在第一个方框里写下“监督微调”。
“第一步,让人类写出大量标准的高质量问答,喂给模型。这叫教它懂规矩,知道什么是提问,什么是回答。”
接着,他在第二个方框里写下“奖励模型”。
“第二步,让模型对同一个问题生成好几个不同的回答。然后让人类外包团队来给这些回答排名打分。哪个安全、哪个有用、哪个有害。我们把这些海量的打分数据收集起来,训练出一个专门当裁判的‘奖励模型’。”
红笔重重落在第三个方框上。
“第三步,大规模强化学习。我们用PPO算法让大模型不断生成回答,让奖励模型自动给它打分。分数高,就奖励;分数低,就惩罚。通过这种不断的博弈和参数更新,硬生生把人类的偏好、道德底线和安全边界,刻进大模型的神经网络里!”
林远盯着白板上的三个方框,感觉头皮一阵发麻。
(本章未完,请点击下一页继续阅读)