第1129章 人工智能大时代开场 (第2/2页)
顾屿手中的笔尖顺着公式滑动:
“如果生成的回答偏离初始模型太远,偏差过大,就直接在最终奖励里进行大幅度扣分惩罚。逼着它既要回答人类想听的,又绝对不能偏离原本正常的语言逻辑规律。”
顾屿停下笔,目光扫过实验室里的众人:
“在信息论和概率统计里,衡量两个概率分布之间差异的这把标尺,全称叫做KUllbaCk-LeiblerdivergenCe,也就是库尔贝克-莱布勒散度。”
顾屿手臂发力,笔尖重重地在公式尾端写下两个大写字母。
“给它加入KL散度惩罚项。”顾屿敲击着白板,
“这样就能彻底锁死奖励黑客的漏洞。”
任少卿推了一下眼镜,盯着那个加上了KL惩罚项的方程。
楼天城从椅子上直接蹦了起来。
“对啊!拉住它的缰绳!”
“不仅要奖励它的讨好,还要惩罚它的过度变化。数学逻辑完全闭环,工程上绝对可行!”
林远站在后方,大脑飞速运转,他完全听懂了顾屿提出的这个概念。
极其精妙。只需在现有代码架构里增加不到两百行的损失函数计算模块,就能彻底解决困扰顶级团队半个月的逻辑死局。
“那灾难性遗忘呢?”任少卿急切追问。
“更好解决。”顾屿将白板翻了个面,画出两个数据池交汇的草图,
“你们现在做PPO强化学习,是不是只用经过标注的问答数据在跑?”
任少卿点头。
“格局小了。”顾屿毫不留情地点评,
“不要只用微调数据去更新梯度。在强化学习的训练池里,按固定比例,直接混入初始的无监督预训练语料。”
他在交汇点画了一个大大的感叹号。
“让模型在应对考试打分的时候,既要看它懂不懂规矩,也要同时考它之前学过的基础知识。为了拿到综合高分,它就必须一边学着变乖,一边不断复习原本的本领。再配合稍微放缓一点的学习节奏,它那种学了新规矩就忘掉老知识的毛病,就能压制在百分之一以内。”
A1核心区安静下来。
任少卿一把拽过终端键盘,十指在按键上砸得劈啪作响,直接在测试环境里疯狂重构代码逻辑,试图推演顾屿这两个方案的数学极值。
五分钟后,任少卿停下手,长长地吐出一口浊气。
“顾总。”任少卿抬起头,
“这两套补丁方案完美契合现有的底层架构,不仅解决了问题,还把训练效率最少提升了百分之三十!”
林远静静站在原地,心跳如擂鼓。
他终于明白为什么眼前这群心高气傲的天才,会对一个还没大学毕业的年轻人如此敬畏。
这根本不是什么商业老板视察工作,这是一场跨越维度的技术布道!
“马上组织所有人手改写算法框架!”楼天城拍了拍手,冲着整个实验室大声下达指令。
“一组去写KL散度惩罚项的代码嵌进PPO!二组去调初始无监督预训练语料,和微调数据做混合!三组完成分布式训练。三天内,我要看到新版本模型重新跑在GPU集群上!”
整个实验室因为顾屿的三言两语,彻底扫空了之前的颓废与暴躁,如同加注了顶级燃料的超级引擎,全速轰鸣。
顾屿重新端起那杯微凉的美式咖啡,喝了一口。
“你们放心改。”顾屿看着大屏幕上重新规划的训练任务节点,
“这个暑假我哪儿也不去,每天就在雅安基地陪你们死磕。”
“争取用最快的时间,把天问三号的完全体训练出来。”
“等到天问三号正式对外发布那天。我要让硅谷那帮巨头看清楚,什么才是真正的人工智能大时代。”