文 |姑苏九歌
编辑 |姑苏九歌
前几天刷到TheInformation的报道,说OpenAI、谷歌这些大公司的研究人员最近有点头疼。
他们发现自己搞出来的AI大模型,居然得了“精神分裂”似的毛病,同一个数学题,换种问法,答案能差出十万八千里。
这事儿听着玄乎,但仔细想想,咱们平时用AI的时候可能早就遇到过类似情况,只是没往深了想。
我选了“AI大模型也闹‘精神分裂’?换个问法答案就翻车,行业巨头都头疼的技术死结”这个标题,因为它直接点出了问题核心,也符合咱们聊天的调调。
接下来咱们就好好唠唠,这“分裂大脑”到底是个啥,为啥连巨头们都搞不定。
AI也会“看人下菜碟”?
先说说这“分裂大脑”到底咋表现的,有研究人员做过测试,问大模型“请用数学证明的格式解答,23乘以47等于多少”,模型唰唰给出正确答案1081,步骤还挺规范。
可换个问法,“老铁,23乘47得多少,帮忙算下呗”,同一个模型居然算出个892,差了快200。
这还不算完,标点符号变了结果也可能跑偏,比如把问号换成句号,或者加个感叹号,答案都可能跟着“放飞自我”。
你可能会说,这不就是模型马虎了吗?但问题没这么简单。
有团队专门测试了不同领域,从数学题到编程代码,再到法律条文解释,发现只要提问方式稍微“出格”,比如用口语化表达、加个表情符号,甚至换种标点,模型给出的答案质量就可能断崖式下跌。
最夸张的一次,问同一个法律问题,用正式法律术语问,模型引用法条准确,用大白话问,它居然编造了一条根本不存在的法律条文。
这种“看人下菜碟”的毛病,在学术圈有个说法叫“场景化判断偏差”。
意思就是模型做题的时候,不是真的理解了问题,而是先判断“这题啥风格”,再从训练过的内容里“套模板”。
就像咱们上学时遇到没见过的题型,有的同学会瞎蒙,模型现在就有点这意思,只不过它蒙的依据是“问题看起来像哪类训练数据”。
模型为啥会“精神分裂”?
那为啥模型会变成这样?说到底,还是训练后期埋下的雷。
现在的大模型训练分两阶段,前期用海量数据“喂饱”,后期用精选数据“拔高”。
这精选数据往往是专家写的规范文本,比如数学证明、学术论文、法律条文。
模型学多了这些,就慢慢形成了条件反射,“只要问题长得像专家写的,我就认真答,要是看着像随便聊的,随便给个答案就行。”
本来想靠精选数据让模型更“聪明”,结果跑偏了。
模型没学会真正理解问题,反而学会了“投机取巧”。
就像有些学生刷题只记题型不理解知识点,换个马甲就认不出来。
专家管这叫“伪理解”,看着啥都懂,其实是“知其然不知其所以然”。
这种毛病对行业影响可不小,现在不少公司指望AI自动化处理工作,比如客服回答问题、医生辅助诊断、程序员写代码。
可要是AI连问题都“看心情”回答,谁敢用?
之前有医疗AI测试,医生用“患者主诉胸痛3小时”提问,模型准确推荐检查,换个护士说“这人胸口疼得厉害,快看看”,模型居然让先做无关的CT。
这要是真用到临床上,后果不堪设想。
巨头们也不是没尝试解决,最常见的办法就是“打地鼠”,发现哪个问法会出错,就专门用这类数据训练。
但你猜怎么着?刚修好数学口语题,编程题又出问题,刚搞定法律大白话,历史问题答案又开始胡编。
就像打地鼠游戏,按下这个那个又冒出来,永远没个头。
有工程师吐槽,现在修复bug的速度,都赶不上新bug出现的速度。
另一个办法更烧钱,雇专家生成数据。
听说微软、谷歌这些公司,光在数学、法律、编程领域请专家写训练数据,一年就花几十亿。
短期看确实有用,特定领域的错误少了,但长期呢?模型越来越依赖“专家风格”的数据,遇到非专家风格的问题,偏差可能更严重。
这就像给偏食的孩子天天喂山珍海味,他可能更不爱吃家常菜了。
那到底有没有根治的办法?现在行业里有两种思路。
一种是改进训练方法,别让后期精选数据“带偏”模型,比如把规范数据和口语数据混着喂,让模型学会“不管啥风格,先理解问题本身”。
另一种更前沿,研究“鲁棒性智能”,就是让模型真正形成对世界的认知,而不是死记硬背。
比如教模型“2+2=4”的时候,不光告诉它答案,还告诉它“为啥等于4”“在什么情况下都等于4”。
但说起来容易做起来难,人类小孩理解“2+2=4”都要花时间,何况模型?有专家悲观地说,现在的大模型本质上还是“高级autocomplete”,离真正的智能还差得远。
几百亿砸进去,可能只是让它“装聪明”的本事更强了,没解决根本问题。
其实这事儿也给咱们提了个醒,AI发展太快,有时候快到咱们都忘了问一句“它真的懂了吗”。
现在的“分裂大脑”问题,可能就是技术狂奔路上必然遇到的坎。
巨头们头疼归头疼,但能发现问题总是好事,总比等大规模应用出了岔子再补救强。
至于未来会咋样,没人敢打包票。
但可以肯定的是,AI要想真正靠谱,光堆参数、砸钱不行,还得在“理解”和“泛化”上下功夫。
这可能需要行业换个思路,别老想着“训练出超级大脑”,先让模型把“基础认知”搞明白。
连同一个问题都答不明白,再强的“超能力”也没用不是?
说到底,技术发展哪有一帆风顺的。
AI大模型闹“精神分裂”,虽然让巨头们头疼,但也让咱们看清了现在AI的真实水平。
或许这不是坏事,至少能让行业冷静下来,想想接下来该往哪走。
咱们普通人呢,以后用AI的时候也多个心眼,别全信,多核实,毕竟模型现在还可能“看心情”给答案呢。