原创 同一问题两种答案,AI大模型“分裂大脑”真相,训练埋下的陷阱
创始人
2025-12-08 14:41:45
0

文 |姑苏九歌

编辑 |姑苏九歌

前几天刷到TheInformation的报道,说OpenAI、谷歌这些大公司的研究人员最近有点头疼。

他们发现自己搞出来的AI大模型,居然得了“精神分裂”似的毛病,同一个数学题,换种问法,答案能差出十万八千里。

这事儿听着玄乎,但仔细想想,咱们平时用AI的时候可能早就遇到过类似情况,只是没往深了想。

我选了“AI大模型也闹‘精神分裂’?换个问法答案就翻车,行业巨头都头疼的技术死结”这个标题,因为它直接点出了问题核心,也符合咱们聊天的调调。

接下来咱们就好好唠唠,这“分裂大脑”到底是个啥,为啥连巨头们都搞不定。

AI也会“看人下菜碟”?

先说说这“分裂大脑”到底咋表现的,有研究人员做过测试,问大模型“请用数学证明的格式解答,23乘以47等于多少”,模型唰唰给出正确答案1081,步骤还挺规范。

可换个问法,“老铁,23乘47得多少,帮忙算下呗”,同一个模型居然算出个892,差了快200。

这还不算完,标点符号变了结果也可能跑偏,比如把问号换成句号,或者加个感叹号,答案都可能跟着“放飞自我”。

你可能会说,这不就是模型马虎了吗?但问题没这么简单。

有团队专门测试了不同领域,从数学题到编程代码,再到法律条文解释,发现只要提问方式稍微“出格”,比如用口语化表达、加个表情符号,甚至换种标点,模型给出的答案质量就可能断崖式下跌。

最夸张的一次,问同一个法律问题,用正式法律术语问,模型引用法条准确,用大白话问,它居然编造了一条根本不存在的法律条文。

这种“看人下菜碟”的毛病,在学术圈有个说法叫“场景化判断偏差”。

意思就是模型做题的时候,不是真的理解了问题,而是先判断“这题啥风格”,再从训练过的内容里“套模板”。

就像咱们上学时遇到没见过的题型,有的同学会瞎蒙,模型现在就有点这意思,只不过它蒙的依据是“问题看起来像哪类训练数据”。

模型为啥会“精神分裂”?

那为啥模型会变成这样?说到底,还是训练后期埋下的雷。

现在的大模型训练分两阶段,前期用海量数据“喂饱”,后期用精选数据“拔高”。

这精选数据往往是专家写的规范文本,比如数学证明、学术论文、法律条文。

模型学多了这些,就慢慢形成了条件反射,“只要问题长得像专家写的,我就认真答,要是看着像随便聊的,随便给个答案就行。”

本来想靠精选数据让模型更“聪明”,结果跑偏了。

模型没学会真正理解问题,反而学会了“投机取巧”。

就像有些学生刷题只记题型不理解知识点,换个马甲就认不出来。

专家管这叫“伪理解”,看着啥都懂,其实是“知其然不知其所以然”。

这种毛病对行业影响可不小,现在不少公司指望AI自动化处理工作,比如客服回答问题、医生辅助诊断、程序员写代码。

可要是AI连问题都“看心情”回答,谁敢用?

之前有医疗AI测试,医生用“患者主诉胸痛3小时”提问,模型准确推荐检查,换个护士说“这人胸口疼得厉害,快看看”,模型居然让先做无关的CT。

这要是真用到临床上,后果不堪设想。

巨头们也不是没尝试解决,最常见的办法就是“打地鼠”,发现哪个问法会出错,就专门用这类数据训练。

但你猜怎么着?刚修好数学口语题,编程题又出问题,刚搞定法律大白话,历史问题答案又开始胡编。

就像打地鼠游戏,按下这个那个又冒出来,永远没个头。

有工程师吐槽,现在修复bug的速度,都赶不上新bug出现的速度。

另一个办法更烧钱,雇专家生成数据。

听说微软、谷歌这些公司,光在数学、法律、编程领域请专家写训练数据,一年就花几十亿。

短期看确实有用,特定领域的错误少了,但长期呢?模型越来越依赖“专家风格”的数据,遇到非专家风格的问题,偏差可能更严重。

这就像给偏食的孩子天天喂山珍海味,他可能更不爱吃家常菜了。

那到底有没有根治的办法?现在行业里有两种思路。

一种是改进训练方法,别让后期精选数据“带偏”模型,比如把规范数据和口语数据混着喂,让模型学会“不管啥风格,先理解问题本身”。

另一种更前沿,研究“鲁棒性智能”,就是让模型真正形成对世界的认知,而不是死记硬背。

比如教模型“2+2=4”的时候,不光告诉它答案,还告诉它“为啥等于4”“在什么情况下都等于4”。

但说起来容易做起来难,人类小孩理解“2+2=4”都要花时间,何况模型?有专家悲观地说,现在的大模型本质上还是“高级autocomplete”,离真正的智能还差得远。

几百亿砸进去,可能只是让它“装聪明”的本事更强了,没解决根本问题。

其实这事儿也给咱们提了个醒,AI发展太快,有时候快到咱们都忘了问一句“它真的懂了吗”。

现在的“分裂大脑”问题,可能就是技术狂奔路上必然遇到的坎。

巨头们头疼归头疼,但能发现问题总是好事,总比等大规模应用出了岔子再补救强。

至于未来会咋样,没人敢打包票。

但可以肯定的是,AI要想真正靠谱,光堆参数、砸钱不行,还得在“理解”和“泛化”上下功夫。

这可能需要行业换个思路,别老想着“训练出超级大脑”,先让模型把“基础认知”搞明白。

连同一个问题都答不明白,再强的“超能力”也没用不是?

说到底,技术发展哪有一帆风顺的。

AI大模型闹“精神分裂”,虽然让巨头们头疼,但也让咱们看清了现在AI的真实水平。

或许这不是坏事,至少能让行业冷静下来,想想接下来该往哪走。

咱们普通人呢,以后用AI的时候也多个心眼,别全信,多核实,毕竟模型现在还可能“看心情”给答案呢。

相关内容

热门资讯

原创 苹... 有不少朋友疑惑苹果iPhone 16 Pro和16 Pro Max有什么区别?该选择哪一款更好?各自...
2024年OPPO手机全攻略:... 手机已不仅仅是通讯工具,它更是我们记录生活、享受娱乐、提升工作效率的重要伙伴。随着科技的飞速发展,O...
2025年值得入手的2款智能手... 在科技飞速发展的今天,智能手表已成为我们生活中不可或缺的伙伴。无论是健康监测、信息提醒,还是时尚搭配...
原创 2... 从去年华为用上了麒麟芯片开始,华为的市场份额就蹭蹭的往上涨,当时抢购的人特别多,一时间还买不到现货,...
第五轮学科评估对比:西安交大突... 在之前的文章中,我们已经提及西安交通大学第五轮学科评估的表现可圈可点,新晋的3个A+学科:机械工程、...
vivo手机5g开关在哪里打开 vivo手机5G开关的打开方式可能因手机型号、系统版本及运营商网络支持情况的不同而有所差异。但总体来...
原创 麒... 为了普及原生鸿蒙(鸿蒙5.0),抢占更多的中端手机市场份额,华为nova系列今年开始计划一年两更,n...
解决FaceTime无法使用的... FaceTime是苹果公司推出的一款视频通话应用,广泛应用于iPhone、iPad和Mac等设备上。...
steam官网无法访问?这个办... 对于广大游戏爱好者而言,Steam平台无疑是获取最新游戏资讯、购买游戏、与全球玩家互动的重要阵地。然...
原创 直... #热点周际赛# 随着科技的进步,儿童智能穿戴设备逐渐成为了家庭中的新宠。华为作为智能穿戴领域的领军者...