推理能力翻倍,Google这次不是在凑数
创始人
2026-02-21 18:01:29
0

《推理能力翻倍,Google这次不是在凑数》

——当得分从31.1%跳到77.1%,这已不是升级,而是换脑

AI发布会听多了,大家早就免疫了。 但这次的数据,让人不自觉坐直。

在第三方逻辑基准上,Gemini 3.1 Pro拿到77.1%,上一代只有31.1%。横向看,Claude Opus 4.6约68.8%,GPT-5.2约52.9%。这不是“领先一点”,而是直接冲到第一梯队。问题来了:它到底做对了什么。

关键不在分数,而在机制。 过去模型更像“背题家”,靠海量语料匹配答案;这次跃迁出现在“未见题”测试——也就是刻意屏蔽训练数据后的逻辑难题。换句话说,它不只是记住套路,而是形成了可迁移的推理骨架。长链思考被拆解成分段验证,像工程师在草稿纸上逐步排错,而不是一次性豪赌输出。这叫泛化,而不是刷题。

我见过一个场景:凌晨两点,开发者把一段复杂函数丢进去,本来准备自己熬夜重写,结果模型先给出思路分解,再附上改进版本。那一刻,他犹豫的不是“好不好用”,而是“要不要全面迁移”。

更“杀人诛心”的是——价格没涨。 性能翻倍,定价持平。这相当于高配处理器按旧款卖。对开发者来说,性价比就是投票权。生态迁移,从来不靠口号,靠算账。

很多人还在比参数规模,但趋势已经很清晰:AI竞争正在从“谁更大”转向“谁更会想”。

可带走的判断只有一句:推理能力,正在成为大模型时代真正的硬通货。

(唐加文,笔名金观平;本文成稿后,经AI审阅校对)

相关内容

热门资讯

原创 苹... 有不少朋友疑惑苹果iPhone 16 Pro和16 Pro Max有什么区别?该选择哪一款更好?各自...
2024年OPPO手机全攻略:... 手机已不仅仅是通讯工具,它更是我们记录生活、享受娱乐、提升工作效率的重要伙伴。随着科技的飞速发展,O...
2025年值得入手的2款智能手... 在科技飞速发展的今天,智能手表已成为我们生活中不可或缺的伙伴。无论是健康监测、信息提醒,还是时尚搭配...
原创 2... 从去年华为用上了麒麟芯片开始,华为的市场份额就蹭蹭的往上涨,当时抢购的人特别多,一时间还买不到现货,...
第五轮学科评估对比:西安交大突... 在之前的文章中,我们已经提及西安交通大学第五轮学科评估的表现可圈可点,新晋的3个A+学科:机械工程、...
vivo手机5g开关在哪里打开 vivo手机5G开关的打开方式可能因手机型号、系统版本及运营商网络支持情况的不同而有所差异。但总体来...
解决FaceTime无法使用的... FaceTime是苹果公司推出的一款视频通话应用,广泛应用于iPhone、iPad和Mac等设备上。...
原创 麒... 为了普及原生鸿蒙(鸿蒙5.0),抢占更多的中端手机市场份额,华为nova系列今年开始计划一年两更,n...
steam官网无法访问?这个办... 对于广大游戏爱好者而言,Steam平台无疑是获取最新游戏资讯、购买游戏、与全球玩家互动的重要阵地。然...
原创 直... #热点周际赛# 随着科技的进步,儿童智能穿戴设备逐渐成为了家庭中的新宠。华为作为智能穿戴领域的领军者...