谷歌Gemini 4 Pro首测登顶Arena 多项基准全面SOTA

2026-09-21 00:40:34    来源:新经网    作者:冯思韵
很多朋友不知道【谷歌Gemini 4 Pro首测登顶Arena 多项基准全面SOTA】,今天小绿就为大家解答一下。

  在考察Agent连续多步执行能力的Terminal-Bench 4.0中,它与自家Flash的差距从上代的3.2%拉大到13.9%,显示任务越复杂、步骤越多,其优势越明显。价格方面,该模型每百万Token输入2.25美元、输出11.25美元,在顶级旗舰中颇具竞争力。

  真正引发震动的是流出的基准测试数据。在这份对比中,Gemini 4 Pro在多项测试里取得全面SOTA:DeepSWE v1.1智能体编码任务拿下88.7%,超过GPT-6 Astra的86.9%;GDPval-AA v2真实知识工作任务成为唯一突破2000 Elo大关的模型,达到2064;Terminal-bench 2.1终端编码能力为95.3%,全场最高;OSWorld-2.0计算机操作测试为86.8%,同样排名第一。

  最受关注的一次演示是"机械蝴蝶"任务:一位开发者要求模型使用Three.js从零编写并渲染出结构复杂的机械蝴蝶,这类实时代码生成考验空间几何理解、光影材质着色器调度与多轴物理模拟能力,稍有差错便会导致浏览器崩溃。结果显示,相比Fable 5.1 Max,处于暗中测试状态的Gemini 4 Pro耗时减少约67%。

版权所有,未经许可不得转载

  此外,还有开发者制作的同款机械蝴蝶加入了爆炸视图、飞行模式与组件标注等交互。在3D手表、机器人"瓦力"等横向对比中,Gemini 4 Pro在爆炸视图与构件设计上表现突出,并会在未被要求的情况下自主添加动画与交互细节。

Gemini

  【CNMO科技消息】近日,一个以"gemini-3.8-flash"为马甲的神秘模型现身大模型竞技场Arena,在多轮盲测中被广泛认为是谷歌尚未发布的Gemini 4 Pro,其性能表现引发AI圈的高度关注。


以上问题已经回答了。如果你想了解更多,请关新经网网站 (https://www.xinhuatone.com/)
郑重声明:本文版权归原作者所有,转载文章仅为传播更多信息之目的,如作者信息标记有误,请第一时间联系我们修改或删除,多谢。