谷歌发布Gemini 4 Argon:性能评测与能力解析

[复制链接]
发表于 5 小时前 来自手机 | 显示全部楼层 |阅读模式
近期,谷歌正式发布了全新的AI模型Gemini 4 Argon。根据官方信息,这款新模型主要面向软件工程、金融、法律和网络安全等复杂工作流,旨在提供更强的长文本推理和多步骤任务执行能力。本文将结合官方公布的评测数据,为大家梳理这款新模型的核心亮点。

模型规格与定价
Gemini 4 Argon在输出能力上进行了大幅扩展,输出上限从原来的6.4万token提升至100万token。这意味着它能更好地处理长篇文档和复杂的连续推理任务。
在API定价方面,每百万输入token为2美元(约13.41元),输出token为10美元(约67.05元)。为了降低高频调用的成本,缓存输入价格大幅下调了95%,仅为每百万token 0.1美元(约0.67元)。这种定价策略对开发者来说具有一定的吸引力。

多领域评测表现
在谷歌公布的各项基准测试中,Gemini 4 Argon在多个专业领域表现出色。
在软件工程测试(DeepSWE v1.1)中,它取得了77.9%的成绩,略微领先于GPT-6 Astra和Claude Opus 5.5。在Vibe Code Bench代码测试中,也以91.9%的成绩位居前列。不过,在FrontierSWE v2和Terminal-bench 4.0等部分测试中,它略逊于GPT-6 Astra和Claude Opus 5.5,显示出各模型在不同细分场景下仍有各自优势。
在知识工作与复杂任务方面,Gemini 4 Argon在Vals Index(68.9%)、企业自动化(51.3%)和金融智能体评测(65.4%)中均取得了领先成绩。法律智能体评测得分为19.6%,长视频理解评测达到91.7%,在GraphWalks长上下文测试中表现出色。

网络安全与实战应用
网络安全是此次Gemini 4 Argon的一大发力点。在Gray Swan IPI攻击成功率测试中,其得分低至0.7%(越低越好),显著优于其他主流模型,展现出较强的防御能力。在CWE-bench v1评测中以68%并列第一。
在实际应用案例中,谷歌已经将其用于大规模代码迁移(如将超过80万行的C/C++代码迁移至Rust),其智能体实施的内存优化释放了超过300 TiB的内存。在libgav1视频解码器项目中,优化后的运行速度达到原有Rust移植版的2.7倍。此外,该模型还能自主发现、验证并修补漏洞,曾有安全团队利用它发现全球多家医院医疗软件中的严重漏洞。

发布策略
Gemini 4 Argon初期通过Fairwind计划向受信任的网络防御团队开放,后续将优先向付费API客户和Google AI Ultra订阅用户提供。

整体来看,Gemini 4 Argon在长上下文处理、专业领域推理以及网络安全防御方面提供了新的工具。其极高的缓存输入性价比和庞大的上下文窗口,对需要处理大规模代码和复杂流程的开发团队来说,是一个值得关注的新选择。

scaled_1000157009.webp
万狸温馨提示:理性消费
1.数码选品:先定用途,再比参数,拒绝 “加点钱更好” 的超支诱惑。
2.购车决策:看平台生命周期,算长期使用成本,刚需比潮流更重要。
3.重点提醒:多查真实评价,少信首发噱头,买得对远比买得新划算。
4.交流准则:聊产品讲实际体验,不抬杠不诋毁品牌,友善分享。
5.氛围维护:遇到分歧先理性沟通,不贴“粉黑”标签,温馨交流。
您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

关注QQ群
手机版|小黑屋|万狸社区-免费活跃数码论坛,手机/电脑/汽车+旅游美食游戏兴趣社区

相关侵权、举报、投诉及建议等,请发 E-mail:572109352@qq.com

Powered by Discuz! X5.0 © 2001-2026 Discuz! Team.|桂ICP备16003785号

在本版发帖
客服QQ:572109352
QQ客服返回顶部