谷歌 DeepMind 发布 Gemini 4 首款旗舰模型 Argon
谷歌 DeepMind 于 9 月 30 日正式发布 Gemini 4 系列首款旗舰模型 Argon,官方称在 19 项基准测试中取得 13 项领先,输出 Token 上限从上一代的 6.4 万提升到 100 万。
推荐理由:文章把 Argon 的基准成绩、真实工程案例与内部质疑放在一起,读者可据此判断跑分领先与实际落地之间的落差。
谷歌 DeepMind 于 9 月 30 日正式发布 Gemini 4 系列首款旗舰模型 Argon,官方称在 19 项基准测试中取得 13 项领先,输出 Token 上限从上一代的 6.4 万提升到 100 万。
推荐理由:文章把 Argon 的基准成绩、真实工程案例与内部质疑放在一起,读者可据此判断跑分领先与实际落地之间的落差。
作者用同一份脏销售流水和同一句提示词实测 WorkBuddy、千问办公和豆包工作,三家都交付了 Excel、PPT 和摘要,但算出的季度总额最高比最低多出 57.7%。
推荐理由:作者用同一份脏数据和同一句提示词实测三款办公 Agent,并拆开安装包对比执行环境,可看到三家在纠错方式与责任归属上的差异。
作者把同一句模糊指令交给 GPT-6 Astra Pro、Claude Fable 5.1 和 GPT-5.6 Sol,三者都让两轴云台转了起来,但对完成的理解不同:Sol 和 Fable 走完四个组合极限角,Astra 只用 7 步分别抵达两轴边界。
推荐理由:作者用同一台云台机器人实测三个模型,从动作数、速度参数和验证机制看它们对完成与风险的不同理解。
阶跃星辰发布 Step 5 Preview,在 Artificial Analysis Intelligence Index 上拿到 44 分,位列全球开源前二。
推荐理由:原文给出 Step 5 Preview 在 AA 榜单的分数、单任务成本和 1M 上下文,并附一次跨 Blender 与网页工程的实测过程。
作者用三张圆明园鼠首照片和一段自然语言指令,让 GPT-6 Astra 在 Codex 中调度 Aholo Lux3D 生成 3D 模型,再交由 Blender 检查、调材质、加底座并渲染导出。
推荐理由:作者用三张鼠首照片跑通从自然语言到可交付 3D 资产的完整链路,并给出耗时与成本数据,可据此判断专业模型接入通用 Agent 的工程化路径。
谷歌发布新一代旗舰模型 Gemini 4 Argon,在 DeepSWE v1.1 上拿到 77.9%,高于 Claude Opus 5.5 的 74.2% 和 GPT-6 Astra 的 74.1%,并以 68.90% 登顶 Vals Index。
推荐理由:汇总 Gemini 4 Argon 的多榜单跑分、定价与首批开放范围,可对照同期 Opus 5.5、GPT-6 Astra 判断旗舰模型格局。
谷歌推出新一代旗舰模型 Gemini 4 Argon,采用公司迄今规模最大的预训练,在谷歌公布的 18 项基准测试中拿下 12 项第一、1 项并列第一,GPT-6 Astra 为 3 项第一、1 项并列第一,Claude Opus 5.5 为 2 项第一。
推荐理由:原文列出 Gemini 4 Argon 在 18 项基准中的胜负分布与短板项,可据此判断它在知识工作与终端操作上的能力边界。
OpenAI 研究员 Noam Brown 在播客访谈中表示,1 万个 Agent 耗时 88 小时、消耗 1300 亿 token 解出千禧年数学难题,但他认为多智能体最多只占其中 10% 的功劳,核心仍是模型本身足够强。
作者在 Claude Code 中用同一任务实测同日发布的 Qwen3.8-Flash 与 GLM-5.3-Flash,要求从零开发一个含任务、日程、笔记、Dashboard 和全局搜索的个人工作台。
推荐理由:同一任务下对比两款 Flash 模型的办公工作台开发表现,并给出任务成本估算,可作选型参考。
雷锋网用同一道长任务对比 OpenClaw v2026.7.1-2 与 v2026.8.1(2.0),两版总耗时基本持平(103.3 分钟对 106.1 分钟),但 2.0 的 LLM 请求从 74 次降到 46 次、工具调用从 100 次降到 65 次。
推荐理由:同一道长任务对比 OpenClaw 1.x 与 2.0,给出请求次数、token 与上下文压缩的后台数据,可判断其长任务托管能力。
雷锋网把 AgnesCode + Agnes 3.0 Flash 与 Codex + GPT-5.6 Sol 放进众智 FlagOS 开放计算全球大赛的 DeepSeek-V3 解码阶段融合 QKV-A 下投影算子题(Task66: dsv3_fused_a_gemm),在 8 款芯片上接受赛事官方自动化评测。
推荐理由:雷锋网用同一道算子优化题对比免费 AgnesCode 与付费 Codex,给出跨芯片加速比与耗时数据,可作 Agent 底层工程能力的参照。
OpenAI 提出针对前沿模型与防护措施的第三方 AI 安全评估的优先事项与原则,强调评估需严谨、安全且独立。
OpenAI 提出为下一阶段 AI 建立共享全球标准的路径,呼吁通过协调一致的评估、报告与治理来提升安全性。
OpenAI Signals 数据显示,全球用户正把 ChatGPT 从提问工具变为做事工具,并给出国家级采用情况与使用趋势洞察。该数据覆盖各地采用程度、使用趋势与行为演变。
OpenAI 就近期涉及 OpenAI 模型的第三方网络安全评测事件作出说明,并概述了用于加强 AI 模型测试与评估的新保障措施。
推荐理由:OpenAI 就第三方网络安全评测中的事件作出说明,并给出新的模型测试与评估保障措施。
OpenAI 首席财务官 Sarah Friar 提出一套实用的 AI 记分卡,通过有用工作量、单次成功任务成本、可靠性和算力回报四项指标衡量 AI 的 ROI。
推荐理由:OpenAI 首席财务官提出用有用工作量、单次成功任务成本、可靠性和算力回报四项指标衡量 AI 投入产出。
OpenAI 公布了 GPT-5.5 Bio Bug Bounty 计划的详情。该计划围绕 GPT-5.5 的生物相关能力设立漏洞赏金机制,具体规则与参与方式随公告一并披露。
OpenAI 发布 GeneBench-Pro,一个用复杂真实数据集测试 AI 在基因组学、生物学和科研领域表现的新基准。
OpenAI 通过 Appia Foundation 支持先进 AI 的评估框架、安全实践与全球合作,推动构建共享标准。
OpenAI 发布 LifeSciBench,一个由专家撰写并评审的基准,用于评估 AI 系统处理真实生命科学研究任务与决策的能力。
OpenAI 推出 Deployment Simulation,一种在模型发布前用真实对话数据模拟部署、预测 AI 模型行为的方法,目标是提升安全性和评估准确性。
推荐理由:OpenAI 提出用真实对话数据在发布前模拟部署,读者可了解模型安全评估方法的一种新思路。
OpenAI 发布关于第三方 AI 评测的指导,内容涵盖如何评估前沿系统的模型能力、防护措施与评测有效性。
推荐理由:OpenAI 官方给出第三方评测的评估框架,涉及模型能力、防护措施与有效性,可供关注评测方法的人参考。
OpenAI 与太平洋西北国家实验室合作,推出 DraftNEPABench 基准,用于评估 AI 编码智能体如何加速联邦审批流程。该基准显示,NEPA 文件起草时间最多可减少 15%,并推动基础设施审查现代化。
推荐理由:OpenAI 与联邦实验室联合发布基准,用 15% 的起草时间降幅说明 AI 编码智能体在政府审批场景的可用边界。
OpenAI 与 Paradigm 联合推出 EVMbench,用于评测 AI 智能体检测、修补和利用高危智能合约漏洞的能力。该基准覆盖漏洞检测、补丁修复与漏洞利用三类任务。
推荐理由:OpenAI 与 Paradigm 联合推出智能体安全评测基准,关注 AI 在智能合约漏洞检测与修复上的能力边界。
OpenAI 推出一个真实场景评测框架,用于衡量 AI 加速湿实验室生物研究的能力。该工作使用 GPT-5 优化分子克隆实验方案,同时探讨 AI 辅助实验的潜力与风险。
推荐理由:OpenAI 用真实湿实验场景评测 GPT-5 优化分子克隆流程的能力,为判断 AI 在生物实验中的可用边界提供参照。
OpenAI 发布 GPT-5.2,称其是自家在数学与科学方面最强的模型,在 GPQA Diamond 和 FrontierMath 等基准上刷新了最优结果。官方表示这些提升已转化为实际研究进展,包括解决一个开放理论问题并生成可靠的数学证明。
推荐理由:GPT-5.2 在 GPQA Diamond 与 FrontierMath 上刷新结果,并给出解决开放理论问题、生成可靠数学证明的实例。
OpenAI 发文阐述 evals 如何帮助企业定义、衡量并改进 AI 性能,从而降低风险、提升生产力并形成战略优势。
OpenAI 发布 gpt-oss-safeguard 技术报告,介绍 gpt-oss-safeguard-120b 和 gpt-oss-safeguard-20b 两个开源权重推理模型。这两个模型基于 gpt-oss 模型后训练,能够依据给定策略进行推理,从而按该策略对内容打标。报告描述了模型能力,并以底层 gpt-oss 模型为基线给出安全评测结果。
推荐理由:OpenAI 公开 gpt-oss-safeguard 两个开源权重模型的技术报告,并给出以 gpt-oss 为基线的安全评测结果。
OpenAI 发布 AgentKit、扩展的 Evals 能力以及面向智能体的强化微调(RFT),用于帮助开发者更快从原型走向生产。官方称这三项工具面向智能体开发流程,但未在摘要中给出具体功能细节与可用范围。
推荐理由:OpenAI 官方发布 AgentKit、扩展的 Evals 与面向智能体的强化微调,读者可据此判断智能体开发工具链的补齐方向。
OpenAI 推出 GDPval,一项衡量模型在真实经济价值任务上表现的新评测,覆盖 44 个职业。
推荐理由:OpenAI 推出覆盖 44 个职业的 GDPval 评测,读者可据此了解模型在真实经济价值任务上的衡量方式。
OpenAI 发布新研究,解释语言模型产生幻觉的原因。研究结果显示,改进评测方式有助于提升 AI 的可靠性、诚实性与安全性。
推荐理由:OpenAI 从评测角度解释大模型幻觉的成因,读者可据此理解评测改进与模型可靠性之间的关系。
Intercom 分享了构建可扩展 AI 平台的三条经验,涵盖评估体系与架构设计,目标是引领客户支持的未来。
OpenAI 发布 BrowseComp,一个面向浏览智能体(browsing agents)的基准测试。
OpenAI 发布 SWE-Lancer 基准,用真实自由职业软件工程任务检验前沿 LLM 能否赚到 100 万美元。该基准以真实外包工作为评测对象,衡量模型在软件工程交付中的经济价值。
推荐理由:OpenAI 用真实自由职业软件工程任务衡量前沿 LLM 的经济价值,可据此判断模型在真实交付场景中的能力边界。
OpenAI 发布 Operator 系统卡,基于其既有安全框架说明多层防护思路,包括为防范提示工程与越狱而实施的模型和产品层缓解措施,以及隐私与安全保护。文档还介绍了外部红队工作、安全评估,以及持续改进这些防护措施的后续工作。
推荐理由:OpenAI 公开 Operator 的系统卡,说明其在提示工程与越狱防护、隐私安全上的多层缓解措施和外部红队评测安排。
OpenAI 提出以增加推理时计算来提升模型对抗鲁棒性的思路,即用更多推理算力换取对对抗攻击的抵抗能力。该方向探讨推理时计算与对抗鲁棒性之间的权衡关系。
OpenAI 发布 o1 与 o1-mini 的系统卡,说明模型发布前开展的安全工作,包括外部红队测试以及依据 Preparedness Framework 进行的前沿风险评测。
推荐理由:系统卡披露了 o1 与 o1-mini 发布前的外部红队测试和前沿风险评测流程,可了解其安全评估框架。
Morgan Stanley 正利用 AI 评估(AI evals)来塑造金融服务的未来。该行将 AI 评估应用于金融服务场景,以推动这一领域的未来发展。
OpenAI 发布文章阐述如何结合人类与 AI 推进红队测试。原文未披露具体模型版本、参数规模或 benchmark 数据,仅以标题点明人类与 AI 协同这一方向。
经济学家 Tyler Cowen 解读了 OpenAI o1 如何应对复杂经济问题。该内容聚焦 o1 在经济推理场景中的表现,由 OpenAI 发布。