OpenAI 发布 GPT-5.3-Codex
OpenAI 发布 GPT-5.3-Codex,这是一款 Codex 原生的智能体,将前沿编码性能与通用推理能力结合,用于支持长周期、真实世界的技术工作。
推荐理由:OpenAI 发布 Codex 原生智能体 GPT-5.3-Codex,读者可据此判断其编码能力与通用推理结合后的长周期任务定位。
OpenAI 发布 GPT-5.3-Codex,这是一款 Codex 原生的智能体,将前沿编码性能与通用推理能力结合,用于支持长周期、真实世界的技术工作。
推荐理由:OpenAI 发布 Codex 原生智能体 GPT-5.3-Codex,读者可据此判断其编码能力与通用推理结合后的长周期任务定位。
OpenAI 发布 GPT-5.3-Codex 系统卡,称其为迄今能力最强的智能体编码模型。该模型结合了 GPT-5.2-Codex 的前沿编码性能与 GPT-5.2 的推理和专业领域知识能力。
推荐理由:OpenAI 官方系统卡给出 GPT-5.3-Codex 的能力定位,读者可据此判断它在智能体编码任务上的升级幅度。
OpenAI 发布 GPT-5.2-Codex,称其为 OpenAI 最先进的编码模型,具备长周期推理、大规模代码转换和增强的网络安全能力。
推荐理由:OpenAI 官方公布 GPT-5.2-Codex 的定位与三项能力方向,可据此判断其是否适合长周期编码任务。
OpenAI 发布 GPT-5.2 系统卡增补文件,涉及 GPT-5.2-Codex。该页面正文未能抓取,目前仅有标题信息。
OpenAI 推出一个真实场景评测框架,用于衡量 AI 加速湿实验室生物研究的能力。该工作使用 GPT-5 优化分子克隆实验方案,同时探讨 AI 辅助实验的潜力与风险。
推荐理由:OpenAI 用真实湿实验场景评测 GPT-5 优化分子克隆流程的能力,为判断 AI 在生物实验中的可用边界提供参照。
OpenAI 发布 GPT-5.2,称其是自家在数学与科学方面最强的模型,在 GPQA Diamond 和 FrontierMath 等基准上刷新了最优结果。官方表示这些提升已转化为实际研究进展,包括解决一个开放理论问题并生成可靠的数学证明。
推荐理由:GPT-5.2 在 GPQA Diamond 与 FrontierMath 上刷新结果,并给出解决开放理论问题、生成可靠数学证明的实例。
GPT-5.2 是 GPT-5 系列中的最新模型系列,其安全缓解方案与 GPT-5 系统卡和 GPT-5.1 系统卡所述基本一致。与 OpenAI 其他模型一样,GPT-5.2 模型在多样化数据集上训练,包括互联网公开信息、与第三方合作获取的信息,以及用户或人类训练师与研究人员提供或生成的信息。
OpenAI 发布 GPT-5.2,称其是面向日常专业工作最先进的前沿模型,具备领先的推理、长上下文理解、编码和视觉能力。该模型可在 ChatGPT 和 OpenAI API 中使用,用于支撑更快、更可靠的智能体工作流。
推荐理由:OpenAI 官方发布 GPT-5.2,读者可据此了解其在推理、长上下文、编码与视觉上的定位及可用渠道。
OpenAI 发布 GPT-5.1-Codex-Max,一款面向 Codex 的更快、更智能的智能体编程模型。该模型面向长时间运行的项目级工作,在推理能力和 token 效率上有所增强。
推荐理由:OpenAI 发布面向 Codex 的智能体编程模型,读者可据此判断长周期项目级编码任务的模型选型方向。
OpenAI 发布 GPT-5.1-Codex-Max 系统卡,说明该模型实施的安全措施。系统卡涵盖模型层缓解措施,包括针对有害任务和提示注入的专门安全训练,以及产品层缓解措施,如智能体沙箱和可配置网络访问。
推荐理由:系统卡披露了 GPT-5.1-Codex-Max 在模型层与产品层分别采取的安全措施,可供评估其智能体沙箱与网络访问配置。
GPT-5.1 已在 API 中开放,带来更快的自适应推理、扩展的 prompt caching 和改进的编码表现,并新增 apply_patch 与 shell 工具。
推荐理由:GPT-5.1 进入 API 并新增 apply_patch 与 shell 工具,开发者可据此判断是否调整现有调用与工具链。
OpenAI 升级 GPT-5 系列,推出 GPT-5.1,官方称新模型更温暖、能力更强,并新增自定义 ChatGPT 语气和风格的方式。GPT-5.1 当天起向付费用户逐步推送。
推荐理由:OpenAI 官方发布 GPT-5.1,付费用户当天开始推送,可据此判断升级节奏与可用范围。
OpenAI 发布 gpt-oss-safeguard,这是一组开放权重的推理模型,用于安全分类。开发者可以应用并迭代自定义策略。
推荐理由:OpenAI 发布开放权重安全分类推理模型,开发者可据此按自有策略迭代内容安全判定。
OpenAI 发布 gpt-oss-safeguard 技术报告,介绍 gpt-oss-safeguard-120b 和 gpt-oss-safeguard-20b 两个开源权重推理模型。这两个模型基于 gpt-oss 模型后训练,能够依据给定策略进行推理,从而按该策略对内容打标。报告描述了模型能力,并以底层 gpt-oss 模型为基线给出安全评测结果。
推荐理由:OpenAI 公开 gpt-oss-safeguard 两个开源权重模型的技术报告,并给出以 gpt-oss 为基线的安全评测结果。
OpenAI 推出 GDPval,一项衡量模型在真实经济价值任务上表现的新评测,覆盖 44 个职业。
推荐理由:OpenAI 推出覆盖 44 个职业的 GDPval 评测,读者可据此了解模型在真实经济价值任务上的衡量方式。
OpenAI 发布 GPT-5 系统卡增补,公布新模型 GPT-5-Codex,这是 GPT-5 针对 Codex 中智能体编程进一步优化的版本。GPT-5-Codex 会根据任务复杂度更动态地调整思考投入,对简单对话查询或小任务快速响应,对更复杂的任务则独立工作更长时间。
推荐理由:GPT-5 系统卡增补披露 GPT-5-Codex 按任务复杂度动态调整思考投入,可据此判断其在智能体编程场景的定位。
OpenAI 发布更先进的语音到语音模型 gpt-realtime,并更新 Realtime API,新增 MCP server 支持、图像输入和 SIP 电话呼叫支持。
推荐理由:OpenAI 发布语音到语音模型 gpt-realtime,并同步扩展 Realtime API 的 MCP、图像输入与 SIP 通话能力。
OpenAI 与 Retro Bio 使用专用 AI 模型 GPT-4b micro,为干细胞疗法和长寿研究设计出更有效的蛋白质。该模型面向生命科学场景,用于蛋白质工程。
OpenAI 在 API 平台推出 GPT-5,提供高推理性能、面向开发者的新控制项,并在真实编码任务上取得领先结果。
推荐理由:OpenAI 在 API 平台上线 GPT-5,开发者可据此了解新模型在推理与真实编码任务上的定位。
OpenAI 发布 GPT-5,称其为 OpenAI 最先进的模型,面向企业 AI、自动化和智能工作时代的办公效率。原文未披露具体参数、版本细节或可用范围。
推荐理由:OpenAI 官方对 GPT-5 的定位说明,可了解其面向企业 AI、自动化和办公效率的落点。
OpenAI 发布文章介绍 GPT-5 在编程和设计方面带来的新可能,正文仅提供摘要,未给出具体功能、版本号或性能数据。
OpenAI 发布文章介绍 GPT-5 在医学研究中的用途。原文未披露具体功能、参数或可用性细节。
OpenAI 发布 GPT-5 系统卡,说明其通过统一模型路由系统实现快速与智能响应,涉及 gpt-5-main、gpt-5-thinking 以及 gpt-5-thinking-nano 等轻量版本,并针对不同任务和开发者用途做了优化。
推荐理由:系统卡披露 GPT-5 用统一路由在 gpt-5-main、gpt-5-thinking 与轻量版本间调度,可据此判断不同任务的模型选型。
OpenAI 发布 GPT-5,称其为目前最强的 AI 系统,在智能水平上较此前所有模型有显著跃升。官方称 GPT-5 在编程、数学、写作、健康、视觉感知等方向达到当前最优表现。
推荐理由:OpenAI 官方发布 GPT-5,说明其在编程、数学、写作、健康与视觉感知等方向的能力定位,可作为模型选型的参考。
OpenAI 发布 GPT-5,并展示一组领先开发者首次使用该模型的过程。原文仅提供摘要,未披露具体功能、版本号或性能数据。
OpenAI 推出 gpt-oss-120b 和 gpt-oss-20b 两个开放权重推理模型,采用 Apache 2.0 许可并适用其 gpt-oss 使用政策。材料仅提供摘要,未披露模型参数规模、性能指标或部署要求等细节。
推荐理由:OpenAI 公开两个开放权重推理模型的许可与使用政策,可据此判断自部署的合规与选型空间。
OpenAI 发布其能力最强的开放权重模型,称这是让先进 AI 更开放、更灵活、更易获取的重要一步。OpenAI 表示,其使命是让尽可能多的人用上 AI,而 AI 的下一个前沿不只关乎能力,也关乎谁能使用它。
推荐理由:OpenAI 发布其能力最强的开放权重模型,关注开放权重路线与模型可及性的读者可了解这一动作。
OpenAI 发布 gpt-oss-120b 和 gpt-oss-20b 两款开放权重语言模型,采用 Apache 2.0 许可。官方称这两款模型在推理任务上优于同规模开放模型,具备较强的工具调用能力,并针对消费级硬件的高效部署做了优化。
推荐理由:OpenAI 发布两款开放权重模型,给出参数规模、Apache 2.0 许可与消费级硬件部署定位,便于评估自部署选型。
OpenAI 发布 ChatGPT agent 系统卡,介绍这款智能体模型将研究、浏览器自动化和代码工具整合在一起,并在 Preparedness Framework 下设置防护措施。
推荐理由:OpenAI 公开 ChatGPT agent 的系统卡,说明其如何把研究、浏览器自动化与代码工具整合并在 Preparedness Framework 下设置防护。
OpenAI 将 Operator 的底层模型从 GPT-4o 替换为 OpenAI o3,API 版本仍基于 4o。该变动作为 OpenAI o3 与 o4-mini 系统卡附录公布。
OpenAI 发布 o3 和 o4-mini 系统卡附录,介绍云端编码智能体 Codex。Codex 由 codex-1 驱动,后者是 OpenAI o3 针对软件工程优化的版本。codex-1 通过强化学习在多种环境的真实编码任务上训练,生成的代码贴近人类风格与 PR 偏好,能精确遵循指令并反复运行测试直至通过。
推荐理由:材料说明 Codex 由 o3 衍生版本 codex-1 驱动,并交代其训练方式,可据此判断该编码智能体的能力来源。
OpenAI 发布 o3 与 o4-mini 系统卡,两款模型将前沿推理能力与完整工具能力结合,支持网页浏览、Python、图像与文件分析、图像生成、canvas、自动化、文件搜索和记忆。
推荐理由:系统卡摘要列出 o3 与 o4-mini 的推理能力与工具调用范围,可据此判断两款模型在落地场景中的能力边界。
OpenAI 发布 o3 和 o4-mini 两款模型,官方称这是其迄今最智能、能力最强的模型,并支持完整的工具调用。
推荐理由:OpenAI 发布 o3 与 o4-mini,官方称其为目前最强模型并支持完整工具调用,可据此判断模型选型。
OpenAI 在 API 中推出 GPT-4.1 系列模型,在编码、指令遵循和长上下文理解方面均有整体提升,并首次发布 nano 模型。该系列模型即日起面向全球开发者开放。
推荐理由:OpenAI 在 API 上线 GPT-4.1 系列并首次推出 nano 版本,开发者可据此判断模型选型与接入时机。
OpenAI 在 API 中推出新一代音频模型,开发者首次可以指示文本转语音模型以特定方式说话,例如“像一位有同理心的客服人员那样说话”,为语音智能体带来新的定制能力。
推荐理由:OpenAI 在 API 中上线新一代音频模型,开发者可指定语音风格,为语音智能体定制提供新选项。
OpenAI 发布 GPT-4.5 的研究预览,并同步公布系统卡。OpenAI 称这是其目前规模最大、知识量最多的模型。
推荐理由:OpenAI 公布 GPT-4.5 系统卡并放出研究预览,读者可据此了解该版本在模型规模与知识量上的定位。
OpenAI 发布 deep research 系统卡,说明该功能发布前开展的安全工作,包括外部红队测试、按 Preparedness Framework 进行的前沿风险评估,以及针对关键风险领域构建的缓解措施概览。
OpenAI 发布 SWE-Lancer 基准,用真实自由职业软件工程任务检验前沿 LLM 能否赚到 100 万美元。该基准以真实外包工作为评测对象,衡量模型在软件工程交付中的经济价值。
推荐理由:OpenAI 用真实自由职业软件工程任务衡量前沿 LLM 的经济价值,可据此判断模型在真实交付场景中的能力边界。
OpenAI 发布 o3-mini 模型,原文链接为 https://openai.com/index/openai-o3-mini,正文未抓取到,暂无更多细节。
OpenAI 发布 Operator 系统卡,基于其既有安全框架说明多层防护思路,包括为防范提示工程与越狱而实施的模型和产品层缓解措施,以及隐私与安全保护。文档还介绍了外部红队工作、安全评估,以及持续改进这些防护措施的后续工作。
推荐理由:OpenAI 公开 Operator 的系统卡,说明其在提示工程与越狱防护、隐私安全上的多层缓解措施和外部红队评测安排。