OpenAI 发布 ChatGPT agent 系统卡
OpenAI 发布 ChatGPT agent 系统卡,介绍这款智能体模型将研究、浏览器自动化和代码工具整合在一起,并在 Preparedness Framework 下设置防护措施。
推荐理由:OpenAI 公开 ChatGPT agent 的系统卡,说明其如何把研究、浏览器自动化与代码工具整合并在 Preparedness Framework 下设置防护。
OpenAI 发布 ChatGPT agent 系统卡,介绍这款智能体模型将研究、浏览器自动化和代码工具整合在一起,并在 Preparedness Framework 下设置防护措施。
推荐理由:OpenAI 公开 ChatGPT agent 的系统卡,说明其如何把研究、浏览器自动化与代码工具整合并在 Preparedness Framework 下设置防护。
OpenAI 将 Operator 的底层模型从 GPT-4o 替换为 OpenAI o3,API 版本仍基于 4o。该变动作为 OpenAI o3 与 o4-mini 系统卡附录公布。
OpenAI 发布 o3 和 o4-mini 系统卡附录,介绍云端编码智能体 Codex。Codex 由 codex-1 驱动,后者是 OpenAI o3 针对软件工程优化的版本。codex-1 通过强化学习在多种环境的真实编码任务上训练,生成的代码贴近人类风格与 PR 偏好,能精确遵循指令并反复运行测试直至通过。
推荐理由:材料说明 Codex 由 o3 衍生版本 codex-1 驱动,并交代其训练方式,可据此判断该编码智能体的能力来源。
OpenAI 发布 o3 与 o4-mini 系统卡,两款模型将前沿推理能力与完整工具能力结合,支持网页浏览、Python、图像与文件分析、图像生成、canvas、自动化、文件搜索和记忆。
推荐理由:系统卡摘要列出 o3 与 o4-mini 的推理能力与工具调用范围,可据此判断两款模型在落地场景中的能力边界。
OpenAI 发布 o3 和 o4-mini 两款模型,官方称这是其迄今最智能、能力最强的模型,并支持完整的工具调用。
推荐理由:OpenAI 发布 o3 与 o4-mini,官方称其为目前最强模型并支持完整工具调用,可据此判断模型选型。
OpenAI 在 API 中推出 GPT-4.1 系列模型,在编码、指令遵循和长上下文理解方面均有整体提升,并首次发布 nano 模型。该系列模型即日起面向全球开发者开放。
推荐理由:OpenAI 在 API 上线 GPT-4.1 系列并首次推出 nano 版本,开发者可据此判断模型选型与接入时机。
OpenAI 在 API 中推出新一代音频模型,开发者首次可以指示文本转语音模型以特定方式说话,例如“像一位有同理心的客服人员那样说话”,为语音智能体带来新的定制能力。
推荐理由:OpenAI 在 API 中上线新一代音频模型,开发者可指定语音风格,为语音智能体定制提供新选项。
OpenAI 发布 GPT-4.5 的研究预览,并同步公布系统卡。OpenAI 称这是其目前规模最大、知识量最多的模型。
推荐理由:OpenAI 公布 GPT-4.5 系统卡并放出研究预览,读者可据此了解该版本在模型规模与知识量上的定位。
OpenAI 发布 deep research 系统卡,说明该功能发布前开展的安全工作,包括外部红队测试、按 Preparedness Framework 进行的前沿风险评估,以及针对关键风险领域构建的缓解措施概览。
OpenAI 发布 SWE-Lancer 基准,用真实自由职业软件工程任务检验前沿 LLM 能否赚到 100 万美元。该基准以真实外包工作为评测对象,衡量模型在软件工程交付中的经济价值。
推荐理由:OpenAI 用真实自由职业软件工程任务衡量前沿 LLM 的经济价值,可据此判断模型在真实交付场景中的能力边界。
OpenAI 发布 o3-mini 模型,原文链接为 https://openai.com/index/openai-o3-mini,正文未抓取到,暂无更多细节。
OpenAI 发布 Operator 系统卡,基于其既有安全框架说明多层防护思路,包括为防范提示工程与越狱而实施的模型和产品层缓解措施,以及隐私与安全保护。文档还介绍了外部红队工作、安全评估,以及持续改进这些防护措施的后续工作。
推荐理由:OpenAI 公开 Operator 的系统卡,说明其在提示工程与越狱防护、隐私安全上的多层缓解措施和外部红队评测安排。
OpenAI 发布 o1 模型,同时带来 Realtime API 改进、一种新的微调方法以及面向开发者的其他更新。官方未在摘要中给出各项更新的具体参数与上线细节。
推荐理由:OpenAI 官方一次性公布 o1 模型与面向开发者的多项工具更新,可据此了解其开发者侧能力布局。
OpenAI 发布 o1 与 o1-mini 的系统卡,说明模型发布前开展的安全工作,包括外部红队测试以及依据 Preparedness Framework 进行的前沿风险评测。
推荐理由:系统卡披露了 o1 与 o1-mini 发布前的外部红队测试和前沿风险评测流程,可了解其安全评估框架。
OpenAI 发布 o1 模型,官方页面标题为 Introducing OpenAI o1。该材料抓取失败,除标题外无正文内容可供进一步说明。
OpenAI 发布 o1-mini,官方定位为在推理能力上追求成本效率的模型。该条目来自 OpenAI 官方新闻源,正文仅给出“Advancing cost-efficient reasoning”这一说明,未披露参数、价格或基准数据。
OpenAI 发布 o1 模型贡献说明,原文仅提供标题,未给出具体贡献者名单或技术细节。
经济学家 Tyler Cowen 解读了 OpenAI o1 如何应对复杂经济问题。该内容聚焦 o1 在经济推理场景中的表现,由 OpenAI 发布。
Cognition CEO 兼联合创始人 Scott Wu 说明 OpenAI o1 如何以更接近人类的方式做出编码决策。
推荐理由:Cognition CEO 说明 OpenAI o1 在编码决策上更接近人类思路,可据此判断该模型在编码场景的定位。
OpenAI 宣布 GPT-4o 现已支持微调,开发者可基于该模型进行定制化训练。
OpenAI 发布 SWE-bench Verified,这是 SWE-bench 中经人工校验的子集,能更可靠地评估 AI 模型解决真实世界软件问题的能力。
推荐理由:OpenAI 发布经人工校验的 SWE-bench 子集,为评估模型解决真实软件问题的能力提供更可靠的基准。
OpenAI 发布 GPT-4o 系统卡,用于说明该模型在安全评估与风险方面的相关情况。原文正文抓取失败,仅标题可用。
OpenAI 发布 GPT-4o mini,官方定位为更具成本效率的智能模型。
OpenAI 提出证明者-验证者博弈(Prover-Verifier Games),用于提升语言模型输出的可读性,让 AI 给出的解答更清晰、更易被验证。该方法旨在使 AI 输出对人类和机器都更可信。
OpenAI 进一步说明其文本转语音模型 Voice Engine 的技术原理与安全研究。该模型可根据文本生成语音,官方同时公布了相关的安全研究内容。
OpenAI 宣布推出新旗舰模型 GPT-4 Omni(GPT-4o),可实时跨音频、视觉和文本进行推理。
推荐理由:OpenAI 官方发布新旗舰模型 GPT-4o,可实时跨音频、视觉和文本推理,读者可据此了解其多模态能力定位。
OpenAI 发布最新旗舰模型 GPT-4o,同时让 ChatGPT 免费用户获得更多能力。官方称此次既上线新旗舰模型,也扩大了免费用户可用的工具范围。
推荐理由:OpenAI 发布新旗舰模型 GPT-4o,并首次把更多能力开放给 ChatGPT 免费用户。
OpenAI 在春季更新中推出 GPT-4o,并让 ChatGPT 免费用户可用更多能力。原文未披露 GPT-4o 的具体参数、版本号与免费能力清单。
推荐理由:OpenAI 在春季更新中推出 GPT-4o,并让 ChatGPT 免费用户获得更多能力,可据此判断免费版能力边界的变化。
OpenAI 公开了 Voice Engine 的小规模预览经验,这是一个用于创建自定义语音的模型。OpenAI 表示正在分享这次预览中获得的经验与教训。
推荐理由:OpenAI 首次公开语音克隆模型 Voice Engine 的小规模预览,并分享其中的经验与风险考量。
OpenAI 发布新的嵌入模型,并同步更新 API。
OpenAI 在 DevDay 上发布 GPT-4 Turbo,支持 128K 上下文且价格更低,并推出 GPT-4 Turbo with Vision。同时公布新的 Assistants API 和 DALL·E 3 API 等开发者产品。
推荐理由:OpenAI 在 DevDay 一次性公布 GPT-4 Turbo、Assistants API 等模型与开发者产品,可据此了解其当时的能力与定价方向。
OpenAI 发布 DALL·E 3 系统卡,介绍该图像生成模型在安全方面的评估与应对措施。
OpenAI 发布 GPT-4V(ision) 系统卡,介绍该视觉模型的能力与安全评估情况。原文正文未能抓取,仅标题可用。
OpenAI 宣布开发者现在可以用自己的数据微调 GPT-3.5 Turbo,以适配各自的使用场景,同时更新了 API。原文未披露微调价格、可用范围等具体细节。
推荐理由:OpenAI 开放 GPT-3.5 Turbo 微调,开发者可用自有数据定制模型,是当时落地定制能力的关键变化。
OpenAI 发布 GPT-4,称其为扩展深度学习规模的最新里程碑。GPT-4 是接受图像和文本输入、输出文本的大型多模态模型,在多个专业和学术基准上达到人类水平表现,但在许多真实场景中能力仍不及人类。
推荐理由:OpenAI 官方给出 GPT-4 的多模态输入输出形态与基准表现,可作为判断该模型能力边界的原始依据。
OpenAI 发布 GPT-4,可在创意与技术写作任务中与用户生成、编辑和迭代内容,例如创作歌曲、撰写剧本,或学习用户的写作风格。
OpenAI 发布 Point-E,一个可根据复杂提示生成 3D 点云的系统。
OpenAI 发布新版嵌入模型,能力显著提升、成本更低且更易使用。官方称该模型在性能、价格和易用性上均有改进,但未披露具体参数规模、benchmark 分数或定价细节。
OpenAI 发布对话式模型 ChatGPT,以对话形式与用户交互。官方称该对话格式让 ChatGPT 能回答追问、承认自身错误、质疑错误前提并拒绝不当请求。
推荐理由:OpenAI 官方发布对话式模型 ChatGPT,说明其能追问、认错、质疑错误前提并拒绝不当请求。
OpenAI 推出改进版 Codex,这是其将自然语言转换为代码的 AI 系统,从今天起通过 API 以私测形式发布。
推荐理由:OpenAI 官方公布 Codex 改进版并开放 API 私测,读者可据此了解自然语言转代码能力的开放节奏。