OpenAI 发布 SWE-bench Verified 基准
OpenAI 发布 SWE-bench Verified,这是 SWE-bench 中经人工校验的子集,能更可靠地评估 AI 模型解决真实世界软件问题的能力。
推荐理由:OpenAI 发布经人工校验的 SWE-bench 子集,为评估模型解决真实软件问题的能力提供更可靠的基准。
OpenAI 发布 SWE-bench Verified,这是 SWE-bench 中经人工校验的子集,能更可靠地评估 AI 模型解决真实世界软件问题的能力。
推荐理由:OpenAI 发布经人工校验的 SWE-bench 子集,为评估模型解决真实软件问题的能力提供更可靠的基准。
OpenAI 提出证明者-验证者博弈(Prover-Verifier Games),用于提升语言模型输出的可读性,让 AI 给出的解答更清晰、更易被验证。该方法旨在使 AI 输出对人类和机器都更可信。
OpenAI 发布 Universe 软件平台,用于在游戏、网站及其他应用中衡量和训练 AI 的通用智能。该平台覆盖全球范围内的游戏、网站和其他应用资源。