跳到正文
原文
OpenAI News·· 2025-02-18精选AI 评分40

OpenAI 发布 SWE-Lancer 基准,测试前沿 LLM 能否赚到 100 万美元

Introducing the SWE-Lancer benchmark

AI 导读

OpenAI 发布 SWE-Lancer 基准,用真实自由职业软件工程任务检验前沿 LLM 能否赚到 100 万美元。该基准以真实外包工作为评测对象,衡量模型在软件工程交付中的经济价值。

推荐理由

OpenAI 用真实自由职业软件工程任务衡量前沿 LLM 的经济价值,可据此判断模型在真实交付场景中的能力边界。

来源:OpenAI News · openai.com