OpenAI News·· 2025-02-18精选AI 评分40
OpenAI 发布 SWE-Lancer 基准,测试前沿 LLM 能否赚到 100 万美元
Introducing the SWE-Lancer benchmark
AI 导读
OpenAI 发布 SWE-Lancer 基准,用真实自由职业软件工程任务检验前沿 LLM 能否赚到 100 万美元。该基准以真实外包工作为评测对象,衡量模型在软件工程交付中的经济价值。
推荐理由
OpenAI 用真实自由职业软件工程任务衡量前沿 LLM 的经济价值,可据此判断模型在真实交付场景中的能力边界。
来源:OpenAI News · openai.com