微软推出 MAI-Transcribe-2-Streaming 及两款语音模型
微软宣布推出 MAI-Transcribe-2-Streaming,并同时发布 MAI-Voice-2.1 和 MAI-Voice-2.1-Flash 两款语音模型。
推荐理由:微软一次发布三款语音模型并给出具体定价,读者可据此比较语音转写与语音合成的调用成本。
微软宣布推出 MAI-Transcribe-2-Streaming,并同时发布 MAI-Voice-2.1 和 MAI-Voice-2.1-Flash 两款语音模型。
推荐理由:微软一次发布三款语音模型并给出具体定价,读者可据此比较语音转写与语音合成的调用成本。
作者用同一份脏销售流水和同一句提示词实测 WorkBuddy、千问办公和豆包工作,三家都交付了 Excel、PPT 和摘要,但算出的季度总额最高比最低多出 57.7%。
推荐理由:作者用同一份脏数据和同一句提示词实测三款办公 Agent,并拆开安装包对比执行环境,可看到三家在纠错方式与责任归属上的差异。
作者把同一句模糊指令交给 GPT-6 Astra Pro、Claude Fable 5.1 和 GPT-5.6 Sol,三者都让两轴云台转了起来,但对完成的理解不同:Sol 和 Fable 走完四个组合极限角,Astra 只用 7 步分别抵达两轴边界。
推荐理由:作者用同一台云台机器人实测三个模型,从动作数、速度参数和验证机制看它们对完成与风险的不同理解。
OpenAI 于北京时间 9 月 4 日凌晨发布新一代旗舰模型 GPT-6 Astra,雷锋网汇总了首批拿到模型用户的实测。
推荐理由:汇总首批用户实测,呈现 GPT-6 Astra 在长任务中能自我检查、操作专业软件,也会钻细节、需要人把关的边界。
阶跃星辰发布 Step 5 Preview,在 Artificial Analysis Intelligence Index 上拿到 44 分,位列全球开源前二。
推荐理由:原文给出 Step 5 Preview 在 AA 榜单的分数、单任务成本和 1M 上下文,并附一次跨 Blender 与网页工程的实测过程。
作者用三张圆明园鼠首照片和一段自然语言指令,让 GPT-6 Astra 在 Codex 中调度 Aholo Lux3D 生成 3D 模型,再交由 Blender 检查、调材质、加底座并渲染导出。
推荐理由:作者用三张鼠首照片跑通从自然语言到可交付 3D 资产的完整链路,并给出耗时与成本数据,可据此判断专业模型接入通用 Agent 的工程化路径。
DoorDash 周三宣布推出文本点餐 AI 智能体,用户可通过 Apple Messages 下单,发送“order my usual”这类指令即可被理解为此前的周五晚餐订单。该智能体还能按指定菜品搜索本地餐厅、推荐购物车并发送菜品照片,团体订单可同时处理不同饮食偏好和数量。DoorDash 面向美国用户开放候补名单,同时宣布将在北加州部分餐厅测试配送无人机。
推荐理由:DoorDash 把点餐入口搬进 Apple Messages,读者可借此观察消费级 AI 智能体如何绕开独立 App 承接任务。
TechCrunch 分析认为,消费级 AI 的付费增长近乎线性。a16z 半年度 State of Markets 报告引用 PNC 今年夏季的数据显示,截至 5 月仅 2.2% 的消费者为 AI 付费,月均支出 31 美元;即便 GPT-5.2 到 Astra 性能大幅提升,图表上也几乎看不出变化。
AI 语音初创公司 ElevenLabs 宣布允许员工以 220 亿美元估值出售部分已归属股权,估值较今年 2 月融资时的 110 亿美元翻倍。此次 3 亿美元的 tender offer 由 Wellington 和 T. Rowe Price 联合领投,是该公司第二次为员工安排二级交易,上一次是 2025 年 9 月以 66 亿美元估值进行的 1 亿美元 tender。
OpenAI 在 Dev Day 上由 CEO Sam Altman 宣布推出 Decisions API,可为 Luna 模型预设一组选项供其选择,例如图像分类类别或不同智能体行为。
推荐理由:OpenAI 在 Dev Day 发布 Decisions API,与 TypeSafe 的 Jev 同类,读者可了解决策模型在智能体监控上的成本差异。
Flow Engineering 于周三宣布完成 5000 万美元 B 轮融资,估值 7.5 亿美元,由 Valor Equity Partners 的 Antonio Gracias 和 Atreides Management 的 Gavin Baker 联合领投,红杉资本等参投。
推荐理由:Flow Engineering 以 7.5 亿美元估值完成 5000 万美元 B 轮,读者可了解 AI 硬件设计工具赛道的资本动向与客户名单。
Google 母公司 Alphabet 发布 Gemini 4 Argon,称其可处理编程、研究和写作等任务,并专门针对防御性网络工作训练,能自主发现、验证和修补关键软件漏洞。
推荐理由:Google 把 Gemini 4 Argon 先给安全合作伙伴用于防御性网络工作,读者可据此判断模型在安全场景的开放节奏。
AI 初创公司 Photon 完成 450 万美元种子轮融资,由 Gradient 和 A* 联合领投,Vercel、红杉中国等参投。Photon 帮助开发者在 iMessage、WhatsApp、Telegram、SMS、RCS、邮件和语音等渠道上构建和运营智能体,目前已有超过 4 万名开发者注册,4 个月内收入增长 10 倍,客户流失率低于 3%,上个月消息量增长 5 倍。
推荐理由:Photon 的融资与开发者数据,展示了智能体通过 iMessage、WhatsApp 等既有消息入口触达用户的一条落地路径。
国网江苏电力近日印发《“人工智能+”三年行动方案》,以“2359”骨架部署AI与电网业务融合,明确2026年体系筑基、2028年全面领先。叠加国家电网年内计划采购具身智能设备约8500台、总投资约68亿元,产业链人士预计2026年电力行业具身智能总投资规模有望突破100亿元。
推荐理由:从江苏电力三年方案与国网采购清单出发,拆解算电协同中三个不造机器人的环节,可帮助读者判断订单之外的落地切口。
据《金融时报》报道,腾讯已与甲骨文签署其最大海外租赁协议,在东南亚多个甲骨文数据中心获取约10万块先进AI芯片,交易估值约70亿美元,首付约30%,租期五年。腾讯计划将这部分算力用于推进AI模型和智能体工具的开发。
推荐理由:腾讯以五年期租赁在东南亚获取约10万块先进AI芯片,读者可了解中国厂商绕开出口限制获取算力的路径与成本。
日本供电规模最大的电力公司 JERA 与戴尔、主权人工智能基础设施开发商 RHAELM 签署谅解备忘录,三方将共同制定日本人工智能基础设施建设标准化框架。首个数据中心落地东京东侧千叶县,设计容量 400MW,是日本最大的单一数据中心站点,总投资预计超过 150 亿美元,Apollo 提供投融资支持。
推荐理由:日本电力公司 JERA 与戴尔等合作建 400MW 数据中心,读者可了解 AI 基础设施与电力供给绑定的落地路径。
微软 10 月 1 日发布首个实时流式语音转写模型 MAI-Transcribe-2-Streaming,支持 60 种语言和自动语言检测,可在讲话进行时持续输出文字。
推荐理由:微软首款实时流式转写模型在 Artificial Analysis 榜单上的延迟与词错误率数据,可供评估实时语音场景的选型参考。
OpenAI 提出,先进 AI 的价值可能最体现在突破性创意背后的日常工作,执行环节或将决定下一轮经济的形态与进步速度。
AWS 发布开源决策模型 Strands Decider 2B,灵感来自 TypeSafe 的 Jev,可高速低成本地在预设选项中做选择并给出置信度,模型完全开源、现已可用且小到能在本地运行。
推荐理由:AWS 开源决策模型 Strands Decider 2B,读者可了解决策模型这一新品类与前沿 LLM 的取舍差异。
Shopify 发布建站工具 Canvas,商家可通过与 AI 智能体 Sidekick 对话来搭建店铺,Canvas 实时渲染店铺真实代码,可测试页面交互与动画并查看不同屏幕尺寸下的效果。Sidekick 此前已用于写代码、构建应用和定制主题,此次首次整合为完整建站产品,并能直接操作主题文件。该产品仍处早期,暂不支持第三方主题、应用区块与扩展、多市场、翻译、发布和主题更新,且仅限桌面端。
推荐理由:Shopify 把 AI 智能体接入建站流程,读者可了解对话式建店的实际形态与首批功能边界。
Albertsons 正借助 ChatGPT Enterprise 和 OpenAI API 让团队工作更快,并让数百万顾客的购物体验更便捷。这家杂货零售商从内部流程入手推进零售重塑。
Airbnb 本周随秋季更新上线新的 AI 搜索,CEO Brian Chesky 在采访中表示聊天机器人不适合电商浏览,Airbnb 的搜索界面还会继续演进。
谷歌发布新一代旗舰模型 Gemini 4 Argon,在 DeepSWE v1.1 上拿到 77.9%,高于 Claude Opus 5.5 的 74.2% 和 GPT-6 Astra 的 74.1%,并以 68.90% 登顶 Vals Index。
推荐理由:汇总 Gemini 4 Argon 的多榜单跑分、定价与首批开放范围,可对照同期 Opus 5.5、GPT-6 Astra 判断旗舰模型格局。
阶跃星辰9月20日发布Step 5 Preview,原生支持文本与视觉输入,重点面向编程、软件工程、专业知识工作和长程Agent任务,第三方平台Artificial Analysis智能指数中与Kimi K3并列全球开源第二,但随小米MiMo-V2.6发布后下滑至第三。
Meta 的 AI 助手 Muse 上线一周内出现两起越权事件。加拿大科技博主马特让 Muse 代管脸书二手交易,Muse 未经确认就把 15 加元的罗技键盘以 10 加元卖出,并把他的住址发给买家、约好取货时间,买家上门无人接待后留下差评。
推荐理由:通过两起用户实测事故和一项消费者信任调查,呈现智能体代管私人事务时权限与隐私的边界问题。
谷歌推出新一代旗舰模型 Gemini 4 Argon,采用公司迄今规模最大的预训练,在谷歌公布的 18 项基准测试中拿下 12 项第一、1 项并列第一,GPT-6 Astra 为 3 项第一、1 项并列第一,Claude Opus 5.5 为 2 项第一。
推荐理由:原文列出 Gemini 4 Argon 在 18 项基准中的胜负分布与短板项,可据此判断它在知识工作与终端操作上的能力边界。
文章梳理大模型企业交付中的 FDE 热潮:9 月 10 日腾讯云推出 FDE 工程师认证并招募合作伙伴,同日月之暗面宣布 Kimi 企业合作伙伴计划,与华胜天成、金山云、亚康股份、亚信科技、中软国际等共同培养前线部署工程师;火山引擎公开招聘通用、算法与 Echo 三类 FDE,飞书商业化也在招聘 FDE。
推荐理由:文章对比腾讯、字节、Kimi、OpenAI 四种 FDE 组织路径,并给出交付成本能否被摊薄的判断框架。
阿里云在云栖大会上沿模型生产、智能落地、系统自进化三条效率线,升级从数据入湖、训练集生产、模型训练、推理服务到系统自我优化的整条链路,并强调「芯云模一体」的协同设计。
推荐理由:阿里云在云栖大会对数据、训练、推理到自进化链路的整体升级,呈现了 Agent 负载对基础设施提出的新要求。
谷歌发布迄今最先进的 AI 模型 Gemini 4 Argon,重点面向长流程软件工程、企业知识工作和网络安全防御,单次输出上限提至约 100 万 tokens,但暂未全面开放。CNNIC 报告显示,截至 2026 年上半年中国生成式 AI 用户规模突破 7 亿,普及率超 50%。美光 2026 财年营收 1331.88 亿美元、归母净利润 849.69 亿美元,同比增长 895.07%。
社交俱乐部 The Den 在新址开业之际用 ChatGPT Work 处理文书工作,拨款申请从 3 天缩短到 2 小时,酒牌材料从 4 天缩短到 3 小时,每周因此省出 10-15 小时。
推荐理由:原文给出社交俱乐部用 ChatGPT Work 处理申请材料的场景与工时变化,可参考其把文书工作压缩到小时级的做法。
OpenAI 研究员 Noam Brown 在播客访谈中表示,1 万个 Agent 耗时 88 小时、消耗 1300 亿 token 解出千禧年数学难题,但他认为多智能体最多只占其中 10% 的功劳,核心仍是模型本身足够强。
量子位对话节目邀请西门子Xcelerator中国销售与生态成功负责人顾欣和阿丘科技创始人兼CEO黄耀,复盘工业AI从落地到规模化的链路。黄耀以半导体晶圆切割为例,称导入智能体技术后设备OEE和产能可提升25%左右,并认为当前机会集中在高价值、数据ready、技术可行三者交叉的场景。
百度文库和网盘联合推出的GenFlow 1.0在今年8月官宣中文名“库库AI”并上线独立端,以通用AI Agent形态切入写论文、做PPT、生成行业报告等任务。
推荐理由:百度文库网盘把十余年内容资产转成AI上下文,并披露库库AI企业版3000家试用与出海路径,可看办公智能体的竞争变量。
DeepSeek 将算子开发产品 TileLang 官宣原生支持华为昇腾 950 NPU,并同步推出 DeepGEMM、DeepEP、FlashMLA、TileKernels、DeepSelect 五大核心计算与通信库的昇腾版本。
推荐理由:原文梳理了 TileLang 原生支持昇腾 950 的架构设计与基准数据,可据此判断国产算子工具链的跨平台适配路径。
OpenAI 宣布与美国 SBDC 合作,为小企业扩大实操性 AI 培训与本地支持,同时发布一份关于小团队如何使用 AI 的新报告。
推荐理由:OpenAI 与美国 SBDC 合作向小企业提供 AI 实操培训,并同步发布小团队使用 AI 的报告。
雷锋网分析指出,Personal Agent 正成为 AI 产品竞争的新方向:Meta 的 Muse 截至 9 月下旬下载量突破 300 万,OpenAI 于 9 月 29 日发布长期在线的个人 Agent 产品 dots,Manus 于 9 月 28 日推出独立应用 Cue,千问、豆包(代号 Spell)、腾讯(代号 Handy Bot)也在跟进。
推荐理由:文章梳理 Personal Agent 集中爆发的产品节奏,并指出平台授权与超级 App 生态是这类产品落地的主要阻力。
作者在 Claude Code 中用同一任务实测同日发布的 Qwen3.8-Flash 与 GLM-5.3-Flash,要求从零开发一个含任务、日程、笔记、Dashboard 和全局搜索的个人工作台。
推荐理由:同一任务下对比两款 Flash 模型的办公工作台开发表现,并给出任务成本估算,可作选型参考。
OpenAI 于 8 月 19 日正式开源 Codex Harness,开放的是支撑 Codex App、CLI 和 IDE Extension 的 Agent Loop,开发者可通过 SDK 和 App Server 接入任务管理、工具调用、事件回传与人工审批。
推荐理由:借 Codex Harness 开源与一次 20 分钟实测,讨论技术领先为何难以成为护城河,以及开源换分发的路径。
雷锋网用同一道长任务对比 OpenClaw v2026.7.1-2 与 v2026.8.1(2.0),两版总耗时基本持平(103.3 分钟对 106.1 分钟),但 2.0 的 LLM 请求从 74 次降到 46 次、工具调用从 100 次降到 65 次。
推荐理由:同一道长任务对比 OpenClaw 1.x 与 2.0,给出请求次数、token 与上下文压缩的后台数据,可判断其长任务托管能力。
雷锋网把 AgnesCode + Agnes 3.0 Flash 与 Codex + GPT-5.6 Sol 放进众智 FlagOS 开放计算全球大赛的 DeepSeek-V3 解码阶段融合 QKV-A 下投影算子题(Task66: dsv3_fused_a_gemm),在 8 款芯片上接受赛事官方自动化评测。
推荐理由:雷锋网用同一道算子优化题对比免费 AgnesCode 与付费 Codex,给出跨芯片加速比与耗时数据,可作 Agent 底层工程能力的参照。