2026-09-11
1. Cognition 发布 SWE-2 编程模型:基于 Kimi K3 后训练,性价比逼近前沿
Cognition(Devin 背后公司)于 9/10–9/11 发布新一代编码模型 SWE-2,基于月之暗面 Kimi K3(2.8T 参数开源基座)做强化学习后训练,单次 RL 同时训练低/中/高多档推理力度。在 FrontierCode 1.1 Main 评测上取得 50.0%,与 Anthropic Fable 5.1(50.9%)仅差 0.9 个百分点,而算力成本降低约 64%–70%;对比 GPT-6 Astra(53.3%)约为其 1/4 价格。medium 档较上代 SWE-1.7 减少 58% 交互轮次、成本降 81%,首次代码改动中位数从 48 步降到 18 步。模型直接并入 Devin 订阅(Desktop/CLI/Web/Fusion),Pro+ 用户本月免费使用。注:在更难的 Terminal-Bench 4 上仅 27.3%,仍明显落后于前沿模型(Fable 5.1 为 55.8%)。
值得关注:「近前沿能力 + 远低于前沿的成本」重新定义 coding agent 性价比基线,且以开源基座(Kimi K3)后训练的路径证明中小团队也能挤出帕累托前沿。对选型而言,日常工程任务可优先评估 SWE-2,超难 agentic 任务仍留给 Fable/Astra;同时也显示国产基座正成为海外产品的训练底座。
2. Cursor Projects 上线:编码 Agent 从单次对话转向常驻协调线程
Cursor 于 9/11 推出 Projects:不再为每项任务单独开聊天,而是在一条持久线程里与「协调 Agent」协作。该 Agent 可常驻在线、自主调度子代理(sub-agent)、并随任务推进持续改进工作方式;用户可把全部对话收进同一 Project 统一管理。同日社区实测反馈认为这是目前最易整理、最好看的 AI 编程界面,并预测其他工具会跟进。
值得关注:标志 coding agent 产品范式从「一问一答/单会话」走向「常驻、可编排、带记忆」的托管协作体,与下方 OpenAI Agents API 同一趋势(见第 3 条)。对团队意味着 Agent 开始像长期同事而非一次性助手,工程组织的协作形态与权限/审计边界需要同步重构。
3. OpenAI Agents API 开放公测:把托管 Codex harness 做成云端基础设施
OpenAI 于 9/10 宣布 Agents API 公测,复用 Codex 背后的智能体执行框架,开发者一次 API 调用即可创建生产级智能体:在云端运行代码、处理文件、保存中间结果、执行跨数小时至数天的任务。OpenAI 负责维护执行框架与编排,开发者只定义差异化工具/知识/工作流。配套推出 Hosted Sandbox(免自建沙盒,复用 Codex/ChatGPT 同款隔离基础设施);支持上下文自动压缩以跨越多个上下文窗口;多智能体可并行最多 3 个子 Agent 由主 Agent 协调汇总;已与 Cloudflare、Modal、Vercel、E2B、Oracle 等 9 家合作提供异构算力。
值得关注:模型商把「agent 运行时」从工具功能升级为平台级基础设施,开发者不再各自搭沙盒/编排/长会话管理——这与 Cursor Projects 的常驻协调、Claude Code 的 Managed Agents 共同指向「托管 harness 化」。对架构选型意味着自研 agent 编排的必要性下降,可更多依赖平台托管,但需评估厂商锁定与长期成本。
4. 工信部、国资委启动实景实训专项行动,具身智能从「重展示」转向真实作业
据经济日报 9/11 报道,工信部、国资委已启动人形机器人与具身智能实景实训专项行动,推动重点产品开启「作业模式」,强调产业竞争正由单一整机突破向「模型—数据—本体—制造」协同发展转变,要求防止重展示轻应用、重数量轻质量。同期(9/9–12)2026 外滩大会上超 40 家具身厂商集中亮相,叙事从跑跳演示转向「真干活」:蚂蚁灵波×国大药房「机器人智慧药房」已在零售店真实落地(窄通道 80cm、透明/反光干扰下自主拣药),擎朗人形进入香格里拉等酒店做迎宾/洗衣,眸深轮式双臂在产线完成螺栓拧紧等精密装配。
值得关注:政策与场景双轮把行业推过「展示期」进入「作业期」,真实场景数据闭环成为胜负手(与外滩大会「一脑多机」、车间自然产生「为什么失败」数据的主张一致)。对本体厂与大脑厂而言,能进真实产线/门店持续产出高质量数据者将拉开身位,纯 demo 型团队窗口收窄。
5. 具身智能抵达商业化临界点,但约 70% 产品需重构、产业链开始细分退出
GEIA GBA 2026 粤港澳大湾区具身智能创新周(9/9–11,深圳)上,万拿、星联未来、慧仑、灵御等企业展示差异化落地路径,共识是「立足特定场景创造可量化价值」才是核心,行业告别 Demo 内卷。赛迪研究院在京东全球科技探索者大会分论坛指出:行业营收「十四五」年均增速近 25%、突破 3000 亿元,但约 70% 产品落地需深度重构,数据/模型/应用为必须翻越的「三座大山」,具身模型「GPT 时刻」最乐观仍需 3–5 年。另一方面,速腾聚创拟以 5987.8 万元出售其具身机器人整机业务,反映部分企业退出整机赛道、聚焦核心零部件与感知方案,产业链分工正在细化。
值得关注:行业进入「商业化临界」与「落地重构」并存的阶段:市场空间确认、但工程化门槛高,资本与资源正从「整机同质化」向「核心零部件/数据/大脑」等关键层收敛。对投资与选型而言,具备可量化场景交付、且占据数据或核心部件卡位的企业更抗周期,纯整机组装叙事的估值承压。
