2026-09-08
1. GitHub 推出 Project HydraFusion:多模型编排让编程智能体成本降 36%–67%
9月4日,GitHub 在 Copilot CLI 中以研究预览形式上线 Project HydraFusion,可针对编码任务动态编排多个 AI 模型,提供三种执行模式:Single(单一模型执行)、Cascade(廉价模型先试、质量不足再升级强模型)、Critique(一模型写码、二模型评审后修订)。GitHub 称其在 TerminalBench 2.1、DeepSWE、CheckpointBench 三项基准上与 Claude Opus 5 持平或更优,而预估 token 成本降低 36%–67%,通过 /experimental 命令在 CLI 中调用,不单独计费。
值得关注:多模型路由(按任务复杂度选择/升级模型)正成为编程智能体的核心竞争力——’用对模型’比’用最强模型’更省钱。这标志着 coding agent 从单模型竞争转向编排层竞争,对成本敏感的中小团队尤其关键。
2. AEO 概念兴起:三大 Coding Agent 工具选择一致率仅 42%
9月3日,Armature 发布大规模实测:在 16,893 个会话中,Claude Code、Codex、Cursor 三个智能体仅在 42% 的场景选择同一工具。研究据此提出 AEO(Agentic Engine Optimization,智能体引擎优化),主张产品文档应当面向 Agent 而非人类优化——例如提供 llms.txt、skill.md、暴露 Token 预算等,让智能体能更准确地调用产品能力。
值得关注:当智能体成为产品的主要’使用者’之一,优化对象从’人读文档’扩展到’机读文档’。AEO 与 SEO 类似,可能催生面向 Agent 的文档标准与工具链,是开发者生态的新变量。
3. SWE-Bench ProMax 发布:仓库级重构最佳解决率仅 41.2%
本原智数与 SWE-Bench 团队(已被 COLM 2026 接收)推出面向大规模多语言代码重构的基准 SWE-Bench ProMax v1,包含 170 个真实 GitHub 任务,覆盖 7 种语言,平均需修改 11.4 个文件。实测显示前沿模型的最佳解决率仅 41.2%,揭示仓库级工程能力仍远未饱和。
值得关注:此前 benchmark 多聚焦单文件/小改动,ProMax 把难度拉到’跨文件、多语言、仓库级重构’,量化了当前智能体的真实天花板,也提示企业在引入 coding agent 时应设定合理预期、保留人工审核。
4. 智平方 AlphaBot O1 登顶中博会’十大最受欢迎新品’榜首
9月3日至6日中博会上,深圳具身智能企业智平方携新一代全身协同通用智能机器人 AlphaBot O1 亮相,以最高得票斩获’十大最受欢迎新品’。该机器人由具身大模型 AlphaBrain 驱动,结合双臂力控与全身协同,可在开放动态环境中完成跨空间、长序列精细操作,并原创类脑 VLA 模型 NeuroVLA;其生产力型通用机器人已在半导体显示、汽车制造、生物医药、公共服务、新零售等场景真实落地。
值得关注:AlphaBot O1 代表的不是’会不会动’,而是’能不能在真实世界干活’。通用机器人在多行业真实产线落地,说明具身智能正从演示走向生产力,’大脑先行’路线得到市场验证。
5. 世界模型四大流派成型,真机数据成具身智能新战场
9月7日中新社报道,毕马威近期报告将全球世界模型归纳为四大技术架构:表征式(回答’世界是什么’)、生成式(Sora/Genie,回答’世界会变成什么’)、交互式(回答’改变世界会发生什么’)、理解-生成-预测一体化(Kairos 3.1、Cosmos 3 等)。同期智元发布 AGIBOT WORLD 2026 第三期开源强化学习数据集,覆盖示教到部署各阶段,并标注进度、错误、成功与干扰等关键信息,供研究者训练过程级奖励模型。
值得关注:世界模型技术路线从’多流派混战’走向可归类的格局,而高质量真实交互数据被公认为落地瓶颈。’模型架构 + 真实数据闭环’正成为具身智能竞争的核心,数据基建赛道价值凸显。

