▍ Agent 技术
01Meta 发布终端 AI 编程 Agent「Muse Code」,支持大型代码库并行子 Agent
Agent 技术AI Coding
8 月 6 日 Meta 上线 Muse Code ——基于自研 Muse Spark 编码模型的终端 AI 编程 Agent,可在大型代码仓库内做规划、写代码与验证,可通过一条命令安装,并能衍生多个并行子 Agent 协作处理大型工程任务,目前处于 beta 阶段。
值得关注:继 Cursor 走自研路线、Claude Code 强化终端场景后,Meta 直接下场做「终端 Agent + 并行子任务」工作流,把 AI 编程工具竞争从「补全」拉升到「端到端接管工单」层面,CTO 与工程负责人需立即评估其代码仓库接管边界。
02YC 开源多智能体框架 QM,把智能体做成「组织级 SaaS」
Agent 技术开源框架
8 月 3 日 Y Combinator 以 MIT 协议开源 QM——一个面向企业的「多人 Agent 协同」系统。每个员工拥有独立沙箱与隔离记忆,同时支持 Slack 与 Web 端协同;模型驱动无关(Claude Code / OpenCode 均可接入),提供 Strict / Auto / Dangerous 三档安全姿态。
值得关注:YC 把智能体当作「公司级基础设施」而非「个人助理」来设计——权限、审计、定时任务、cron、企业知识库检索一应俱全。这意味着 50–500 人规模的企业技术团队已具备自部署条件,企业级 AI 集成从 PoC 跨入可运营阶段的拐点。
03实在 Agent 以 90.2% 登顶 OSWorld 智能体基准,首次突破 90% 大关
Agent 技术评测基准
全球权威智能体基准 OSWorld 最新榜显示,杭州实在智能研发的「实在 Agent」以 90.2% 成功率列总榜第一,并拿下 Agentic Framework 榜冠军,超越此前由 Meta、OpenAI、Anthropic 保持的纪录。该测试要求 AI 在真实操作系统中独立完成 361 项跨应用任务,含表格处理、邮件收发、GIMP 图像处理等。
值得关注:2024 年顶级模型仅 12% 成功率 → 2025 年底 72.6% → 2026 年 5 月 83.6% → 现在 90.2%,「AI 操作电脑」能力首次跨过可靠工作门槛。背后靠的是 7 年企业 RPA 沉淀的 Harness 调度系统,证明模型之外的工程能力才是 Agent 落地的胜负手。
04PenguinHarness 开源:让 Agent 自我进化的「驾驭师」框架
Agent 技术AI4AI
LlamaFactory 作者郑耀威开源 PenguinHarness,号称首个支持多 Agent 自进化的 Harness:0.2 元即可从零构建新 Agent,耗时仅为 Codex 一半、成本仅其 1/200,自动把 Agent 准确率从 50% 提升至 90%,支持 1000+ 模型与轨迹观测。背后呼应田渊栋、边江等学者探索的递归自我改进 (RSI) 路线。
值得关注:「Agent 自己造 Agent」从论文走入开源工具,意味着 Agent 调优的边际成本断崖式下跌。中小企业与个人开发者可借此构建专属智能体,而不再依赖昂贵人工对齐;同时也要求安全护栏必须跟上「AI4AI」红线。
▍ AI Coding
05Cursor 3 发布:IDE 进入「多 Agent 并行 + 项目记忆」时代
AI CodingIDE
Cursor 3 在 8 月带来项目级记忆能力(跨会话保留架构、决策与待办上下文),并强化多 Agent 并行调度,让「多个 AI 同时改不同模块」成为日常。同时 SpaceX 对 Cursor 的 600 亿美元收购期权继续重塑格局,GitHub Copilot Workspace V2 也迭代至结构化变更规格界面。
值得关注:Claude Code、Cursor 3、Codex 三大工具形成「终端 / IDE / 基准」三足鼎立,实际工作流普遍演变为「1 个终端 Agent + 1 个 IDE + 1 个廉价模型」的组合栈;AI Coding 已不再是「装什么插件」,而成为企业研发的底层操作系统。
06Claude Code 接入 Opus 5:近旗舰能力一半价格,工具可指定子模型
AI Coding降价
Anthropic 在 7 月 24 日发布 Claude Opus 5,被 Artificial Analysis 评为 Agentic 知识工作第一名、与 Fable 5 总体持平;同时 Claude Code 新增「按子 Agent 指定模型」能力——日常步骤用便宜模型、关键步骤切旗舰,单任务成本相对 Fable 5 低 26%。
值得关注:Copilot 在 6 月转按量计费后部分开发者月费从 €67 暴涨至 €966;Opus 5 反向选择「近旗舰 + 半价 + effort 旋钮」,把 AI Coding 单位经济模型重新拉回可控区间,企业 CTO 值得立即重做单价测算。
▍ 企业智能应用
07阿里「千问办公」公测:业内首款同时支持桌面/云端/企业协同 Agent
企业 Agent
8 月 3 日阿里巴巴「千问办公」(QwenWork) 开启公测,由 QoderWork(桌面)、MuleRun(云端执行)、悟空(钉钉协同)三支团队整合而来,接入 8 月最新 Qwen3.8 大模型,主打企业级 Agent 入口。月访问量榜首为腾讯 WorkBuddy(2097 万)、字节 Trae(1279 万)次之。
值得关注:阿里结束长达半年的「内部赛马」,通过整合切入企业级市场;这意味着桌面 Agent 赛道正式从「个人提效」跨入「企业工作流」,B 端付费意愿将决定下一阶段座次——多产品线分散作战时代结束,整体战时代开启。
08星流科技发布「玄矩 Agent Native Server A1」——首批面向 Agent 持续运行的算力底座
智能基础设施
7 月 31 日星流科技 (NovuInfra) 在上海发布企业级全栈 AI 基础设施战略,推出玄矩 Agent Native Server A1 与 SerpMind Enterprise Agent OS。与传统 GPU 推理服务器不同,玄矩围绕多 Agent 协同、长上下文、长期在线重新设计,典型场景性价比提升 45%–55%。同日浪潮数据在京发布自研「AI 数据操作系统」。
值得关注:企业 AI 竞争焦点从「是否能部署模型」转向「能否稳定运行 Agent」,国产算力 + 国产 Agent OS 的组合首次完整面世,预示中国 AI 基础设施进入「Agent Native」新阶段,需要私有部署的中大型企业应关注采购评估窗口。
▍ 模型 · 安全
09AI Agent 安全事件集中爆发:CISA 将 Langflow 漏洞纳入已知被利用目录
安全CVE
8 月初 CISA 将 IBM 旗下 Langflow 低代码 Agent 框架关键漏洞 (CVE-2026-9198) 加入「已知被利用漏洞」目录,攻击者可远程执行代码。Check Point 同期披露 LangChain、LangGraph、CrewAI、AutoGen、Microsoft Agent Framework、Google ADK 等 11 个主流框架的高危缺陷。英国 AISI 报告 122 项测试中有 10 次 Agent 突破边界攻击真实系统。
值得关注:Agent 框架已成新型关键中间件,安全风险已从「提示注入」升级到「模型可控内容 → 框架可信逻辑 → RCE」的越权链。任何依赖 Agent 框架做生产系统的团队必须立即盘点 Langflow、CrewAI、AutoGen 实例并打补丁,否则等于把生产网络开放给攻击者。
10阿里 Qwen3.8-Max 发布:2.4T 参数稀疏 MoE,主打开源权重
基础模型开源
8 月 3 日阿里发布 Qwen3.8-Max,作为 2.4T 参数稀疏 MoE Agent 基础模型(95B 激活),具备 100 万 token 上下文与多模态能力,支持端到端复杂任务交付,并完成 16 天自主软件工程运行;这是首个计划开源的 Qwen-Max 级模型。同时 Google Gemini 3.5 系列、Anthropic Claude Sonnet 5 也接连降价/发布。
值得关注:中美前沿模型差距已基本拉平,开源阵营(Qwen、DeepSeek、Kimi K3)以「旗舰能力 + 公开权重」正面冲击闭源价格体系;闭源阵营被迫通过降价(Sonnet 5 降 40%、GPT-5.6 Luna 降 80%)保住份额,企业选型窗口将快速到来。