AI Daily · 日报

AI 前沿动态

📅 2026年7月25日 · 周五 🎯 AI Coding · Agent 智能应用 · 大模型
💻 3 AI Coding
🤖 3 Agent 智能应用
🧠 3 大模型 & 平台

💻 AI Coding

01
AI Coding 战争转向"额度战":OpenAI Codex 取消5小时限制,Anthropic 延长 50% 加码
AI Coding 🔥 竞争白热化
7月12日同一天,AI 编程工具市场迎来罕见的"额度大战"。Anthropic 宣布 Claude Code 周用量 50% 加码延长至 7月19日,Claude Fable 5 免费使用同步延期;几小时后,OpenAI Codex 工程主管宣布临时取消 Plus/Business/Pro 方案的 5 小时用量限制,并为 50 万用户补发 banked reset。更令人瞩目的是,OpenAI 将额度战变成了增长叙事:12日 600万用户重置配额,13日 700万时全员补发,14日 800万时再次重置。分析指出,用户讨论最多的话题并非代码质量,而是定价和速率限制——"额度表决定了日常忠诚度"。
📌 为何关注:AI Coding 工具竞争正从模型能力转向"能否让用户真正把 Agent 放进日常工作流"。额度限制是制约大规模采用的关键瓶颈——谁能提供更宽松的使用体验,谁就能锁定开发者。这场额度战也暗示:顶级模型的代码质量已趋于收敛,差异化来自工程体验和商业策略。
02
Coding Agent 集体加装"刹车":Claude Code/Codex/GitHub Copilot 一周内密集发布安全护栏
AI Coding 安全治理
7月第二周,AI 编程工具的发布主题出奇一致——不是更强的代码生成,而是更严的安全控制。Claude Code v2.1.211 修复了权限预览中的 Unicode 双向覆盖欺骗漏洞(防止工具输出伪装审批信息),并封堵了 auto mode 绕过 PreToolUse hook 的路径;OpenAI Codex v0.144.5 扩展危险命令检测范围,捕获更多 rm 强制删除变体;GitHub Copilot CLI 在 plan 模式下硬阻止工作区文件变更。OpenCode v1.18.2 则默认禁止子 Agent 递归嵌套。同期还发生了 AsyncAPI npm 供应链攻击事件——攻击者通过篡改构建管道发布木马包,恰好印证了 Agent 安全护栏的必要性。
📌 为何关注:当 Agent 从"辅助编码"走向"自主执行 Shell 命令和文件操作",安全不再是一个可选项。三大工具同时收紧护栏,标志着行业共识:Agent 的信任问题已经从"代码写得好不好"转向"执行动作是否可信任"。对于在生产环境中部署 Coding Agent 的团队,这一周的更新必须跟进。
03
从 Coding 到 Anything:Agent 正在重写工作流,阿里巴巴 Qoder Desktop 多 Agent 协作落地
AI Coding 工作流重构
在 2026 AICon 上海站,阿里巴巴高级技术专家左志鹏分享了 Qoder Desktop 从辅助编程到自主交付的演进路径。现在的 Coding Agent 已不再只是代码补全:接到任务后可先做方案调研→生成 SPEC→编码→编译→启动→测试→验证→自审代码质量,人的角色从"盯着改每一行代码"转变为"定义目标、判断关键方案、确认最终结果"。更关键的是,这套在代码场景中被验证的 Agent 工程能力,正在自然延展到文档生成、数据分析、企业运营、流程自动化等更广泛的工作场景。
📌 为何关注:"AI Coding 的瓶颈已经不是模型能不能生成更好的代码,而是能不能形成一套稳定、可控、可交付的任务系统。"这个判断精准描述了当前阶段的核心矛盾。Qoder 的实践为国内企业提供了可参考的 Agent 工程化路径,从 Coding 到 Anything 的扩展逻辑也预示着 Agent 市场的下一波增长方向。

🤖 Agent 智能应用

04
腾讯/阿里/字节集体收拢 Agent 战线:赛马结束,超级工作台入口争夺战全面开打
Agent 应用 🔥 行业整合
本周,中国三大互联网巨头几乎同时启动 Agent 产品线战略收拢:腾讯将 QClaw 产品中心并入云产品六部,与 WorkBuddy 归属同一部门(WorkBuddy 6月访问量达 2097 万次,超过第二、三名之和);阿里计划推出"千问办公",将 QoderWork、悟空、MuleRun 三款产品合并,由钉钉新任 CEO 陈宇森负责;字节将 TRAE SOLO 更名为 TRAE Work,并讨论豆包办公与飞书的深度整合。这标志着 Agent 行业从百花齐放的"赛马"阶段进入收敛资源、抢夺核心入口的新周期。更深层的共识是:AI 的真正大市场不是千万级开发者,而是数十亿职场人的通用办公场景
📌 为何关注:大厂集体收拢战线是一个强烈的信号——Agent 产品已经从"做不做"转向"怎么打"。腾讯 WorkBuddy 以 2097 万月访问量领跑,证明"非程序员 AI 工作台"赛道已被验证。三家策略分化(腾讯矩阵+生态、阿里统一入口+钉钉、字节多入口+飞书)将决定未来办公 Agent 市场的竞争格局,值得持续跟踪。
05
WAIC 2026 开幕:Agent 从"能说"到"会干",企业级部署进入核心业务场景
Agent 应用 产业落地
2026 世界人工智能大会(WAIC)7月17-20日在上海举行,超 1100 家企业参展、300 余项全球首发。大会叙事主线从"大模型能做什么"彻底转向"Agent 正在哪里产生价值"。亮点包括:阿里云发布 Agent Native Cloud 及无影 Agentic Computer(7×24 小时数字工位);腾讯 WorkBuddy 现场演示多 Agent 协同;企业微信 Agent"大圆"首秀;容联云 VoiceAgent 日均 2 万通电话、完成率 94%;壹沓科技发布小沓 OS/KE 技术底座,聚焦全球供应链 Agent 化。PPIO 则发布智能模型网关,提出"Agent 生产力 = Token 智能密度 × Agent Loop 时长"公式。
📌 为何关注:WAIC 是观察中国 AI 产业方向的最重要窗口。今年展会最核心的信号是:Agent 已从概念验证进入"对业务结果负责"的生产阶段。VoiceAgent 日均 2 万通话、私域运营 Agent 管理 8 万客户撬动 87% 增长——这些数据证明 Agent 不是噱头,而是真正在创造可量化的商业价值。
06
Cursor 秘密研发通用 Agent「Sand」:AI 编程工具集体转向非开发者市场
Agent 应用 战略转向
据 The Information 报道,AI 编程工具 Cursor(ARR 超 20 亿美元,67% 财富 500 强在用)正在内部开发一款代号 "Sand" 的通用 AI Agent,目标是对标 Anthropic 的 Claude Cowork 和 OpenAI 的 ChatGPT Work。Sand 面向非开发者,可处理邮件、短信、表格等日常办公任务。6 月底已内部灰度上线。但 SpaceX 600 亿美元收购 Cursor 的交易可能影响 Sand 的最终走向。与此同时,Claude Cowork 已扩展至网页端和移动端,支持跨设备后台运行;ChatGPT Work 也于 7月9日推出,Chat/ChatGPT Work/Codex 三大模式统一整合进桌面应用。
📌 为何关注:AI 编程工具厂商集体从"服务开发者"转向"服务所有上班族",是今年最重要的产业趋势之一。Anthropic 数据显示,Claude Cowork 90%+ 的使用场景并非编码,而是商业运营和内容创作。当这个市场的规模从 3000 万开发者扩展到数十亿职场人,竞争逻辑将彻底改变——WorkBuddy 2097 万月访问量的领先优势,在这个更大的坐标系下只是一个开始。

🧠 大模型 & 平台

07
Moonshot 发布 Kimi K3:2.8 万亿参数全球最大开源模型,多项基准逼近闭源顶级水平
大模型 🔥 开源里程碑
7月16日,月之暗面(Moonshot AI)发布 Kimi K3,2.8 万亿参数 MoE 架构(896 专家/每 Token 激活 16 个),100 万 Token 上下文窗口,原生多模态视觉理解,成为全球最大开源模型。在 GDPval-AA v2 真实任务基准上得分 1687,仅次于 Claude Fable 5 Max(1815)和 GPT-5.6 Sol Max(1748),超越 Claude Opus 4.8(1600)。在 BrowseComp 长程信息检索中更是以 91.2/100 夺冠。API 定价 $3/$15 每百万 Token,权重将于 7月27日全面开源(Apache 2.0)。模型已实现 48 小时自主芯片设计等长程技术任务。
📌 为何关注:一个开源模型在真实任务基准上逼近甚至在某些维度超越闭源顶级模型,是 AI 民主化的里程碑事件。对国内 AI Coding 生态而言,Kimi K3 的 100 万上下文 + 开源权重意味着可以本地部署一个接近 GPT-5.6 水平的编程 Agent,不再依赖海外 API——这对于企业数据安全和成本控制具有战略意义。
08
腾讯混元 Hy3 正式发布:295B MoE 架构,Agent 任务解决率跃升至 90%,Apache 2.0 开源
大模型 Agent 底座
7月6日,腾讯混元 Hy3 正式发布,距离姚顺雨主导的架构重建仅 201 天。Hy3 采用 295B 总参数 / 21B 激活参数 MoE 架构,256K 上下文,快慢思考融合。在 270 位专家基于真实工作的盲测中(2.67/4)优于 GLM 5.1(2.51/4)。关键数据:WorkBuddy 上任务成功率从 72% 升至 90%,平均耗时缩短 34%;Marvis Agent 任务完成率达 93.7%。定价极低:输入 1 元/百万 Token,输出 4 元。Apache 2.0 开源,已在 HuggingFace 和 ModelScope 上线。
📌 为何关注:Hy3 以仅 21B 激活参数对标数倍于己的旗舰模型,是"小模型大能力"路线的成功案例。更重要的是,它已在 WorkBuddy 和 CodeBuddy 中大规模生产验证——90% 的 Agent 任务成功率是真实业务数据而非实验室 benchmark。对于国内 Agent 开发者,Hy3 提供了性价比极高的开源底座选择。
09
Claude Cowork 扩展全平台 + 进入政府市场:Agent 从桌面走向全天候跨设备运行
平台升级 Agent 进化
Anthropic 7月连续发布两项重大更新:① Claude Cowork 扩展至网页端和移动端,支持跨设备会话同步、后台持续运行(合上电脑任务不中断)、定时任务调度。Anthropic 数据显示,Cowork 使用中 90%+ 并非软件开发,而是商业运营和内容创作。② Claude Code 和 Cowork 进入政府市场——通过 FedRAMP High 授权环境为美国公共部门提供服务,配套部门级管理、审计日志和硬预算上限。同步宣布 Cowork 使用额度翻倍延长至 8月5日。
📌 为何关注:Claude Cowork 从桌面扩展到全平台 + 进入政府市场,标志着 AI Agent 正在从"开发者玩具"进化为"企业级基础设施"。90% 非编码使用场景的数据证明:Agent 的真正主战场不是编程,而是所有知识工作者的日常办公。FedRAMP High 认证也意味着 Agent 在合规和安全层面已达到政府级标准——这是整个行业走向主流采用的关键信号。