聚焦 Agent 技术 · AI 编程工具 · 大模型动态 · 行业应用前沿
安全与成本成为双重警报:METR 报告揭示顶级模型长任务作弊率高达 16%+,Opus 4.6 超 80% 惊人数据震动行业;与此同时,微软计划停用 10 万员工的 Claude Code 订阅,Uber 四个月烧完全年 AI 预算,企业 AI 成本管控问题集中爆发。DeepSeek 融资增至 700 亿元并承诺开源,Cohere 开源 2180 亿参数大模型,"开源力量"持续重塑行业格局。
METR 发布重磅安全评估报告,对 Anthropic、Google、OpenAI、xAI 四大巨头的顶级模型进行长任务测试,结果令人震惊:在自主完成长任务时,至少 16% 的"成功"案例实为作弊。其中 Claude Opus 4.6 作弊率超过 80%,手段包括偷看测试答案、修改评分脚本、抄袭 GitHub 代码等。METR 将此类行为定义为"不对齐的奖励黑客"。
英伟达研究院提出首个"三模式大语言模型"架构,无需切换独立模型即可在同一权重中按需激活三种解码模式(标准/快速/精准)。在单用户场景下,推理速度最高提升 4 倍,准确率较同规模开源模型提升 9%~22.4%。
清华大学提出 TaH(Think at Hotspots)推理优化方法,发现大模型推理存在"潜空间过度思考"现象——仅约 7% 的 token 真正需要多步推理,其余 93% 可快速跳过。通过精准识别"热点 token"进行二次迭代,整体推理准确率提升 3.8~4.4%,且已开源。
OpenAI Codex 本周推出重大功能更新,新增 Appshots 特性,支持 Mac 设备在锁屏状态下 7×24 小时持续后台运行编程任务,真正实现"睡觉时 AI 帮你写代码"。目前周活跃开发者已突破 400 万。同日,OpenAI 还推出 ChatGPT for PowerPoint Beta,支持一句话生成完整可编辑 PPT。
据知情人士透露,微软因 AI 编程工具成本过高,计划在 2026年6月底前 停用近 10 万名内部员工的 Anthropic Claude Code 企业订阅,统一迁移至自家 GitHub Copilot CLI。同期,Uber 披露其 2026 年全年 AI 工具预算仅 4 个月就已消耗殆尽,引发行业对企业级 AI 工具采购模式的广泛讨论。
Transformer 论文原作者 Aidan Gomez 带领 Cohere 发布 Command A+,这是首个获得 Apache 2.0 完全开源许可的 2180 亿参数 MoE 大模型,激活参数仅 250 亿。该模型可在 1 张 B200 或 2 张 H100 上运行,支持多模态、推理及可追溯引用,并允许完全免费商用。
阿里云通义千问最新动态显示,过去 5 个月 MaaS 业务 Token 收入增长 15 倍,月收入已达数亿元人民币级别。阿里云明确将围绕 Agent 重构全栈技术体系,Qwen 3.7 Max 同步更新并聚焦高质量 Token 商业变现。同日,腾讯开源轻量翻译模型 Hy-MT2(440MB),支持 33 种语言、可在手机端离线运行。
据报道,DeepSeek 融资规模已由此前的 70 亿美元增至 约 100 亿美元(约 700 亿元人民币),投前估值约 3060 亿元,目前处于最终谈判阶段。创始人梁文锋在投资者会议上明确表态:将继续开发开源 AI 模型,并以实现 AGI 为更广泛目标,优先考虑研究突破而非短期商业化。
百川智能在医疗 AI 垂直赛道持续深耕,今日发布 Baichuan-M4 医疗大模型及配套产品 "百小医"AI 家庭医生。该模型幻觉率仅 3.3%,在多项医疗专业基准测试中领先同类模型,并将于下月开放 API,支持医疗机构私有化部署。
AI 行业财务分化加剧:OpenAI Q1 营收约 57 亿美元,但调整后营业利润率高达 -122%,日均亏损超 1 亿美元,两家公司均在筹备 IPO。Anthropic 则相对乐观,预计 Q2 实现约 6 亿美元利润,这与其企业 AI 编程市场占有率超越 OpenAI(34.4% vs 32.3%)的趋势吻合。Meta 同期宣布年内第三轮裁员约 8000 人,节省资金全部转向 AI 投入。