返回往期
2026年9月15日星期二
10 点要闻3 分钟阅读

今日要闻

1

Apple发布新版Siri AI,基座引入Gemini

AI产品多模态Apple

Apple正式推出重构后的Siri AI,运行于结合Google Gemini开发的Apple Foundation Models,新增跨信息、邮件和照片的个人上下文理解、屏幕感知、应用内操作、Camera Siri及独立Siri应用。首批以英语测试版登陆iOS 27、iPadOS 27、macOS 27、watchOS 27和visionOS 27,暂不覆盖欧盟与中国,并首次引入AI功能用量限制及未来付费安排。

阅读原文
2

Anthropic称7家中国实验室蒸馏Claude,交互超1.9亿次

AI安全模型蒸馏供应链

Anthropic九月威胁报告称,7家中国实验室开展了Claude蒸馏活动,其中5家的已披露交互量合计超过1.9亿次。报告称阿里巴巴在5月至7月通过逾3500个欺诈账户完成超过1.51亿次交互,峰值接近每日300万次;Moonshot和DeepSeek还被指将用户请求转发至Claude Opus,智谱则因安全限制转向防护更弱的模型。上述结论来自Anthropic单方调查。

阅读原文
3

Anthropic重构CI系统,将测试周期从70天降至1天

AI编码工程效率测试

Anthropic披露内部测试影响分析的规模化案例:工程师每季度交付代码量达到此前的8倍,其中约80%由Claude编写,六个月内CI任务量随之增长25倍。原有测试基础设施由此形成明显瓶颈;一名工程师用三周完成关键重构,把完整测试周期从约70天压缩至1天。该案例显示,AI编码提高产出后,测试调度、依赖分析与持续集成容量会成为新的工程约束。

阅读原文
4

Reward AI发布OM-1,机器人无需遥操作数据即可迁移

具身智能机器人基础模型

Reward AI推出OM-1机器人基础模型,训练数据直接来自人类操作过程,不依赖遥操作或既有机器人经验数据。团队称该模型能够零样本迁移至桌面机械臂、工业机械臂和人形机器人,并可在不同硬件形态上执行操作任务,目标是降低具身模型收集专用机器人数据的成本。现有材料尚未给出训练规模、完整基准、部署价格或开源许可,实际泛化能力仍需独立测试验证。

阅读原文
5

Google发布ToolGrad,工具数据生成成功率达99.8%

研究工具调用数据生成

Google Research发布ToolGrad,用「先构造并验证API调用链、再生成用户问题」的答案优先流程替代传统的先写请求、再让智能体寻找路径。该方法在覆盖1.6万个真实API的数据生成中取得99.8%成功率;仅使用其中500个样本训练的Gemma 3 12B,在包含未见API的工具使用测试上匹配Gemini 2.5 Pro。其核心价值是减少无效轨迹,并提高训练数据的可验证性。

阅读原文
6

Real-SWE测试私有企业代码,最高解决率仅38.8%

基准测试AI编码企业软件

Real-SWE推出面向真实软件工程环境的评测,使用获许可的私有生产代码库,包含无法从公开训练数据恢复的业务规则和公司特定编码约定。评测覆盖10项任务和640次运行,最佳模型与Harness组合仅解决38.8%的任务,其中6项任务平均解决率低于15%。分析显示,遗漏需求、未经验证的假设及对私有系统理解不足是主要失败原因,凸显公开代码基准与企业开发之间的差距。

阅读原文
7

Salesforce推出企业AI Harness,统一管控智能体

企业AI智能体治理

Salesforce发布Enterprise AI Harness,将六项可信能力与AI Control Plane组合为可组装架构,用于统一管理企业内部的智能体和其他AI系统。平台把开放式模型推理与企业数据、安全策略、治理要求及业务规则连接起来,并允许企业在不同模型和第三方系统之间保持灵活性。其重点不是提供单一模型,而是让专有客户上下文在权限与合规约束下被智能体调用和审计。

阅读原文
8

Fireworks助Juicebox降延迟80%,年推理费降至80万美元

推理优化智能体成本

Fireworks AI披露与人才搜索平台Juicebox的部署案例:通过针对业务场景优化的专用模型,为同时运行的多个实时搜索智能体处理数十万份人才档案,将端到端延迟降低80%,年度推理成本从400万美元降至80万美元,约缩减五分之四。案例表明,在搜索范围大、响应时间敏感且调用频繁的智能体产品中,专用模型与推理优化可能比全量使用通用前沿模型更具成本优势。

阅读原文
9

DeepSeek V4.1 Flash跻身开源Agent模型前三,单任务0.07美元

模型评测开源模型DeepSeek

DeepSeek-V4.1-Flash Max进入Agent Arena开源模型榜第三,净改进率为4.87%,与第二名Hy4 preview仅差0.09个百分点,与第一名Kimi K3 Max相差1.52个百分点。其单任务中位成本为0.07美元,较Hy4 preview低68%,较Kimi K3 Max低91%,成为前三名中成本最低者;模型在Confirmed Success指标上以13.75%的提升位列第四,但综合排名为第十二。

阅读原文
10

ElevenLabs扩展MCP,接入语音、音乐、图像和视频生成

MCP多模态创作工具

ElevenLabs扩展其MCP能力,使用户可在现有AI助手中直接生成语音、转录文本、配音、音乐、音效、图像和视频,将接口从语音工具扩展为多模态创作套件。通过MCP生成的内容会自动进入ElevenCreative工作区,用户随后可在Studio中调整时间线、修改旁白、叠加音乐与音效并导出成品。该流程旨在减少应用切换,把生成、资产管理和后期编辑连接到同一工作链路。

阅读原文

不要错过明天的 AI 简报

数千位专业人士的首选,用 AI Daily Brief 开启每天的工作与生活。