返回往期
2026年9月3日星期四
10 点要闻3 分钟阅读

今日要闻

1

Google发布Gemini 3.8 Flash,Cyber补丁数增2.6倍

模型发布网络安全AI编程

Google DeepMind发布Gemini 3.8 Flash与Cyber版,输入、输出价格延续3.7 Flash,分别为每百万Token 0.75美元和3.75美元。通用版在DeepSWE 1.1得分73.7%;Cyber版在CWE-Bench pass@1达47.2%,Chrome实测正确补丁数为大型商业模型的2.6倍。通用版已进入API、Gemini应用等渠道,Cyber版仅通过Fairwind向政府、关键基础设施和可信维护者开放。

阅读原文
2

World Labs推出Atlas,可生成一分钟1440p视频

世界模型多模态3D生成

World Labs推出Atlas早期访问版,这是从零开始预训练的多模态空间智能模型,可接收文本、图像、视频和3D数据,建立一致的空间记忆,并完成世界生成、场景重建与模拟。模型可生成最长一分钟的连贯1440p视频,也能重建3D场景,面向VFX、设计和机器人工作流。材料同时指出,现有工具链尚未完全适配其输出格式,企业接入前仍需评估资产格式、后处理环节和生产流程兼容性。

3

欧盟将ChatGPT纳入DSA超大型搜索引擎监管

政策监管欧盟OpenAI

欧盟委员会依据《数字服务法》将ChatGPT指定为「超大型在线搜索引擎」,并将Reddit和Roblox指定为「超大型在线平台」。三项服务需在四个月内履行更严格的系统性风险评估、风险缓解与透明度义务。此次指定意味着ChatGPT在欧盟不再只按生成式AI产品接受审视,而被纳入面向大规模信息检索服务的DSA框架;后续合规重点将覆盖风险治理、报告披露、监管审查及平台责任。

4

Claude支持后台操作电脑,首发限macOS付费用户

AI Agent桌面自动化Anthropic

Anthropic为Claude Cowork和Claude Code桌面端加入后台电脑操作:Claude可在获准应用中点击、输入和启动应用,用户同时继续处理其他任务。该能力目前处于beta,仅面向macOS的Pro与Max方案;此前启用computer use的用户会自动获得,也可在设置中调整。执行方式从占用前台屏幕转向后台并行,但操作范围仍受应用授权与安全设置约束,适合跨应用、多步骤的桌面工作流。

阅读原文
5

Anthropic开源电商Agent,缓存命中率可达99%

开源AI Agent电商

Anthropic开源Claude Commerce Agents蓝图与参考实现,覆盖零售、旅行、电信和娱乐,并发布面向生产环境的架构指南。其建议多数商务对话优先采用「单模型加Skills」,避免子Agent交接造成状态损失、Token增加和数秒延迟;电商场景提示缓存命中率可达90%至99%。指南还要求资金与业务状态变更由人或策略执行,安全规则放在harness层,并以状态快照而非固定对话路径评测。

阅读原文
6

Cursor开放自管Cloud Agents,支持自动扩缩容

AI编程云基础设施企业AI

Cursor允许Cloud Agents运行在用户自管基础设施上,可使用随需求自动扩缩的机器池,并访问企业内部服务或专用硬件;Agent循环与状态管理仍保留在Cursor平台,计算执行层则下沉到客户环境。首批支持的沙箱与部署提供商包括AWS Lambda、Cloudflare、Daytona、E2B、Modal、Namespace、Vercel和Coder。该混合架构主要面向对数据控制、网络连通和算力类型有要求的企业开发流程。

阅读原文
7

美国司法部支持OpenAI训练合理使用抗辩

版权政策监管OpenAI

美国司法部在《纽约时报》诉OpenAI版权案中提交意见书,支持OpenAI关于模型训练构成合理使用的抗辩。司法部认为,复制受版权保护文本用于LLM训练具有高度转换性,不会替代原作,并称过宽责任可能削弱美国AI竞争力和国家安全。意见书仅针对「训练本身是否合理使用」,不处理训练数据如何取得,也未裁定特定模型输出是否复现受保护内容;最终结论仍由法院逐案判断。

阅读原文
8

DeepSeek开源V4 Pro评测栈,公开完整Agent轨迹

DeepSeek开源模型评测

DeepSeek随V4 Pro 0813发布开源评测harness,完整记录每次工具调用、系统提示词和子Agent调度,使外部开发者能够复现模型表现,而非依赖封闭测试环境。该评测栈可被fork并改造成自定义基准,适配不同Agent架构、工具集合和评分标准。其核心价值在于同时公开模型结果与执行过程,为独立核验、误差定位和跨系统对比提供可检查的实验轨迹,降低Agent评测因环境不透明而难以复现的问题。

阅读原文
9

150组模型审计显示社区微调泛化下降约6个百分点

模型评测微调开源研究

一项预注册、污染控制审计比较150组社区微调模型与对应基础模型;在143至144组有效配对中,微调模型面对全新题目反而更差:GSM8K下降6.9个百分点、MMLU下降6.0个百分点、IFEval下降6.5个百分点。研究采用确定性评分而非LLM裁判,并预先固定排除标准。作者同时说明,基准记忆信号目前只有GSM8K通过标签置换检验,其他任务仍需继续验证,因此结论主要指向泛化退化。

阅读原文
10

Agent优化SGLang扩散内核,Qwen-Image提速33.9%

推理优化扩散模型AI编程

开发者披露用Agent优化SGLang Diffusion内核的完整实践,覆盖Qwen-Image、FLUX.2、Wan和SANA Video,约95%代码由Agent直接或间接完成。多项融合与量化优化使Qwen-Image端到端提速33.9%;Wan的VAE解码提速17.1%、流水线提速10.7%,峰值显存由49.6GB降至46.1GB。案例也显示微基准提速不等于整模提速,数值误差会在扩散步中累积,仍需人工决策与模型级验证。

阅读原文

不要错过明天的 AI 简报

数千位专业人士的首选,用 AI Daily Brief 开启每天的工作与生活。