返回往期
2026年9月23日星期三
10 点要闻3 分钟阅读

今日要闻

1

Anthropic发布Claude Opus 5.5,运行成本降40%

大模型模型发布AI安全

Anthropic已上线Claude Opus 5.5,材料称其在多数任务上达到Claude Fable 5.1水平,并在智能体编程、计算机操作和知识工作方面领先。相较Opus 5,新模型通过减少单任务Token及降低60%缓存读取量,使运行成本下降40%;自动化行为审计成绩为Anthropic迄今最佳,边界规避尝试减少85%。相关测试采用自适应思考最高努力档并开启生产防护,模型现已开放使用,具体API价格材料未披露。

阅读原文
2

OpenAI发布GPT-6 Sol与Luna,Luna价格减半

大模型模型发布API

OpenAI发布GPT-6 Sol和GPT-6 Luna,将旗舰级能力下放至价格更低的模型层级。材料称Luna价格为GPT-5.6 Luna的一半且性能更好,但未提供具体单价、基准分数或上下文参数。GPT-6 Sol已接入Perplexity与Computer,并成为Computer努力程度选择器中的默认Light选项。现有信息主要来自平台公告及开发者转述,完整官方规格尚未出现在材料中,实际成本仍需按具体使用场景核验。

阅读原文
3

OpenAI升级GPT-6缓存,输入折扣最高90%

API推理优化开发工具

OpenAI改进GPT-6 API提示缓存,30分钟内复用符合条件的共享前缀,可获最高90%的缓存输入Token折扣。新版默认提高命中率,并新增Prompt Caching Dashboard、诊断API、显式缓存断点、追加式工具更新及缓存预热。GitHub Copilot称需重新处理的提示Token占比下降逾50%;Strawberry Browser称命中率提升数个百分点、成本下降20%,开发者还可在不破坏缓存时调整推理强度。

阅读原文
4

Opus 5.5验证Claude SDK,产出16个修复PR

形式化验证AI编程智能体

Boris Cherny使用Claude Opus 5.5配合Lean,对Claude Agent SDK开展形式化验证;仅用数条短提示便产出16个PR,修复多项缺陷与竞态条件。实验同时引入TLA+分析数据流、并发与状态管理,展示Lean与状态机工具的互补性。作者称自己并不熟悉Lean或TLA+,但模型降低了形式化方法的使用门槛;这是个人实验,材料未给出PR合并状态、缺陷严重程度或独立复核结果。

阅读原文
5

ReFigBench:Harness影响编码智能体甚于模型

AI评测AI编程多模态

ReFigBench以真实arXiv图表为输入,要求编程智能体生成可编辑PPTX,并保留文本、布局和连接关系;评测结合产物检查、LLM评审及盲测人工评价,覆盖10种模型与运行配置。结果显示,同一GPT-5.5在Claude Code与Codex中表现明显不同,Harness影响可能超过模型差异;专用流程虽移除原生连接器仍获人类偏好,研究者据此认为视觉感知仍是图表重建任务的主要瓶颈。

阅读原文
6

Astra定位libuv 14年旧缺陷,关联ChatGPT崩溃

AI编程软件缺陷智能体

ChatGPT在升级macOS 27后出现间歇性崩溃,Peter Steinberger称其智能体Astra最终将根因定位到libuv中一项约14年前遗留的缺陷。该案例显示,操作系统更新可能触发成熟底层依赖中的潜伏问题,也展示编码智能体可参与C语言基础设施的根因排查,而非仅生成新代码。当前材料仅来自作者一手描述,尚未提供对应补丁、libuv上游确认、受影响版本范围或可复现实验细节。

阅读原文
7

Jev搜索停止Recall@5达93.25%,延迟降77.5%

模型评测智能体RAG

Milvus在搜索停止任务中测试Jev,称其取得93.25%的Recall@5,并较DeepSeek V4 Flash将决策延迟中位数降低77.5%。在编码智能体记忆重排任务中,Jev把Recall@5从74.71%提升至79.41%;但在HotpotQA和MuSiQue上分别落后GPT-5-mini 1个和4.13个百分点。结果显示其在低延迟决策方面具有优势,但跨任务表现并非全面领先,材料也未披露测试成本与完整配置。

阅读原文
8

Sluicebox采用Nemotron,成本降51%至80%

企业AI智能体NVIDIA

Sluicebox基于NVIDIA Nemotron 3 Ultra构建供应商智能体Lucy,用于收集和核验供应商数据,帮助工程师分析数据中心碳足迹。NVIDIA披露的Sluicebox测试显示,采用该模型后准确率提升,成本下降51%至80%,响应速度最高提高2倍。材料未说明样本规模、准确率绝对值、对照模型、运行周期及部署价格,因此上述效果仍属于供应商案例数据,其可迁移性和适用范围需结合实际业务流程评估。

阅读原文
9

Genspark幻灯片基准纳入Fireworks指数

AI评测生成式AI办公软件

Genspark的Slides Benchmark被Fireworks AI纳入Specialized Intelligence Index,用于评价幻灯片生成这一专门任务。Genspark称其首款自研Gen-1 Slides在内部评测中达到前沿级演示文稿质量,输入Token价格约为对比对象的1/17。此次纳入为该基准提供了更多第三方可见度,但材料未披露对比基线、样本规模、评分细则和完整结果,质量及成本结论目前主要仍来自厂商自报。

阅读原文
10

Opus 5.5两天生成虚拟旧金山,Jev用量25美元

3D生成AI编程智能体

Matthew Berman称其借助Claude Opus 5.5在Unreal Engine中重建旧金山,并以Jev驱动场景中的行人、宠物、车辆和交通等动态实体。整个目标工作流约运行两天;一次因整夜未停止运行产生约25美元Jev用量。该案例提供了智能体生成3D环境的时间与成本信号,但未披露资产管线、人工介入程度、硬件配置、质量评价或用量构成,现阶段更接近可玩演示,而非可横向比较的标准化基准。

阅读原文

不要错过明天的 AI 简报

数千位专业人士的首选,用 AI Daily Brief 开启每天的工作与生活。