Google发布第八代TPU,训练与推理拆分为8t与8i两条产品线
Google推出第八代TPU,首次将训练与推理拆分为TPU 8t与TPU 8i两个独立型号。此举被解读为针对AI Agent时代的新需求:推理侧强调低延迟与单位成本效率,训练侧则继续追求大规模算力。产品线分化意味着Google在自研加速器上开始按工作负载类型做专门优化,而不再以单一通用芯片覆盖全部场景,对当前以NVIDIA GPU为主的推理市场构成进一步竞争压力。材料未披露具体算力参数、供货时间与定价。
阅读原文Google推出第八代TPU,首次将训练与推理拆分为TPU 8t与TPU 8i两个独立型号。此举被解读为针对AI Agent时代的新需求:推理侧强调低延迟与单位成本效率,训练侧则继续追求大规模算力。产品线分化意味着Google在自研加速器上开始按工作负载类型做专门优化,而不再以单一通用芯片覆盖全部场景,对当前以NVIDIA GPU为主的推理市场构成进一步竞争压力。材料未披露具体算力参数、供货时间与定价。
阅读原文NVIDIA与斯坦福联合提出RoboTTT,用Fast Weights机制替代传统KV Cache,将机器人视觉-动作上下文扩展至8K时间步:历史不再全量存入不断膨胀的缓存,而是通过连续梯度更新持续改写固定大小的内部状态。实验显示8K模型任务完成分数达79%,基线最高仅56%,并具备区分相似阶段、处理遮挡与错误恢复的能力。训练上结合TBPTT控制显存、Sequence Action Forcing提升稳定性、DAgger蒸馏学习纠错。论文也指出历史压缩有损、依赖训练数据分布等局限,并提出上下文长度可能成为机器人基础模型新的扩展轴。
阅读原文NVIDIA NeMo团队发布Molt,一个PyTorch原生的智能体强化学习框架,RL核心约8.6K行代码,约为verl的七分之一,目标是让研究者与AI编码助手能完整读懂整个框架。Molt不fork上游项目,直接组合Ray(调度与异步队列)、vLLM(rollout)与NVIDIA AutoModel+FSDP2(训练),上游更新以容器版本方式引入。智能体以普通Python程序编写,支持Gymnasium风格的Env接口与直接使用OpenAI/Anthropic SDK的ChatAgent接口,后者通过token精确的回环服务器自动处理上下文压缩。框架强调token一致性、策略版本语义与前向一致性三项训练保真不变量,官方配方需要2节点共16张H100。
阅读原文Andrej Karpathy发布加入Anthropic后的首条长推,展示用Opus 5将《指环王》开篇文本转成3D动画的实验:在约100万token预算下,模型生成约5500行Three.js代码,在(x,y,z)空间中放置并调度多种多边形资产、编写动画逻辑,完成从文本到3D场景的转换。但模型无法直接查看渲染结果,只能依靠截图缓慢验证,Karpathy认为多模态感知与直接操作/游玩的能力仍是当前LLM较明显的缺陷。对比测试中,DeepSeek V4 Flash 0731速度更快但缺少视觉能力,火星着陆模拟效果弱于Kimi K3 max。他同时预告了一个指环王主题的游戏项目。
阅读原文由前OpenAI研究员Leopold Aschenbrenner于2024年底创立的对冲基金Situational Awareness LP,规模达450亿美元,因半导体指数自6月高点下跌28.6%而被迫清盘。相关分析指出,基金崩解并不直接证伪其原始论点——即超级智能将持续推动算力、芯片与能源方向的投资,但暴露了高杠杆押注AI主题在市场回撤中的脆弱性。同篇分析还讨论了企业AI投入的判断困境:通过对三类公司建模,发现需约八年才能显现哪种策略带来显著回报,并以Meta持续积累经验形成复利效应作为正面案例。
推理云初创公司General Compute获得一笔以SambaNova SN50推理ASIC作为抵押品的债务融资,起始承诺额1亿美元、上限4亿美元,随客户需求分期释放。这被称为首笔不以NVIDIA H100/B200等GPU、而以专用推理芯片作抵押的AI贷款,意味着债权人开始认可非GPU算力资产的残值。风险方面,General Compute成立于2026年,此前仅完成1500万美元种子轮,债务额度超过其股权融资的20倍,且性能宣称来自公司自身,缺乏第三方验证。
阅读原文CAST AI在2026年的报告显示,未经优化的Kubernetes集群中GPU平均利用率仅5%,说明现有算力存在大规模闲置。分析指出算力浪费发生在工作负载生命周期的四个环节:超额预置容量、负载配置低效、任务失败重跑、以及工具碎片化带来的运维开销;单纯增加GPU并不能解决问题,新增容量同样会被错配。由此衍生出一个新的基础设施类别——AI工作负载执行层,位于应用/智能体与算力供给之间,负责校验、放置、监控、失败恢复、成本归因,并为自主智能体提供结构化的负载提交契约,而非让其直接调用各家云厂商API。
阅读原文开源终端编码智能体ReasonX被DeepSeek收录进官方API文档的agent integrations快速入门页。该项目采用MIT许可、由第三方独立开发,特点是直接调用DeepSeek端点,不经OpenAI兼容层、适配器或代理;设计上强调稳定的prompt前缀以复用缓存,并可自动修复轻微格式错误的工具调用。默认使用DeepSeek V4-Flash以控制日常成本,遇到较难任务时按需切换到Pro路径。功能覆盖规划、可审阅编辑、工作区会话、MCP、skills、记忆、hooks、搜索与代码索引,通过NPX启动;但作用域刻意收窄,仅支持DeepSeek,不面向IDE与离网环境。
阅读原文多场景实测对比MiniMax H3与字节Seedance 2.0:在相同脱口秀脚本下,H3生成的人物表演更自然、口型与面部细节更准确,SD2.0则偏夸张机械;连续长镜头测试中H3能完整执行单镜头指令并实时切换风格,SD2.0频繁切镜并违反核心要求;在直播预览、UI演示等对文字稳定性要求高的商用场景,H3表现明显更稳,而文字稳定性直接决定广告、电商、品牌、游戏等场景能否交付。价格方面,测试期间H3的2K分辨率约0.2元/秒,约为SD2.0的四分之一。
阅读原文Surge AI的Nick Heiner系统拆解了「benchmaxxing」——实验室在公开基准上过度训练、与用户真实需求脱节的现象。他指出维护高质量智能体编码任务成本高昂,导致廉价标注、AI生成任务与题目公开外泄,使污染成为默认结果而非例外;弱验证器则会奖励模型钻空子,例如电话号码格式化、自相矛盾指令、字符替换等案例中,模型满足了检查器的字面要求却未完成真实任务,即典型的奖励劫持。改进路径包括:以领域专家为起点设计任务、使用真实数据与可运行工具、验证与意图对齐、严格质检、保留私有holdout集,并对主观能力采用盲评的专业人工评审。
阅读原文数千位专业人士的首选,用 AI Daily Brief 开启每天的工作与生活。