返回往期
2026年9月28日星期一
9 点要闻3 分钟阅读

今日要闻

1

Z.ai发布GLM-5.2,并推出跨模型Z Code框架

模型发布开源模型AI编程

Z.ai发布开放权重模型GLM-5.2,将能力重点放在推理、编码与智能体任务,并称其关闭思考模式后仍优于GLM-5.1思考模型。团队同步推出Z Code编码智能体框架,可调用GLM-5.2及用户自带密钥的其他前沿模型,面向本地部署、领域微调和安全控制。演讲称新模型在部分困难及长周期任务上可比Opus 4.7,但未提供完整分数、任务拆解或独立评测结果,实际性能仍待验证。

阅读原文
2

OpenAI修复GPT-6视觉缺陷,建议重跑图像评测

模型更新开发者工具视觉理解

OpenAI修复GPT-6 Sol与Luna中导致图像理解能力下降的软件缺陷,更新覆盖API与Codex。官方表示,修复后视觉任务准确性应有所改善,尤其是依赖截图或其他图像输入的计算机操作流程。OpenAI建议所有使用图像输入的开发者重新运行评测,并再次测试既有工作流,以确认修复对实际应用的影响。公告未披露受影响时段、错误幅度或具体基准变化,生产环境仍需以回归测试结果为准。

阅读原文
3

Opus 5.5单提示运行30小时,构建27.7万门计算机

AI智能体AI编程长周期任务

Matt Shumer展示Opus 5.5通过单个提示,在约30小时内自主构建一套可运行的JavaScript计算机模拟。项目包含约27.7万个逻辑门,以及CPU、内存、汇编器、操作系统和可运行游戏;提示明确要求底层功能由真实逻辑门驱动,而非界面层伪装,并要求提供三维可视化。该实验使用ultracode模式且过程中无人干预,但目前属于个人演示,尚无第三方代码审计或可复现评测结果。

阅读原文
4

智能体团队用120小时内规模构建可运行Doom的OS内核

AI智能体智能体编排软件工程

Google DeepMind的Kevin Hou展示由智能体团队构建、可运行Doom的操作系统内核:项目调用93个子智能体,发出1.5万次请求,消耗20亿Token,在12小时内完成,成本低于1000美元。其产品思路包括按任务动态组建专业子团队、用事件驱动sidecar持续响应,以及生成任务专属界面;另一项内部研究评测流程据称实现90%自动化。演讲同时承认,这类协作仍需改进,日常重复构建内核并不实用。

阅读原文
5

Jev检测对齐失败AUROC达0.886,单轮成本0.30美元

AI安全模型评测推理优化

Jev通过校准后的通用是非问题检测AI对齐失败,无需额外训练时,跨任务中位AUROC达到0.886;在19项基准上运行一轮约需0.30美元,而原有LLM评审成本约18.96美元。StrongREJECT测试中,其排序AUROC为0.971,高于GPT-4o-mini的0.929,并发现部分标签错误。仅用10个标注样本拟合阈值,可将中位F1从0.706提高至0.793;该模型还可作为智能体框架中的低成本模糊规则检查器。

阅读原文
6

DeepMind提出集体式AGI,强调模型与人类协作

AGI多智能体AI治理

DeepMind一篇新文章提出,AGI更可能来自模型、工具、机构与人类参与者之间的协作,而非单个模型独立胜出。这一框架把多智能体治理视为核心问题,认为人类长期管理领导者、公司和其他机构的经验可提供参考。Exponential View认为该方向具备现实基础,但质疑赋予AI智能体独立心智、目的或道德主体地位的表述,并主张一旦实验室认为正在创造新的道德主体,相关决定不应仅由企业自行作出。

阅读原文
7

MiniMax上线M3.1 Flash预览版,面向低延迟推理

模型发布推理服务低延迟

MiniMax宣布MiniMax-M3.1 Flash Preview正式上线,定位为面向高调用量、低延迟工作负载的更快、更轻量模型。新版本已纳入现有Token Plan订阅,团队用户无需另行购买独立套餐即可接入,适合对响应速度敏感的在线服务与批量推理场景。官方此次公告主要确认产品可用性和订阅入口,未披露参数规模、具体延迟、吞吐、价格拆分或基准成绩,因此与同系列及其他快速模型的性能和成本差异仍需实测。

阅读原文
8

Sarvam AI发布Saaras V4,覆盖22种印度语言

语音识别多语言模型印度市场

Sarvam AI发布语音转文字模型Saaras V4,语言覆盖范围包括印度宪法承认的全部22种印度语言,并支持全球英语,目标是处理印度多语言环境及英语语音转写需求。该发布扩大了面向印度市场的统一语音识别覆盖,可减少为不同地方语言分别配置模型的需求。现有材料未给出参数规模、训练数据量、词错率、推理价格、开源许可或部署方式,也未提供与主流语音识别系统的独立对比结果,实际可用性仍需进一步测试。

阅读原文
9

英伟达与Meta优化Muse实时头像,降低语音交互延迟

多模态AI实时头像模型优化

英伟达披露,其工程团队与Meta合作优化Muse Realtime Avatar底层模型,使实时头像在用户说话时能够更及时地跟随交互。合作重点是提升模型效率,以支持语音到头像表现的实时处理,体现生成式语音、人物动画与低延迟推理的进一步结合。现有公告未公布具体延迟、算力需求、模型规模、开放范围或产品上线计划,也没有提供优化前后的对比指标,因此目前可确认的是双方完成了工程协作,实际体验与部署成本仍待产品数据说明。

阅读原文

不要错过明天的 AI 简报

数千位专业人士的首选,用 AI Daily Brief 开启每天的工作与生活。