返回往期
2026年9月25日星期五
10 点要闻3 分钟阅读

今日要闻

1

Google Cloud强化AI容器性能,TTFT降低70%

AI基础设施云计算性能优化

Google Cloud在2026年Gartner容器管理魔力象限中获评领导者,并披露GKE与Cloud Run的AI负载升级。GKE预测延迟功能可将首Token时间降低70%,KV Cache自动分层使长提示吞吐提高70%,节点启动速度提升4倍;意图式自动扩缩容把资源响应时间从25秒缩至5秒。Cloud Run现支持NVIDIA Blackwell GPU,可在不到5秒内完成供给并缩容至零,GKE网络策略集群容量则翻倍至1.5万节点。

阅读原文
2

Muse Spark 1.3登陆两家云,采用隔离虚拟机

AI智能体云计算安全

Muse Spark 1.3现已可通过Google Cloud和Oracle使用,为企业增加多云部署选项。Muse同时披露Secure VM架构:每名用户可获得一台云端计算机,其完整Ubuntu Linux镜像运行在与宿主文件系统隔离的运行单元内,用户能够查看并控制该环境。敏感操作及凭证由运行单元外部的Sentinel进程管理和监督,用于降低提示注入等风险在执行层扩散的可能性;目前材料未披露云端版本的价格、区域范围及服务等级。

阅读原文
3

Midjourney更新局部重绘并预览实时模型

图像生成模型更新

Midjourney公布一组图像生成更新:v8.1和v8.2调整了「--tile」参数,以改善无缝图案生成;新版局部重绘允许仅修改用户选中的像素区域,减少对画面其他部分的意外改动;实时图像生成模型已在alpha平台进入早期预览。官方还发布新编辑模型教程,展示如何在多次生成和编辑中保持角色特征一致,并介绍相关工作流。目前材料未披露实时模型的正式上线时间、生成延迟、价格以及可用用户范围。

阅读原文
4

Pruna加速Qwen-Image-2.1,采样降至5步

图像生成LoRA模型推理

Pruna-Qwen-Image-2.1发布面向Qwen-Image-2.1的LoRA适配器,用于加速图像生成与编辑。该方案把原模型所需的40个采样步骤压缩至5步或8步,最高速度提升6.3倍;5步配置侧重生成效率,8步配置则在速度和图像质量之间提供另一档选择。由于采用LoRA适配方式,用户可在既有模型工作流中加载相应权重,而不必替换基础模型。材料暂未提供适配器的授权方式、硬件测试环境、显存需求及质量评测结果。

阅读原文
5

LangSmith Custom Apps正式可用,可用提示生成界面

AI开发工具智能体评测LangSmith

LangChain宣布LangSmith Custom Apps进入正式可用阶段,用户可通过自然语言提示,为LangSmith中的智能体数据生成定制界面。典型用途包括构建标注队列,对模型或智能体运行结果进行系统化审核与标记;创建实验对比视图,并排观察提示词调整带来的输出变化;以及制作自定义追踪审查界面,调试多步骤智能体线程。该功能将评测、数据审阅与调试界面放入同一平台,但材料没有披露定价、权限边界及企业部署要求。

阅读原文
6

Managed Deep Agents 0.8加入私有持久记忆

AI智能体智能体记忆隐私安全

LangChain发布Managed Deep Agents 0.8,重点加入持久化且按用户隔离的记忆能力。Context Hub作为管理层,分别处理通用智能体记忆与私人用户上下文,使开发者能够检查、审计通用记忆,同时避免直接暴露个体数据或在不同用户间泄漏信息。新版还改善Slack集成,增加更细化的权限控制、文件直接投递和内置搜索,以简化团队协作中的资料调用与治理。材料未说明记忆保存周期、数据区域、迁移方案以及新增能力的收费标准。

阅读原文
7

Fireworks与LangSmith打通微调部署全流程

模型微调AI开发工具模型部署

Fireworks AI与LangChain集成LangSmith微调流程,开发者可通过smithtune命令行工具,将LangSmith运行追踪直接转为监督微调数据,在Fireworks上执行托管式SFT,随后完成评测并部署模型。该流程把数据提取、训练、验证和上线连接为连续管线,用户无需自行维护训练基础设施,主要面向需要根据真实智能体轨迹进行模型专门化的团队。材料未披露支持的基础模型范围、训练价格、数据保留策略以及部署区域。

阅读原文
8

Pareto混合路由追平GPT-6 Astra,成本约三分之一

模型路由AI智能体成本优化

Pareto 26.9展示了一种面向智能体任务的混合模型策略:系统查询多个模型并从候选结果中选择输出,而非把所有请求固定发送给单一前沿模型。相关评测称,Pareto在总体结果上与GPT-6 Astra并列第一,但每个成功任务的成本约为后者三分之一,且材料称未观察到明显速度代价。该结果显示,模型路由与结果选择可能改善特定任务的成本效率;不过现有信息未披露评测集规模、路由规则、参与模型清单及独立复现结果。

阅读原文
9

1.2万份真实询价测试:校准决定自动化上限

模型评测企业自动化决策模型

一项基于1.2万份真实询价单的对比测试评估了35B参数Qwen模型、类型化API Jev及4.21亿参数Laya。结果显示,原始准确率并非安全自动化的唯一决定因素:Jev凭借更可靠的置信度校准,可设置满足95%精度要求的自动处理阈值。流程策略同样影响显著,将风险标记从阻断条件改为记录属性后,自动化比例由26.6%提高至91.9%,同时保持较高精度。Laya运行错误为零且延迟较低,但校准不足,难以形成可靠的人机交接边界。

阅读原文
10

Laya跨GPU测试显示p99延迟存在陡峭拐点

模型推理GPU性能评测

针对4.21亿参数决策模型Laya的跨NVIDIA GPU测试显示,服务负载在批处理器填满前较稳定,越过容量拐点后,p99延迟会由约100毫秒升至数秒,因此平均延迟可能掩盖生产风险。在Hopper和Blackwell架构的动态服务场景中,torch.compile的max-autotune FP16配置吞吐高于TensorRT;12GB MIG切片虽能提供隔离,但在高负载及超过400 Token的文档上无法满足130毫秒目标。测试还用63个问题检查优化前后输出一致性。

阅读原文

不要错过明天的 AI 简报

数千位专业人士的首选,用 AI Daily Brief 开启每天的工作与生活。