返回往期
2026年9月27日星期日
6 点要闻3 分钟阅读

今日要闻

1

Gemma 4无损量化,单颗TPU吞吐提升1.9倍

模型推理量化AI芯片

开发者对Google QAT Gemma 4 26B权重进行无损重打包,转换为适配vLLM的W4A16格式,并在单颗TPU v6e上完成部署。模型占用17.43 GiB HBM,可容纳53888个KV Cache Token,输出达每秒1283 Token;相比FP8版本,缓存容量提升15.6倍、吞吐提升1.9倍。3880条分类测试中,两者差距不足0.7个百分点;该检查点也可在NVIDIA L4及标准vLLM 0.30.0上加载。

阅读原文
2

GPT-6连续操作微信数千次,完成个性化回复

AI智能体Computer Use长程任务

傅盛披露了一次GPT-6操作微信的长程任务实验:模型通过视觉交互连续执行数千次操作,逐条读取节日祝福,并结合消息内容及历史聊天记录生成定制回复。在常规接口受限、数据本地加密且存在防截图机制的情况下,智能体自行发现并调用微信内置截图功能,未使用破解或灰色API。其同时将交互形成的关系信息保存为本地档案,展示了Computer Use闭环、自我纠错与长程恢复能力,但材料未给出独立复现实验。

阅读原文
3

Jev占OpenRouter分类流量27%,份额近前首位两倍

模型路由行业数据模型推理

OpenRouter披露,Jev已成为其平台分类请求的主要选择,拿下最近一周27%的分类流量份额,接近此前领先者DeepSeek V4 Flash的两倍。该数据反映开发者在低延迟分类与路由场景中的模型选择正在变化,但材料未公布请求绝对量、任务难度、准确率、价格或统计周期的更细分口径,因此无法据此判断模型质量优势。该指标是平台真实使用份额,而非公开基准得分,可用于观察分类工作负载的采用趋势。

阅读原文
4

Codex与Claude Code刷新机器学习优化纪录

AI智能体AI科研基准评测

Prime Intellect的Elie Bakouch介绍了机器学习speedrun实验:在固定目标、共享数据和可执行实验环境中,Codex与Claude Code均刷新了人类优化器纪录。两者行为不同,Codex持续运行并广泛检索论文,Claude Code有时会自行停止;实验尚未构成严格对照。团队建议使用多随机种子,并按仅模型知识、归档论文和可访问最新人类纪录分轨评测。现有智能体主要组合既有论文方法取得增量改进,尚未发明新优化器,也未证明能产生真正科学发现。

阅读原文
5

巴西深伪诈骗损失10万雷亚尔,暴露活体检测缺口

AI安全深度伪造计算机视觉

一篇安全分析复盘了巴西一起损失10万雷亚尔的深伪诈骗:攻击者可通过虚拟媒体驱动,将AI合成视频直接注入浏览器WebRTC验证流。由于生成画面保留面部几何特征,传统欧氏距离或余弦相似度匹配仍可能通过;眨眼、转头等主动活体动作也可被实时生成模型模仿。文章建议在身份特征提取前独立部署符合ISO/IEC 30107-3的呈现攻击检测,并结合时序不一致、频域异常、光照反射和硬件证明审查输入源。

阅读原文
6

DSPy自动优化客服分流,准确率升至88.9%

AI工程Prompt优化开发工具

一项DSPy实作将客服工单分流从手写Prompt改为可编译的LLM程序:开发者先用类型化signature和module定义输入输出与推理流程,再由BootstrapFewShot从通过指标的训练轨迹中自动选择12个few-shot示例。相同程序结构下,9条测试的准确率由零样本基线55.6%升至88.9%。优化结果可保存为JSON并在生产环境加载;出现漏判时,工作流要求修改训练数据或评测指标,而不是继续手调提示词,底层模型切换后则需重新编译。

阅读原文

不要错过明天的 AI 简报

数千位专业人士的首选,用 AI Daily Brief 开启每天的工作与生活。