返回往期
2026年8月14日星期五
8 点要闻3 分钟阅读

今日要闻

1

Google发布Gemini 3.7 Flash,价格较前代减半

大模型产品发布开发工具

Google DeepMind发布Gemini 3.7 Flash,重点提升编程、智能体、网页开发与知识工作能力。其DeepSWE得分由3.6版的49%升至65.3%,FrontierCode由34.4%升至43.6%,GDP.pdf由22.0%升至34.0%。首发价为每百万输入、输出token 0.75美元和3.75美元,约为前代原价一半。模型已接入Gemini API、AI Studio、Cursor及Gemini Spark,但不开放权重。

阅读原文
2

ChatGPT上线Computer History,衔接跨应用工作

AI智能体桌面应用隐私

OpenAI在ChatGPT macOS桌面端推出Computer History,以点击、输入和应用切换等交互事件构建工作时间线,不录制屏幕或音频。ChatGPT与Codex可据此识别最近编辑的文档、总结工作并衔接跨应用任务。该功能采用主动开启机制,用户可排除应用和网站、查看或删除记录,并访问本地记忆文件。现面向Pro、Business和Enterprise用户全球推送,欧洲经济区、英国及瑞士将稍后开放。

阅读原文
3

OpenAI预览Ultrafast模式,速度最高提升14倍

推理加速APIAI基础设施

OpenAI预览GPT-5.6 Sol的Ultrafast模式,借助Cerebras基础设施将生成速度提升至最高750 token/秒,官方称较常规模式最高快14倍。该模式首先通过API向部分客户开放,面向实时客服、金融研究、事故调查和代码重构等时效敏感任务。演示称,原需1至2小时的数据收集、整理与补充上下文可缩短至10至15分钟。OpenAI正与早期客户优化体验,并接受后续扩容通知登记。

阅读原文
4

DeepSeek开源Harness,以插件架构支持长周期Agent

AI智能体开源开发工具

DeepSeek开源Harness,采用Cordis插件优先架构,将运行时组件设计为可替换插件,并提供标准、PTC、极简和创意四类Agent预设。PTC模式支持TypeScript SDK,用户也可组合自定义预设与Skills。其Trajectory窗口记录事件级原始日志,可回放模型行为、定位执行瓶颈并跟踪token消耗,提升长周期任务的调试与成本控制。报道测试显示其可持续推演20分钟乃至10小时,但相关对比主要来自体验性演示。

阅读原文
5

Google推出Sheets canvas,自然语言生成迷你应用

办公软件无代码数据可视化

Google为Sheets推出Gemini驱动的Sheets canvas,用户可用自然语言把表格数据转换为可交互的可视化迷你应用,无需公式或编程。Canvas作为覆盖在原始表格之上的可读写层,可生成学习追踪器、体育看板或婚礼座位图等界面。用户能继续通过提示调整布局和功能,Canvas与底层单元格的修改会双向实时同步。成品可作为Sheets标签页共享,并支持多人协作编辑,保持原有数据一致性。

阅读原文
6

Cursor云端Agent启动提速3倍,失败构建不再上线

AI编程云端Agent开发工具

Cursor更新云端Agent的Builds机制,通过持续预备开发环境,将Agent启动速度提升3倍,使启动时间从分钟级降至秒级。该机制面向长时间、复杂任务的异步交付,减少每次任务开始前重复配置环境的等待。Cursor称Faire、Headway和Descript等企业客户已观察到相应提速。Builds还把构建验证纳入上线流程,失败构建不会进入生产环境,并保留更清晰的调试路径,以提高云端Agent执行的韧性和可排查性。

阅读原文
7

OKF共享token ID,多Agent首token延迟降37.8%

多智能体推理优化工程实践

一项多Agent工程实验用OKF在不同尺寸Qwen2.5-Coder模型间共享预计算token ID,避免各Agent对相同文本重复分词。方案在OKF中加入token_pointer字段,把.npy数组放入/dev/shm共享内存,并对151936项词表执行完整一致性校验,防止映射差异造成静默错误。3B模型首token时间由69.3毫秒降至49.9毫秒,下降28%;1.5B模型由49.6毫秒降至30.9毫秒,下降37.8%。不同隐藏维度仍使KV缓存无法共享。

阅读原文
8

Gemma 4在AWS T4G实测达43.1 token每秒

模型部署vLLM云计算

一份工程实测在AWS EC2 G5g实例上部署Gemma 4 E2B,组合Graviton2 ARM64处理器与NVIDIA T4G GPU,并用修补后的vLLM实现43.1 token/秒。该硬件组合缺少公开预编译支持,且Gemma 4不同层采用256和512维注意力头,Turing架构64 KiB共享内存不足以运行默认Triton内核。方案使用AWS ARM64 GPU DLAMI、vLLM 0.27.2rc0以上版本,并缩小KV tile与流水线级数,最终性能受277 GB/s显存带宽限制。

阅读原文

不要错过明天的 AI 简报

数千位专业人士的首选,用 AI Daily Brief 开启每天的工作与生活。