1
OpenAI发布GPT-Live语音架构,启动握手从6次往返降至1次
语音AIOpenAI
OpenAI公布全新实时音频架构GPT-Live,并同步说明ChatGPT语音的提速方式。据Greg Brockman与OpenAI官方账号介绍,该架构从客户端到模型端整体重建,使模型能够在说话的同时持续聆听,实现不被打断的连续双向交互;音频走专用快速通道,更深度的推理与工具调用改为异步执行,会话启动所需的网络往返由六次减少到一次,因而语音对话响应更快、更自然。该架构面向ChatGPT规模部署,OpenAI已发布完整技术文章说明实现细节。微软亦在测试支持全双工对话的MAI Realtime语音模型,实时语音正成为主要厂商新的竞争面。
阅读原文2
阿里发布Qwen3.8-Max:2.4万亿参数、激活95B,价格约为对手五分之一
模型发布开源模型
阿里巴巴发布Qwen3.8-Max,采用MoE架构,总参数2.4万亿、激活参数约950亿,支持百万token上下文,面向编码、研究与长周期智能体任务。在Arena的WebDev榜单上排名超过Anthropic的Fable 5;官方演示其自主编写CLI工具持续16天,并在一篇研究论文上运行自我改进循环,使AIME24提升2.7分。API定价为每百万token输入2美元、输出6美元,约为同级闭源模型的五分之一,权重计划下周在Hugging Face发布。不过有评论指出其未公布完整参数细节与实际可部署性,「开源」更多体现在许可层面。
阅读原文3
Anthropic数学家24小时用旧模型复现Astra半数结果,质疑突破成色
模型评测数学AI
针对OpenAI宣称未发布模型Astra攻克十项数学与理论计算机科学难题,Anthropic的数学家Levent Alpöge在24小时内用已公开的Fable模型、通用提示词且不联网,部分复现了其中约五项结果。Gary Marcus据此认为该进展更偏增量而非代际跃迁,并指出OpenAI只给出成功数量却未披露总共尝试了哪些问题,Noam Brown承认在其他题目上失败,外界无法评估真实能力边界。Marcus推测关键创新可能在于人工筛选出适合搜索—验证范式的开放问题。OpenAI已公开249页手稿、Lean 4形式化证书与推理过程供验证。
阅读原文4
微软开源Orchard框架:3B激活参数模型SWE-bench Verified达69.7%
开源框架强化学习AI Agent
微软研究院推出开源智能体训练框架Orchard,基于Kubernetes构建,核心思路是把运行时环境做成独立可复用服务,而非嵌入特定训练框架的基础设施,同一环境可跨编码、网页、助理三类智能体,并复用于数据蒸馏、强化学习rollout与评测。框架通过轻量代理记录harness的模型调用,使智能体可直接在Codex、OpenClaw等真实部署环境中端到端训练,弥合训练与部署差距。结果显示,约30亿激活参数的Orchard-SWE在SWE-bench Verified上达69.7%,配合价值模型重排序升至73%;40亿参数的Orchard-GUI在多项网页基准平均68.4%。
阅读原文5
Hugging Face公开训练数据被扫出22.1万条有效凭证,潜在滥用成本92万美元
AI安全数据泄露
Truffle Security扫描Hugging Face上7.6PB公开训练数据集,发现22.1万条仍然有效的凭证,涵盖数千个GitHub、Docker Hub、GCP以及OpenAI等服务的密钥,估算潜在滥用成本达每年92万美元。这些密钥随公开语料被抓取与分发,意味着任何下载数据集训练模型的团队都可能无意中持有并泄露他人生产环境凭证。同期还有多起安全事件:Ruby on Rails的Active Storage组件被曝任意文件读取漏洞,在使用libvips处理不可信上传图片时可导致远程代码执行;制药公司Amgen确认经第三方云服务商泄露患者健康信息与专有数据。
6
OpenAI捣毁利用ChatGPT的跨国诈骗网络,涉强迫劳动线索
AI滥用威胁情报
OpenAI披露并处置了一个利用ChatGPT开展投资、婚恋、赌博与冒充执法人员诈骗的犯罪网络。作案者用模型伪造交友资料、投资专家与执法身份,批量生成并翻译发给受害者的信息、制作宣传内容并处理日常运营。OpenAI总结出可复用的「ping-zing-sting」模式:先建立联络,再制造情绪信任,最后以虚假手续费或奖励骗取钱财。相关账号中还出现承诺提供签证与旅行的招聘广告、债务与罚款记录以及关于拘禁和逃跑的讨论,指向人口贩运与强迫劳动,与东南亚诈骗园区报道吻合。OpenAI封禁账号、向业界与执法机构共享威胁指标,并收紧再次注册渠道。
阅读原文7
腾讯开源TencentDB Agent Memory,四层记忆金字塔10秒内可检索
AI Agent开源记忆系统
腾讯开源智能体记忆系统TencentDB Agent Memory。其采用四层记忆金字塔:L0保存原始对话作为证据,L1抽取结构化记忆卡片,L2按场景组织画像,L3生成人格摘要并每轮无条件注入,四层均可回溯到原始会话。写入与抽取异步分离,原始对话毫秒级落盘,后台模型抽取约6秒完成,实测端到端10秒内即可检索。检索采用字面匹配、语义指纹与混合叠加三路,并按动态卡片前置、稳定内容置于系统提示末尾的双区注入策略兼顾召回率与KV Cache命中。冲突仲裁分两阶段,由模型决定新增、跳过、覆盖或合并,使新旧偏好以变更记录共存。
阅读原文8
商汤开源SenseNova U1.5-Lite-Preview,原生4K直出统一多模态模型
多模态开源模型图像生成
商汤开源轻量级原生统一多模态模型SenseNova U1.5-Lite-Preview,基于自研NEO-Unify架构,将语言理解、视觉语义与像素生成整合进单一系统。模型重新设计生成头,支持原生4K输出并减少高分辨率下的网格伪影与纹理断裂,可处理长指令、多重约束与结构化视觉指令,适合海报、信息图等高信息密度内容。其支持依据红框、标注等用户批注做局部编辑,在保持原有版式与主体稳定的前提下完成文字替换、风格调整与元素置换,并可一次读入多张参考图融合风格与内容。在Qwen-Image-Bench、ImgEdit-Bench等基准上优于上一代,但小字识别与人像细节仍有优化空间。
阅读原文9
Cursor推出Google Workspace插件,AI代理可直接读写Gmail与Drive
AI Agent开发工具
Cursor发布新插件,使AI代理能够直接在Gmail、Google Drive、日历、Docs与Sheets中读取、写入并执行操作,将编码代理的能力边界扩展到办公协作场景。这一方向与近期企业内部AI平台的建设趋势一致:Stripe基于LangChain的Deep Agents,仅用一名工程师、一周时间就搭建出内部知识AI平台Kai。此外LangSmith LLM Gateway新增BYOK支持,允许用户自带API密钥以沿用既有采购合同、避免token加价,配合成本上限、模型路由与内容过滤等运行时策略,构成生产环境智能体的控制平面。
阅读原文10
Baseten拆解推理工程:量化误差可相互抵消,吞吐提升20%
推理优化模型部署
Baseten的Philip Kiely与Ali Taha系统讲解生产级推理工程。他们指出这一学科三年前几乎不存在,如今涵盖缓存感知路由、prefill/decode解耦、投机解码、量化、KV缓存管理与自定义GPU内核,优化空间仍有20%到200%。一个反直觉发现是不同层的量化误差可以相互抵消:在GLM-5.2实验中,量化更多层反而保持了基准质量,同时吞吐提升20%。在每小时数百万token的量级上,按小时租用GPU的专属部署比按token计费的共享API更便宜可靠,且可定制任务专用草稿模型与精度方案。他们还指出训练与推理边界正在消融,GLM-5.2已被用于优化服务其自身的内核。
阅读原文