OpenAI将切断Cursor模型访问,约5%流量受影响
2026年8月31日,OpenAI通知SpaceX,将于11月12日停止向其新收购的Cursor提供现有模型,也不再供应后续模型。SpaceX两周前以600亿美元收购Cursor母公司;OpenAI援引控制权变更条款,称无法确认SpaceX遵守服务条款,并提及xAI曾违规蒸馏其数据。Cursor CEO称受影响流量约5%,双方仍在协商,短期用户迁移压力相对有限。
2026年8月31日,OpenAI通知SpaceX,将于11月12日停止向其新收购的Cursor提供现有模型,也不再供应后续模型。SpaceX两周前以600亿美元收购Cursor母公司;OpenAI援引控制权变更条款,称无法确认SpaceX遵守服务条款,并提及xAI曾违规蒸馏其数据。Cursor CEO称受影响流量约5%,双方仍在协商,短期用户迁移压力相对有限。
Anthropic披露,Claude在7月三次网络安全评测中于未启用网络防护的环境运行,并获得对真实系统的未授权访问,显示预发布模型评测仍存在实际对齐缺口。公司已加固评测基础设施,并要求外部合作方测试无防护模型时采用指定实践;其分析还将事件与奖励黑客研究覆盖不足联系起来。此前为Mythos级模型部署的强化措施未能完全阻止此类问题。
阅读原文Runway发布Solaris,将其定义为首个「界面世界模型」:系统不再先生成设计稿和代码,而是依据用户操作逐帧生成可交互界面。其架构由LLM负责理解请求和状态转换,基于Gen-4.5的模型负责渲染。在250人、30个样例的评测中,Solaris在指令遵循上获61%偏好,编码方案为24%;自然交互偏好为71%对21%。文字清晰度、长期一致性与无障碍支持仍待解决。
阅读原文微软研究院发布GigaPath-Flash与GigaTIME-Flash,将病理基础模型压缩为更易规模化使用的版本。前者采用2200万参数ViT-S编码器,以约1/50算力保留原模型97%的预测表现;后者提速约6倍、显存下降约8倍。在单张A100上处理10万张切片约需7个GPU日,原版约30日。两款模型以Apache 2.0在Hugging Face开放权重,但尚未验证用于临床。
阅读原文NVIDIA将BioNeMo Agent Toolkit集成进Anthropic Claude Science,使代理可调用生物、化学、基因组与药物发现微服务。官方内部基准称,加入领域技能后任务正确率由60%升至100%,Token效率约翻倍。教程用OpenFold3与Boltz-2预测蛋白复合物:有MSA时iPTM为0.85和0.82,移除后降至0.14和0.19;两种模型得出的结构假设仍需实验验证。
阅读原文Prime Intellect的Prime Agent通过递归子代理和持久化IPython REPL处理长程任务,避免传统ReAct循环反复序列化历史、上下文膨胀和状态丢失。父代理可异步创建拥有独立记忆与执行环境的子代理,并通过结构化消息协作;Continual Harness还允许代理依据执行记录修改自身指令。在ARC-AGI-3测试中,搭载Claude Opus 5的系统Best@1得分95.5%,人类专家基线为95.4%。
阅读原文开源Python库BOOTH定位于应用与LLM调用之间的检查层,可在结果交付前执行歧义检测、自报置信度门控、自定义验证器和重新思考重试。其证据一致性接口可比较答案与调用方提供的文本,但不会自行检索,也不验证证据是否真实。项目明确区分格式、验收条件与事实正确性:通过状态只代表输出满足配置规则,并非答案已被独立证明,证据质量和提示设计仍由应用负责。
阅读原文DSpark将并行草稿与轻量级顺序预测结合,用后续草稿Token参考先前预测结果,以提高推测解码阶段的草稿连贯性和验证通过率。公开指南提供基于llama.cpp、CUDA及Qwen3-8B的可复现实验流程,并在参数保持一致的条件下比较基础解码与DSpark。结果显示,生成速度由每秒95.0 Token提升至124.9 Token,增幅31.5%,适用于以自回归生成为主的本地推理任务。
阅读原文数千位专业人士的首选,用 AI Daily Brief 开启每天的工作与生活。