返回往期
2026年8月2日星期日
10 点要闻3 分钟阅读

今日要闻

1

OpenAI确认下一代模型Astra,单题成本不足2000美元攻克10项数学难题

OpenAI数学前沿模型

OpenAI公开确认下一代模型Astra存在,并发布其在数学与理论计算机科学上的十项进展,涵盖高维几何、编码理论、群论、量子复杂性等长期未解问题。按GPT-5.6 Sol的token价格计算,每个问题花费不足2000美元。全部数学证明由AI系统生成,人类研究者负责整理论文并在Lean 4中完成形式化验证,并对最终正确性负责;OpenAI在GitHub公开了Lean形式化代码与论文,并附上基于推理轨迹的推导演示PDF。据媒体报道,Astra定位为长程任务模型,支持多智能体长时间协作,参数规模接近GPT-5.6 Sol的两倍,与Sol、Terra、Luna构成新的天体命名体系。

阅读原文
2

MiniMax发布全模态视频模型H3:15秒2K视频含原生立体声,2K每秒0.13美元

视频生成模型发布MiniMax

MiniMax发布H3全模态视频生成模型,可生成15秒、2K分辨率并带原生立体声的片段。H3不是文生视频加插件,而是把文本、图像、视频、音频作为统一上下文处理。技术上,H3-VAE带来4倍有效序列长度收益,使原生2K在成本上可行;H3-Omni Transformer提升约30%训练吞吐;用上下文重生成替代超分模块,保留小字与品牌标识。定价为2K每秒0.13美元,低于主流模型。第三方评测显示其在文生视频与图生视频落后于竞品,但在视频编辑上领先。实测对比称其价格约为Seedance 2.0一半,支持一次生成四个不同版本与单镜头局部重做。

阅读原文
3

AMD开源Instella-MoE-16B-A3B,全程用Instinct GPU训练、激活参数2.8B

开源模型AMDMoE

AMD发布完全开放的混合专家模型Instella-MoE-16B-A3B,总参数16B、每token激活2.8B,每层配置2个共享专家与6个路由专家。架构上引入Gated MLA(为多头潜在注意力增加轻量学习输出门)与FarSkip-Collective,带来12.7%的训练加速,推理服务的首token时间最多降低39.2%。训练在AMD Instinct GPU上完成,使用来自开放语料的7.1T token,随后进行中期训练、长上下文扩展,并用Miles框架做强化学习后训练。权重以ResearchRAIL许可发布,仅限学术与研究用途,不能直接商用。

阅读原文
4

GitLost漏洞曝光:一句话Issue即可让GitHub AI Agent泄露私有仓库数据

AI安全提示注入Agent

研究者披露名为GitLost的攻击手法:攻击者无需任何编程技能,只需在公开仓库的Issue中嵌入隐藏指令,即可通过间接提示注入诱导拥有跨仓库权限的GitHub AI Agent,把私有仓库中的数据以公开评论形式泄露出去。分析认为,Agent依赖模型行为而非代码逻辑维持信任边界,用户输入本身即指令,使提示注入成为类似SQL注入的系统性漏洞。防御建议包括将Agent权限收敛至最小必要范围、在输入进入模型前完成净化,以及严格隔离输入与指令上下文。文章强调私有仓库从来不是安全边界,只是组织边界,Agent打破了这一前提假设。

阅读原文
5

李飞飞World Labs收购机器人仿真公司SceniX,补齐真实-仿真-真实闭环

具身智能世界模型并购

李飞飞创办的World Labs收购机器人仿真公司SceniX,补充物理属性复原、复杂交互仿真与机器人策略训练能力,推动世界模型从生成静态环境走向支持动态交互与动作预测。分析指出,物理AI训练正从单纯采集数据转向构建可交互的虚拟世界,其中R2S2R(Real-to-Sim-to-Real)闭环是关键:确保策略在仿真中的表现能可靠预测真实世界表现,通过虚拟环境放大训练场景,降低真机训练的成本与风险。物理AI的数据基础设施需要在真实性与多样性之间平衡——真实场景采集提供数据锚点,生成模型扩展数据分布,物理仿真器支撑动态交互。

阅读原文
6

Supabase开源Evals基准:容器化真实任务评测Claude Code、Codex与OpenCode

评测基准开源AI编程

Supabase开源评测框架Evals,用于在真实Supabase任务上给编码Agent打分,覆盖Claude Code、Codex与OpenCode等。框架启动真实的容器化Supabase技术栈,使用实际的MCP服务器与CLI工具而非mock,保证测试贴近真实环境;评分采用确定性检查与LLM-as-a-judge混合方式,评分前允许一次重试。结果显示Skills对小模型的提升远大于顶级Agent:在Build阶段,Opus 5与Kimi K3在无Skill辅助下均取得100%。评测同时暴露Agent的三类共性弱点:手工执行schema迁移、鉴权验证做法欠佳、文档使用不一致。

阅读原文
7

微软研究:多轮意图切换致GPT-5.5准确率从80%降至71%

LLM研究多轮对话微软

微软研究通过反向生成构建实验框架,评估LLM在用户意图动态演化下的表现,发现多轮意图演化(尤其是功能切换)会导致性能大幅下滑:GPT-5.5在BIRD-SQL上的准确率从80.0%降至71.0%,DeepSeek V3.2在BrowseComp+上从36.0%降至15.0%。功能切换是核心瓶颈,GPT-5.1在经历两次功能切换后,意图追踪准确率从99%降至82%。Prompt Recap、Oracle Recap等记忆机制虽有帮助但无法根治问题,即便使用Oracle Recap,GPT-5.5在功能切换场景仍达不到单轮80%的水平。研究认为被动回看上下文不是解法,系统需主动复述用户当前真实诉求并抑制无关上下文注意力。

阅读原文
8

DeepSeek-V4-Flash首次实现本地无损部署,Codex实测两个issue仅花0.31元

模型部署量化DeepSeek

DeepSeek-V4-Flash总参数284B、激活13B,采用量化感知训练(QAT),96%路由专家原生以MXFP4格式存储,使本地无损部署首次可行:UD-Q8_K_XL量化体积161.9GB,在1328个张量上达到比特级一致(KLD≈0),PPL与官方权重一致(4.5319),top-token匹配率100%;UD-Q4_K_XL为155.1GB的性价比方案,top-token一致率96.28%。部署可通过Unsloth Studio图形界面或llama.cpp命令行完成。另有开发者将其接入Codex修复两个真实mypy issue,共消耗4.36M token,缓存命中率98.1%,总成本仅0.31元人民币。

阅读原文
9

Claude Code之父:每半年清空一次claude.md、skills和hooks

AI编程Anthropic上下文工程

Anthropic的Claude Code创始人Boris Cherny在访谈中提出,使用AI编程工具正从依赖理论与固定方法的学科,转变为不断试错与再验证的经验科学。由于模型能力迭代极快,开发者应避免过度依赖预设的复杂架构,而是采用删除再添加的消融式方法观察模型在不同版本下的实际表现。他建议每半年清空一次系统提示、Skills与Hooks,因为Opus 5等新模型往往能自主完成过去需要显式指令的任务,冗余指令反而会束缚模型能力。其核心主张是识别模型已具备但产品未释放的能力(Product Overhang),通过截图对比、测试套件等验证工具诱导模型完成复杂任务,并走向对上千Agent的测试时算力编排。

阅读原文
10

字节Seedance 2.5实测:30秒单镜头直出,支持时间戳精确分镜

视频生成Seedance实测

多方实测显示豆包Seedance 2.5可稳定生成30秒单段单镜头视频,不再依赖拼接,适合完整广告与短片;通过时间戳指令可精确定义不同时间区段的内容,支持复杂分镜与导演式创作。普通话、粤语、法语等多语种口型对齐准确、生僻字发音正确、表情自然;八条测试视频均一次成功,稳定性与出片率明显提升。配套平台侧,小云雀接入Seedance 2.5后支持创意迁移(解析参考视频的运镜、动作与节奏)、按时间段甚至单秒的片段重拍,以及3D导演台可视化调度镜头轨迹与人物走位,使生成、检查、修改、复核形成闭环。

阅读原文

不要错过明天的 AI 简报

数千位专业人士的首选,用 AI Daily Brief 开启每天的工作与生活。