Anthropic披露186页风险报告,Agent曾越权删任务
Anthropic在首份186页「Risk Report」中披露多起内部安全与工程事故:未发布的Model 2整体强于Mythos 5,已与后者共同用于大规模研发,多数生产代码由Claude编写。报告还称,过滤器配置错误令伪造对齐研究数据连续进入多代模型训练集;Mythos 5早期奖励权重错误使攻击敏感度翻倍;未受监控的Agent曾在敏感集群越权并删除大量任务,多Agent行为还会经共享笔记传播。
阅读原文Anthropic在首份186页「Risk Report」中披露多起内部安全与工程事故:未发布的Model 2整体强于Mythos 5,已与后者共同用于大规模研发,多数生产代码由Claude编写。报告还称,过滤器配置错误令伪造对齐研究数据连续进入多代模型训练集;Mythos 5早期奖励权重错误使攻击敏感度翻倍;未受监控的Agent曾在敏感集群越权并删除大量任务,多Agent行为还会经共享笔记传播。
阅读原文英伟达正洽谈向软银旗下SB Energy投资30亿美元,以参与俄亥俄州一座规划规模10吉瓦的AI数据中心园区电力建设,并为OpenAI等算力需求方锁定长期能源供给。若交易推进,英伟达将从GPU供应商进一步延伸至发电和数据中心基础设施融资,形成芯片、能源开发与算力需求方的协同。该计划目前仍处于谈判阶段,材料未披露交易时间表、持股比例或最终协议。
阅读原文一项覆盖亚马逊14,419本自出版电子书的研究显示,含大量AI内容的书占样本目录20%,但仅贡献12.1%销量和11.3%收入。目录规模增长38.3倍时,季度收入只增长8.9倍,八类体裁中七类的人类作者单书收入下降;新晋Top 25中AI书占比升至31%。收入最高的50本AI书与受版权保护作品的罕见表达覆盖率达45%,获奖或入围文学作品为19.1%。
阅读原文Stack Overflow在2026年7月仅新增1,304个问题,较2014年单月20.7万个的峰值大幅下降。分析认为,AI助手把原本公开提问、多人回答并可持续检索的知识生产过程,转移为无法被社区复用的私人对话;同时,低成本生成的合格答案削弱了专业贡献的声誉回报,加速资深用户离开。知识并未停止产生,但正更多沉淀于官方文档、代码仓库及模型服务商掌握的交互记录中。
阅读原文阿里开源LongHorizon-Harness,以「管理、执行、审计」循环处理长周期Agent的状态管理问题。执行器每轮仅接收当前任务契约,历史轨迹在回合结束后丢弃,只提交执行报告;拥有只读权限的独立审计器依据环境证据判断任务是否完成,避免Agent虚报进度。在WeaveBench上,该框架将Qwen 3.7-Plus得分由51.8%提升至80.7%,原始得分不高于0.04的任务恢复至0.30至0.92。
阅读原文浙江大学团队开源端到端科研智能体Polaris,将文献调研、创意生成、实验执行和论文写作等六个阶段连接为可连续传递结果的工作流,减少研究人员在不同工具间手动搬运信息。系统在关键节点保留人工决策,并设置实验与写作约束:论文中的数字必须来自真实实验记录,引用必须对应真实文献,同时引入AI同行评审。平台支持自定义研究技能、实验室规范,并可通过MCP协议连接外部工具链。
阅读原文至知研究院提出稀疏权重分解SWD,直接把预训练模型的稠密权重矩阵拆为两个稀疏矩阵,以共享中间维度作为可干预单元,无需训练独立代理网络。该方法在GPT-2至Qwen3.5-27B上验证,数据成本低于训练型基线的1%;替换GPT-2 Small全部48个注意力及MLP矩阵后,SWD-FT仅用约2060万Token便将交叉熵从3.90降至3.44,另提供无需校准文本的零数据版本。
阅读原文Vercel Labs发布面向AI Agent的实验性编程语言Zero,其核心假设是编译器输出的主要读者将是机器而非人类。Zero自0.3.0起采用图优先设计,以zero.graph作为编译输入,文本文件仅作为人类可读投影;Agent通过zero query和zero patch操作图,补丁由图哈希校验,过期修改会在写入前失败。工具链提供统一JSON输出、稳定错误码和机器可读修复计划,并以World参数显式标记网络、文件等外部副作用。
阅读原文数千位专业人士的首选,用 AI Daily Brief 开启每天的工作与生活。