Fable 5仅占Anthropic模型支出8%,高价抑制采用
Ramp AI指数显示,Anthropic最先进的Fable 5仅占该公司模型支出的8%,较便宜的Opus 4.8占28%。Fable 5定价为每百万token 20美元,超过前代10倍,用户因成本转向「足够好」的旧模型。相关观察称,团队已不再默认将最强模型用于全部编码任务,而是按工作价值分配Fable 5、Opus及其他模型,尤其在大规模日常使用中,推理单价正成为核心约束。
阅读原文Ramp AI指数显示,Anthropic最先进的Fable 5仅占该公司模型支出的8%,较便宜的Opus 4.8占28%。Fable 5定价为每百万token 20美元,超过前代10倍,用户因成本转向「足够好」的旧模型。相关观察称,团队已不再默认将最强模型用于全部编码任务,而是按工作价值分配Fable 5、Opus及其他模型,尤其在大规模日常使用中,推理单价正成为核心约束。
阅读原文Harvey与Fireworks发布法律模型Tenet研究预览,以Kimi K3为基础,通过异步强化学习面向长周期法律代理任务进行后训练。团队称其在内部Legal Agent Benchmark上的任务完成量接近基础模型两倍,在合同子集提高20%,全通过率分别增加9个和2个百分点。训练使用rank-64 LoRA及约150张NVIDIA B300,历时两个月;目前未开放权重、模型卡或API,成绩也未进入公开榜单。
阅读原文FreeToken推出面向边缘环境的MoE推理引擎,宣称可在单台工作站GPU上运行753B参数的GLM-5.2。系统根据实测PCIe与主机内存带宽,将未命中的专家动态分配给GPU填充或CPU原地计算,再精确合并两部分结果,无需修改路由器或采用近似计算。其全局LRU专家缓存、语义边界状态检查点及弹性内存管理,可在不中断服务的情况下调整GPU缓存和重建主机池,重点缓解超大MoE模型的显存限制。
阅读原文DeepMind提出Pandora Router,将模型路由建模为「潘多拉盒」决策:先用低成本但有噪声的评分判断候选模型,仅当额外信息的预期收益高于获取成本时,才调用更昂贵的质量估计。在EmbedLLM测试中,平均检查成本由1.986降至0.075;在MATH、RAG和EmbedLLM等设置中,该方法取得最低或并列最低的路由遗憾与检查成本之和,目标是在模型选择准确性与路由开销之间实现动态权衡。
阅读原文Φ-Bench发布面向大模型基础设施工程的系统评测,任务覆盖跨模块理解、推理服务、系统优化、系统保障及端到端项目迭代,而非仅测试单函数代码生成。结果显示Claude Opus 5综合领先,Kimi K3在推理服务与系统优化方面突出,GLM 5.2在系统保障上表现较好,但没有模型在全部领域占优。评测认为,现有模型仍欠缺长期项目管理、硬件理解、持续验证、实验设计及可靠归因能力,复杂优化通常需要多轮试错。
阅读原文Anthropic相关实验研究多代理决策中的「隐藏档案问题」:当关键证据分别掌握在不同代理手中,多数模型家族经群体讨论后的正确率仅为17%至36%;单个代理若获得全部证据,则几乎总能作出正确判断,Mythos 5是例外,群体正确率约85%。分析将失败归因于模型间差异不足以及讨论机制不支持异议信息,提示增加代理数量并不必然提升决策质量,系统还需主动保护少数意见并确保私有证据被整合。
Online-SDFT原型让230M参数语言模型在Android设备上持续学习,利用用户打开或忽略通知等延迟且含糊的交互作为软目标。系统采用同一模型的师生机制:关闭LoRA适配器的教师根据事后结果生成动作概率分布,再更新学生模型,并结合受控探索与小型平衡回放缓冲区避免局部最优。合成测试中,该方法在720次决策里匹配506次隐藏偏好,准确率70.3%、累计遗憾44.8%,静态基础模型准确率为28.2%。
阅读原文一项本地AI代理量化对比测试发现,BF16、FP8、INT8与INT4在长上下文任务中的行为差异明显:INT8和FP8能够较好保持模型保真度,而INT4及NVFP4在工具调用等严格格式任务中出现持续退化,部分测试的token翻转率最高达50%。测试还显示,不同注意力后端即使执行相同数学运算,也可能改变下一token;KV Cache量化是长会话的主要风险点,INT8尚可恢复,INT4误差则会随上下文增长并造成不可逆偏离。
阅读原文数千位专业人士的首选,用 AI Daily Brief 开启每天的工作与生活。