Mistral发布万亿参数Large 4,月底开放权重
Mistral AI发布Mistral Large 4预览版,采用MoE架构,总参数1万亿、激活参数490亿,并由3800块NVIDIA Grace Blackwell GPU训练。模型已通过API提供,支持「none」与「high」两档推理,开放权重计划月底发布。Artificial Analysis评分为38,位列DeepSeek 4.1 Flash之后,较Large 3提升明显。
阅读原文Mistral AI发布Mistral Large 4预览版,采用MoE架构,总参数1万亿、激活参数490亿,并由3800块NVIDIA Grace Blackwell GPU训练。模型已通过API提供,支持「none」与「high」两档推理,开放权重计划月底发布。Artificial Analysis评分为38,位列DeepSeek 4.1 Flash之后,较Large 3提升明显。
阅读原文Anthropic扩展Cyber Verification Program,将网络安全访问分为Defense Access、Red Team Access和Specialized Access三档,并按风险配置审查与控制。公司称,CyScenarioBench测试显示该机制可放行合法防御研究,同时阻止未授权操作;参与伙伴已在短期内发现超过12.9万个软件漏洞。
阅读原文Reflection发布纯文本MoE模型Beam,总参数5010亿、激活参数230亿,从零使用23.8万亿Token训练,面向编码、科学与智能体任务。公司称其SWE-bench Verified得分80.9,推理效率为GLM 5.2的3至4倍;训练还在1万块GB300 GPU上完成逾1亿次rollout,覆盖约100万项任务。完整权重计划本月以Apache 2.0许可证发布。
阅读原文Google发布EmbeddingGemma 2开发指南。该开放权重多模态嵌入模型基于Gemma 4,可按需加载文本、视觉或音频编码器,参数规模为2.7亿至7.4亿,并把不同模态映射到统一的768维空间。其MRL训练支持将向量从768维动态截短至128维,最多减少6倍向量库存储。Google称其代码搜索和技术检索优于上一代,适用于本地RAG与代码库索引。
阅读原文Baseten工程师把MetaInfer方法中的推理系统知识封装为Skills,交由Claude Code在单块B200、Qwen-3.6-35B-A3B和NVFP4精度约束下,自主编写并迭代VibeQwen引擎。实验持续约一周,消耗约200个B200小时和17亿Token;结果显示,单流解码速度较优化后的vLLM快90%,并发32时吞吐提高71%。该结果来自高度定制场景,不代表通用框架表现。
阅读原文TII发布Falcon-Emirati-7B,面向阿联酋方言及文化语境,采用Falcon-H1-Arabic混合架构,让Mamba与Transformer注意力并行运行,以兼顾长序列效率和阿拉伯语处理。团队选择70亿参数,是在30亿模型的表达深度与340亿模型推理成本间折中;训练数据结合本地方言网页、现代标准阿拉伯语文化材料及语言学家约束的合成数据。模型在Alyah榜单得分84.83%。
阅读原文LangChain在Open SWE测试Harness模型路由:先用LangSmith轨迹识别任务复杂度,再按线程首条消息选择快速、均衡或高性能模型,并在整段任务中保持不变。近500个线程显示,相比始终使用高性能模型,路由使中位成本下降64%、P90成本下降37%,合并PR率无统计显著差异。任务中34%进入快速档、56%进入均衡档、10%进入高性能档;快速模型对照测试因用户投诉在一天内终止。
阅读原文Browserbase团队称,LLM裁判可能显著高估浏览器智能体能力:同一WebVoyager智能体被原裁判评为74%成功,而更贴近人工标签的Universal Verifier仅评约38%。新验证器按任务生成准则,从轨迹中选取相关截图,并结合动作与最终陈述,分别给出过程分和布尔结果。团队用人工标注和留出轨迹测试,强调只评用户要求、隔离中间错误,并区分缺货等外部阻碍与智能体失误。
阅读原文数千位专业人士的首选,用 AI Daily Brief 开启每天的工作与生活。