xAI发布Grok 4.6,强化编程与知识工作能力
xAI发布Grok 4.6,定位为兼顾性能、成本与速度的通用模型,重点提升高难任务、编程、工程及知识工作表现。同步公开的模型卡覆盖能力评测和部署前安全测试,发布方还展示了该模型在Artificial Analysis Intelligence Index上的结果。材料未提供具体分数、API价格及开放范围,目前可确认模型已正式发布,实际性价比仍待官方文档与独立测试验证。
阅读原文xAI发布Grok 4.6,定位为兼顾性能、成本与速度的通用模型,重点提升高难任务、编程、工程及知识工作表现。同步公开的模型卡覆盖能力评测和部署前安全测试,发布方还展示了该模型在Artificial Analysis Intelligence Index上的结果。材料未提供具体分数、API价格及开放范围,目前可确认模型已正式发布,实际性价比仍待官方文档与独立测试验证。
阅读原文阿里Qwen团队开放Qwen3.8-2.4T-A95B模型权重,这是Qwen-Max级别模型首次开放权重。模型采用2.4万亿参数MoE架构,每个Token激活950亿参数,原生上下文长度为256K,并可扩展至1M。其512个专家中每次激活10个及1个共享专家,同时采用多步Token预测训练,重点强化编程、办公、科研及长周期Agent任务的端到端完成能力。
阅读原文Anthropic宣布开始在Claude生成文本中嵌入不可见、机器可读的水印,以满足生成内容透明度要求。该信号可在复制粘贴及轻微编辑后保留,具体实现方式尚未公开,可能利用词语选择形成统计特征。现有信息同时表明,重写或文本规范化仍可能移除这类标记,因此水印更适合辅助识别与溯源,而不能单独作为内容真实性证明;其检测工具、适用模型和上线范围尚未披露。
阅读原文Google为Gemini应用新增14项外部服务连接,用户可在统一对话中调用已授权应用,完成规划、内容创建及待办管理。官方示例包括从Zoho Bigin读取活跃交易,以及汇总Granola中的会议记录,显示连接能力正覆盖CRM与知识工作场景。Gemini同时宣布基于MCP的新应用连接将在未来数周逐步推出,但材料未披露完整应用清单、地区范围、套餐限制及第三方数据权限规则。
阅读原文Anthropic更新Claude Chrome体验,浏览器侧边栏现可运行与桌面端、网页端和移动端一致的Cowork会话,用户能在标签页中启动任务并在其他设备继续处理。会话记录、Skills及Connectors均可在浏览器环境使用,当前面向Max和Team用户逐步开放,Pro用户随后获得支持。演示场景中,Claude可检查多个发票标签页并把金额写入Google Sheets月度报表,同时官方提醒防范网页隐藏指令攻击。
阅读原文瑞典AI软件公司Lovable完成4亿美元C轮融资,投后估值达到133亿美元,较八个月前约翻一倍。公司年化收入已接近6亿美元,客户覆盖近三分之二的财富500强企业,显示自然语言生成应用和软件的需求正从个人开发者延伸至大型组织。材料未披露领投方、融资条款、资金用途及盈利情况,因此目前能够确认的核心进展是融资规模、估值增幅、收入水平与企业客户渗透率。
Mistral计划到2030年在欧洲建设最高1吉瓦的AI算力基础设施,以扩大本地模型训练和推理能力,并增强欧洲对自主AI基础设施的掌控。公司已开始寻求长期客户承诺,为后续容量建设与资金安排提供需求保障。材料尚未披露数据中心选址、分阶段投产计划、芯片供应商、建设成本或已签约客户,因此该项目目前仍处于扩张规划和商业承诺募集阶段,实际落地规模取决于后续合同与基础设施进展。
OlmoEarth Studio新增基础模型嵌入按需导出,用户可选择区域、月份、编码器、空间分辨率及Sentinel-1或Sentinel-2影像,结果以int8 Cloud-Optimized GeoTIFF提供。嵌入可用于相似度搜索、少样本分割、变化检测和PCA探索;其中,基于192维特征及60个标注像素训练的线性分类器,在红树林、水体和其他地类识别上取得0.84的F1分数。
阅读原文Google Research提出知识画像框架及WikiProfile基准,用五类状态区分事实未编码与已编码但无法直接回忆。研究显示,Gemini 3、GPT-5等前沿模型已有95%至98%的测试事实被编码,但直接生成答案时仍有26%至34%出现回忆失败。思维链可恢复40%至65%的已编码不可访问事实,对未编码事实的改善仅为5%至15%,表明事实性优化重点可能由扩充知识转向提升知识访问能力。
阅读原文微软研究院发布MindTopo基准,评估多模态大模型对连续性、分离、顺序、包围和绳结五类拓扑关系的理解。测试结果显示,模型在单幅场景中的静态关系识别明显优于交互式规划;即使正确感知初始场景,也常在多步操作中丢失目标关系、采用局部合理但整体无效的动作,或违反环境约束。图像生成有时可辅助单帧判断,但视频推演仍会改变拓扑结构,难以可靠支持长程规划。
阅读原文数千位专业人士的首选,用 AI Daily Brief 开启每天的工作与生活。