Google推出Interactions API,统一模型与智能体调用
Google DeepMind展示Interactions API,以统一接口承载模型、多模态生成和长时智能体。interaction ID可跨请求保留上下文与思维签名,typed steps统一描述图像、音频、搜索及工具调用。托管智能体可在远程沙箱中分析GitHub仓库,并凭environment ID复用文件与依赖;代理还能注入凭证,避免模型直接接触令牌,但定价、规模和安全评测尚未披露。
阅读原文Google DeepMind展示Interactions API,以统一接口承载模型、多模态生成和长时智能体。interaction ID可跨请求保留上下文与思维签名,typed steps统一描述图像、音频、搜索及工具调用。托管智能体可在远程沙箱中分析GitHub仓库,并凭environment ID复用文件与依赖;代理还能注入凭证,避免模型直接接触令牌,但定价、规模和安全评测尚未披露。
阅读原文VS Code称已从延续十年的月度发布转为每周发布,服务逾5000万用户。团队统计智能体生成代码最终进入提交的比例,该指标由GPT-4.1时期的55%升至86%,归因于更新模型与Harness改进。配套措施包括TypeScript Go将构建提速10倍、截图和Playwright提供界面反馈、AI审查先于人工审查,以及分阶段上线、自动议题分流和VSC-Bench评测。
阅读原文上海初创公司StartLux推出Decision开源决策模型系列,覆盖0.8B、2B、4B、9B和27B五种规模。材料称Decision-27B在38项Decision Index测试中有31项超过Jev,并在棋类对局中表现突出。其本地智能体架构由27B通用模型、负责高频判断的Decision模型、长期记忆模块和跨应用Agent Harness组成;Auto Research系统将方向设定到模型验证压缩至3天。
阅读原文AssemblyAI披露自建客服智能体Joey,以应对每天约1000个API注册用户。此前接入文档的成品机器人只能解决约10%的对话,且提示词、工具和RAG难以调整;Joey改用随文档仓库更新的Markdown、Voyage向量检索及文件系统搜索。公司称上线首周端到端解决率达到80%,Token与基础设施月成本约700美元;法律、隐私和费率变更等事项仍转交人工。
阅读原文Docker展示面向智能体的Sandboxes功能,通过sbx run启动拥有独立内核与文件系统的MicroVM。演示中,普通桌面编码智能体可读取主机浏览器历史,而沙箱内的同一智能体无法看到主机浏览器,网络请求也在策略下被阻止。现有能力包括密钥处理、审计记录、网络和文件系统控制、MCP服务器隔离及只读仓库挂载;Layer 7策略、委托追踪和细粒度仓库权限仍属后续规划。
阅读原文Crusoe展示运行于Kubernetes之上的托管Slurm训练平台,目标是在保留研究人员原有调度方式的同时,自动处置GPU节点故障。XID 79出现后,系统会标记并排空节点、终止和重排任务,再从备用容量替换故障机器,训练依靠检查点恢复。在两张A100的模拟实验中,节点更换约耗时5分钟,连同应用启动和检查点加载,总停机时间低于15分钟;该结果尚非大规模集群统计。
阅读原文Sourcegraph发布agentic batch changes测试版,面向企业跨数百或数千个代码库执行补丁、迁移和漏洞修复。产品将编码智能体用于需要判断的环节,把确定性脚本用于重复操作,并根据CI及拉取请求反馈继续迭代,同时追踪受影响位置的覆盖情况。早期案例中,Mercari用户从两个已知存在漏洞的仓库出发,又识别出80个潜在实例;但检测准确率、完整上线结果和运营成本尚未公开。
阅读原文AWS研究人员以Strands Agents演示运行时元工具机制:智能体初始仅配备编辑器、Shell和工具加载器,即可在会话中编写计算器与字符统计工具,动态加载后立即调用,无需重启。另一项旅行规划演示中,系统依据模板创建航班、活动和行程子智能体并组织协作,但无法获取实时天气等外部信息。演讲强调上线前需评估任务完成、工具参数和智能体间消息,并限制权限、隔离执行环境及保留追踪数据。
阅读原文Temporal提出将人工参与视作异步API调用,而非阻塞智能体线程。演示中的订单工作流在高价值交易前记录等待条件,人工批准以信号形式异步送达,并可设置超时。讲者在审批期间关闭Worker、离线发送批准后再重启,系统通过事件日志重放恢复状态,继续派送且不重复已完成步骤。该模式可接入Google ADK和LangGraph,适合高错误成本场景,但审批过多可能造成告警疲劳。
阅读原文Google DeepMind研究团队提出AI意识评估框架,将不同理论归纳为五层:系统行为、运行算法、硬件连接、是否属于具有切身利害的生命体,以及与外部世界的连接方式,每层均配有可测试指标。文章认为,现有AI在行为层表现较好、算法层表现不均,在硬件、生命属性和世界连接三层明显不足。Exponential View团队按不同理论组合测试,所得可信度为0.003至0.083,但结果高度依赖理论选择。
阅读原文数千位专业人士的首选,用 AI Daily Brief 开启每天的工作与生活。