Asana优化浏览器智能体,成本降76倍
Asana通过StackAI研究浏览器智能体效率,先由GPT-6 Astra在Codex中定位历史记录与截图被反复发送的问题,再以更长缓存和更智能的图像处理优化GPT-6.1 Sol。单次平均模型成本由逾36美元降至0.47美元,约缩减76倍;执行时间从22分钟降至4分钟,并在收集32本书条目的测试中实现100%任务完成。该案例表明,降低上下文重复传输可同时改善成本、速度和可靠性。
阅读原文Asana通过StackAI研究浏览器智能体效率,先由GPT-6 Astra在Codex中定位历史记录与截图被反复发送的问题,再以更长缓存和更智能的图像处理优化GPT-6.1 Sol。单次平均模型成本由逾36美元降至0.47美元,约缩减76倍;执行时间从22分钟降至4分钟,并在收集32本书条目的测试中实现100%任务完成。该案例表明,降低上下文重复传输可同时改善成本、速度和可靠性。
阅读原文天体物理学家Brice Ménard借助Claude Science编排多个智能体,处理和交叉校准大规模天文数据、去除大气辉光,并补齐以往紫外巡天留下的缺口。由于GALEX等任务为保护探测器避开明亮恒星和银河平面,既有紫外天空图并不完整;项目进一步利用可见光、红外和射电观测训练机器学习修复模型,预测未观测的紫外像素,形成首张完整紫外天空图,展示了智能体承担耗时科研数据流程的方式。
阅读原文PyTorch介绍NVIDIA Dynamo的会话感知推理机制。智能体任务包含大规模预填充、连续工具调用和并行子智能体,普通逐请求路由易引发缓存抖动与重复计算。Dynamo用稳定session ID串联同一推理轨迹,在多轮请求间保留上下文;调度器按会话工作集分配资源,并在工具边界实施背压。其索引器与KvHint接口协调HBM和DRAM间的KV缓存移动,使基础设施从处理单次请求转向理解完整程序执行。
阅读原文Postman为横跨150多个微服务和数千个REST端点的编码智能体构建API上下文图,已映射115个微服务,将服务、调用方、实现、数据路径和应用关系连接,并要求每项事实回溯至代码行或生产遥测。团队以真实PR和设计决策比较图谱增强智能体、Claude Code与普通代码搜索;一项影响分析的Token消耗仅为后者的二分之一至三分之一。测试还显示,旧图谱会漏掉新增消费者且成本更高,因此及时同步是正确性前提。
阅读原文Ai2以分层预算调度替代静态优先级,管理者可按研究项目影响分配GPU时间比例,而非把固定设备长期划给团队。调度器在默认7天滑动窗口内比较实际占用与预算,优先安排使用不足的负载,并将闲置资源转给活跃任务。系统还引入调度契约,任务须声明最短运行时间及能否恢复,以自动排空故障节点,减少维护期间的人工抢占和运维干预,同时维持公平分配与较高集群利用率。团队称这也改善了用户满意度。
阅读原文WorkOS推出WOW CLI与Atlas平台,让非工程员工自行检查开发依赖、从模板创建代码库并部署内部AI应用。Atlas把Cloudflare Workers、D1和KV封装进标准流程,默认提供公司SSO、API令牌、请求日志、Doppler密钥管理和应用目录。公司已登记278个应用,展示当日有21次部署,每周请求超过330万次,约60个应用被持续使用;其中37%的应用提交没有工程师参与。细粒度授权、数据集成和Slack部署仍待补充。
阅读原文NVIDIA披露KGMON团队在KDD Cup中构建数据分析智能体的方法:将CSV、JSON和数据库统一导入SQLite,让模型通过单一SQL接口访问结构化数据,并只开放模式检查、查询和文档读取等少量工具。持久化Python环境可跨调用保留变量,中间件修复格式错误;文档与视频先提取关键信息或表格,避免直接输入原始内容。系统还记录完整执行轨迹,以归类失败并迭代测试,减少路由错误和无效轮次。
阅读原文Neo4j提出以统一上下文图管理智能体的短期消息、长期实体和推理记忆,通过共享本体完成实体消歧,并记录决策依据、策略、工具调用、结果、Token消耗与时延,使大量智能体复用彼此经验。其研究把Agent Skills扩展为带类型和模式约束的执行图,再从真实记忆中蒸馏可追溯技能,以覆盖度和社区检测检查依据及主题一致性。当前免费的NAMS服务通过REST和MCP提供相关能力,并标记过期或漂移技能。
阅读原文数千位专业人士的首选,用 AI Daily Brief 开启每天的工作与生活。