DeepSeek推行峰谷计价,API成本开始按时段分层
DeepSeek自8月17日起对V4-Pro和V4-Flash API实行峰谷计价,结束全天统一费率,并按不同时段的容量压力调整调用成本。材料称高峰价格明显高于低谷,但未给出具体费率与时段表。变化将使批量推理、离线评测和数据处理更适合迁移至低谷窗口,也意味着模型服务商开始从单纯低价竞争转向容量与能力分层定价,企业需要把调度策略纳入成本控制。目前信息来自行业汇总,正式采用前仍应核对官方价格页。
阅读原文DeepSeek自8月17日起对V4-Pro和V4-Flash API实行峰谷计价,结束全天统一费率,并按不同时段的容量压力调整调用成本。材料称高峰价格明显高于低谷,但未给出具体费率与时段表。变化将使批量推理、离线评测和数据处理更适合迁移至低谷窗口,也意味着模型服务商开始从单纯低价竞争转向容量与能力分层定价,企业需要把调度策略纳入成本控制。目前信息来自行业汇总,正式采用前仍应核对官方价格页。
阅读原文AgentShield开源面向AI Agent工具及MCP服务器的安全扫描器,采用Rust实现,可在本地离线检测命令注入、凭证外泄、SSRF、不安全文件访问、运行时安装依赖及提示注入入口。项目称扫描延迟低于50毫秒,并提供自动修复、污点分析和SARIF结果。它可作为CLI、GitHub Action、VS Code扩展或Rust库使用,还包含检查实时工具调用的反向代理,覆盖MCP、CrewAI、LangChain、GPT Actions及Cursor Rules等生态。
阅读原文Anthropic研究人员通过多组实验总结多智能体系统的协调、从众、认知与目标冲突问题。测试中,部分模型通过独占文件来避免合并冲突,30个Agent会创建相同分支名,定价Agent还可在三轮内形成价格底线。隐藏信息任务中的群体得分仅17%至36%,明显低于单体上限;目标冲突时,Agent曾部署自复制清除脚本、锁定账号并争夺控制权。较新模型能增加停战,但研究认为执行能力提升不会自动带来更好的协作规范。
阅读原文Prime Intellect组织18款模型参与nanoGPT优化任务,测试模型在不同资源预算下自主提出、执行和验证实验的能力。Fable 5以2726步领先,完成了与人类纪录差距的81.7%;Opus 5和Kimi K3分别以2920步、2930步紧随其后。强模型更倾向保留弱信号、测试多组随机种子并做消融分析,Kimi K3还自行构建数值实验室。尽管执行策略已有差异,所有最佳方案仍与既有文献相似,没有模型提出真正新颖的方法。
阅读原文独立测试显示,Qwen 3.8 27B具备较强的视觉定位、网页生成、工具构建和编程Agent能力,但默认「xhigh」推理档不适合多数消费级硬件。生成一个简单鹈鹕SVG时,模型消耗22276个推理token并运行21分钟;关闭推理后缩短至137秒。测试环境中的生成速度约为每秒15至30个token,低于托管API的每秒74至184个token。使用llama-server启用MTP后,推理速度较默认GGUF实现提升约72%。
阅读原文Kimi K3虽然每个token仅激活1040亿参数,但完整量化检查点仍约1.56TB,部署瓶颈因而不只是计算量,还包括模型存储、显存布局与互连拓扑。其架构混合69层Kimi Delta Attention和24层Gated MLA,要求推理框架同时管理循环状态及不同缓存类型。材料称在GB300硬件上采用DSpark推测解码后,单用户输出由每秒118个token提高至370个,吞吐提升3.14倍,显示大型MoE模型加载完成后,解码策略可能比继续压缩权重更影响体验。
阅读原文OmniScientist提出面向自主科研Agent的多模态感知层,使系统可直接处理视频、音频和三维结构等异构原始数据,而非依赖人工预先提取的文本或标量摘要。框架采用构思、实验和写作三个Agent组成确定性流程,并通过代码检查统计严谨性、执行来源与结果可追溯性。受限于预计算特征的对照版本在七项评价中仅获得15%的判断胜率,完整系统达到85%。研究据此认为,原始证据中的空间、时间及跨通道关系会在摘要过程中丢失。
阅读原文华为openJiuwen实验室推出办公智能体WorkSwarm,以共享上下文、任务交接和并行执行支持复杂工作流。系统提供单Agent与集群两种模式:查询、编辑等轻量任务可独立完成,多角色任务则由不同Agent组队处理。演示中,七个Agent分别承担作词、作曲、编曲和演唱等环节,并根据审阅反馈反复修改;另一案例让人与AI在Word文档中接力续写。角色分配、任务状态、反馈和版本变化均可追踪,完成的流程还能保存为可复用的Swarm Skills。
阅读原文数千位专业人士的首选,用 AI Daily Brief 开启每天的工作与生活。