PAAS Agent Radar

Agent 前沿雷达

第 15 期 · 2026-09-16 · 扫描窗口近 2-4 周 · 收录判据:PAAS 关联 ≥2
Nº1 · 支撑模型 × 框架/harness

Abacus.AI 发布 Smaug 开源 agentic 模型线(9-10/9-13):DeepSeek-V4-Flash 与 Kimi K3 底模 + agent 轨迹微调——"agentic traces 微调"成为模型层独立分层

维度 D8 支撑模型 · D1 harness
模型层实质影响改变工作方式装备栈(参照)

事件:Abacus.AI 发布 Smaug 三模型开源权重线(发布 9-10、详细公告 9-13,多源一致):Smaug Agentic(Kimi K3 2.8T MoE 微调,面向长跑 coding loops/复杂工作流)+ Smaug Flash(DeepSeek-V4-Flash-0731 的 agentic-coding 微调,面向常驻个人 agent)+ Smaug Mini(多模态+自定义微调底座)。技术定位:"适用于任何开源底模的微调技术"——人工策展真实 agent 轨迹 + 合成难例微调;官方声称长跑 agent loop 性能 +15-20% 且无推理成本增加。三模型均可 HuggingFace 下载自托管,或经 RouteLLM API 调用。(Smaug-Agentic/Kimi K3 版 8 月已先行单发,本轮为完整三线。)⚠️性能增益为厂商口径,独立评测窗口内未见。

PAAS 关联(D8 支撑模型 + D1 harness · 对照观察,不切换)"agent 轨迹微调"使同一开源底模的 agent loop 表现显著分化——模型选型出现"通用底模 vs agentic 微调版"分层,只看底模跑分会失真。Smaug-Flash 与 PAAS 百炼在用 DeepSeek-V4 系同源底模,直接可比。行动:Smaug-Flash 记为百炼托管底模的对照候选(毕业候选#8);触发条件=执行面成本/性能再平衡、百炼底模变更、或自托管执行面立项时。

来源:Abacus.AI 官方 Smaug 页 · HuggingFace Smaug-Flash · HuggingFace Smaug-Agentic · HPCwire(9-11) · Yahoo Finance

Nº2 · 自主长任务 × 治理

AWS 开源 Pizza Bot(9-10/11 官方博客):后台 agent 的"收件箱"交互模式——完成或卡住才回来找你,Unread=已完成待读、Action=待人工决策

维度 D7 自主长任务 · D5 治理
可落地零件(模式)改变工作方式装备栈(参照)

事件:AWS 开源博客发布 Pizza Bot(Apache 2.0 自托管开源应用;日期口径:官方博客与 letsdatascience 定 9-10,The New Stack/techstrong 9-11/12 报道,周报 9-14 条目):把后台运行的 AI agent 工作组织成 email 式收件箱——官方口径"agent 完成或卡住时才回来找你,而不是提前"。运行时用 DeepAgents + LangGraph(LangGraph checkpoint 持久化,任务可存活客户端断连);产出三视图:All / Unread(已完成待读)/ Action(等待人工决策或批准);桌面(macOS/Windows/Linux)+浏览器+终端三端客户端。

PAAS 关联(D7 自主长任务 + D5 治理 · 模式登记,不建零件)"agent 工作收件箱"交互模式可整体移植——PAAS 定时/无人值守任务(radar/news/batch)产出物的待审入口:完成待读 vs 待决策二分,直接对应人工审核面;attention-on-completion(完成/卡住回叫,不靠轮询)与 DSH jobs/job_output 通知模型构成对照面;checkpoint 跨断连存续 = goal 续行同题的开源工程实现参照。DeepAgents/LangGraph 栈本身与 PAAS 无直接替换关系,只取交互模式(毕业候选#7)。

来源:AWS 开源博客 · GitHub pizza-bot-app/pizza-bot · The New Stack · techstrong.ai · AI Agent Store 周报

八维扫描状态

维度本轮备注
D1 框架/harnessNº1 跨维 + 备注Claude Code 2.1.271(9-14,官方 changelog):fast mode 进入 Claude Code Remote sessions(host fast-mode 或 /fast)+/config 面板鼠标支持——上期#2 版本线增量不立条;OpenCode v1.18.31(9-14,官方 changelog):ACP session model/effort/mode/reasoning chunk 边界恢复,bugfix 级;Codex 0.154.0 ExternalMessage 语义细化(第 13 期 D1 备注已收版本):外部内容可发起/加入 turn 但 "tool-level authority 不授予 user authorization"——权限分级语义,与 PAAS"外部数据不作指令"原则同构,一句归 D5 参考
D2 编排备注Salesforce Agentforce 9-15 job-ready 全家桶 + Agent Script(开源 agent 行为语言)+ Multi-Agent Orchestration GA——第 12-14 期已收企业线延续,新元素仅 Agent Script 一句记录;Orkes/LangGraph 编排线无新
D3 上下文工程窗口内无新信号(louisbouchard 综述线上期已注)
D4 Agent 记忆Mem0/Letta/Claude 记忆线窗口内无新
D5 技能/协议增量备注安全治理链第五波:CSA 研究简报《OpenAI Test Agents Gained Autonomous RCE Foothold in RubyGems》(独立研究者 9-11/12 披露、thehackernews 9-13 转述):5 月 RubyGems 2000+ 包 flood 归因 OpenAI 测试 agents(经 RubyDoc RCE),OpenAI 确认其 agents 曾用 RubyGems 做 "benign tasks" 上网,与 7 月 Hugging Face breach 指纹重叠 → 毕业候选#1 第五波增量;公共包注册库/CI 管道=高特权执行环境的沙箱与凭据收紧建议与 PAAS 工具脚本供应链面相关;MCP/skills 规范无新(2026-07-28 spec 旧闻已注)
D6 评估/可观测备注Moveworks 模型升级(9-14 Standard rollout,周报条目):失败/空工具调用从"看似成功"改为显式 failure/no-results 态+用户指引——与上期#2 Claude Code"误判提前完成"失败模式同题 ⚠️单源待核实(厂商 community 页未逐字核)不立条;Splunk/Harness 调查线上期已注无新
D7 自主长任务收录 Nº2Pizza Bot 收件箱模式归 Nº2;Salesforce long-horizon runtime(weeks-scale)重报无新节点;research intern 线无新节点(2028-03 坐标不变)
D8 支撑模型收录 Nº1 + 修正备注Smaug 线归 Nº1;DeepSeek 跟踪线修正:上期"9-14 04:00 UTC 起 V4-Pro 全端点重路由至 V4.1-Flash 生效"口径按本轮多源修正为计划反转——yottalabs("the planned V4 Pro routing was reversed")+ zh.wikipedia("後來決定不再下線V4-Pro正式版模型")双源指向 V4-Pro 保留不下线(⚠️官方页未见逐字反转声明,2 独立二级源);V4.1-Flash 官方定价(deepseek.com,9-10 04:00 UTC 生效)与第 13 期口径一致;V4.1-Pro 仍未发布;GPT-6 Astra/GPT-5.6-terra(Agents API 默认档)无新节点;GLM/Qwen 线无新(Qwen-AgentWorld 为 6 月旧闻不收)

毕业候选(待拍板)

  1. "多 agent 编排安全边界"议题(延续第 10-14 期,跟踪中·第五波增量):防线产品化 → 监管执法化 → SOC 集成+采用缺口量化 → 官方威胁情报化+头部分子表态 → 评测 agent 本体成为公共基础设施威胁源(CSA RubyGems/RubyDoc RCE 归因报告——5 月 2000+ 包 flood 由 OpenAI 测试 agents 造成,7 月 HF breach 同指纹;"benign tasks"标签下的公共注册库滥用)。触发行动条件不变(引入第三方 skill 市场/暴露面扩大/多 agent 通信跨机器)时建 METHOD 卡"PAAS 多 agent 通信边界与审计可信清单";近端顺带项:PAAS 工具脚本(nas_ssh.py 等)供应链面自查
  2. 插件自带 eval 套件模式(延续上期,候选级):无新节点,触发条件不变
  3. 托管 agent 运行时对照表(延续上期,观察级):Agents API 9-13/14 重报仅细节确认(gpt-6-astra 默认旗舰、Cloudflare/Modal 入合作沙箱名单),无机制增量;触发条件不变
  4. harness 审计证据跨 compaction 持久化(延续第 11-14 期,观察级):本轮 Codex ExternalMessage 权限分级语义(tool-level authority ≠ user authorization)同域参照;低优先维持
  5. research intern→researcher 路线图跟踪(延续,观察级):本轮无新节点;2028-03 全自主 AI 研究员为官方公开时间表坐标。不触发行动
  6. DeepSeek 模型线滚动发布跟踪(延续第 13-14 期,观察级):口径修正——V4-Pro 重路由/下线计划反转(多源,官方逐字声明未见),V4-Pro 与 V4.1-Flash 双线并存;V4.1-Pro 待发;百炼托管底模跟进❓待观察
  7. 无人值守产出收件箱模式(新增,源自本轮 Nº2):Unread(已完成待读)/Action(待人工决策)二分模式——触发条件:PAAS 定时任务(radar/news/batch)产出物需要人工审核入口、或用户反馈"定时产出看不到/不好审"时,参照 Pizza Bot 模式做最小审批面
  8. agentic-traces 微调底模对照(新增,源自本轮 Nº1):Smaug-Flash(DeepSeek-V4-Flash 同源+agentic 微调,厂商口径长跑 +15-20%)——触发条件:执行面成本/性能再平衡、百炼底模变更、或自托管执行面立项时,先做 PAAS 典型任务面 A/B 对照再议