《一周AI速览202610A》|AI开始上夜班——智能体常驻,模型竞争改算完成成本

夜间智能体运营中心,象征常驻 AI、模型成本与可审计工作流

本周,AI开始上夜班了。

它不再等人打开对话框才动工。一批新产品把智能体变成了全天候在线的“数字同事”:它们有自己的云端电脑、工作记忆、应用连接和任务队列,可以在人离开屏幕后继续推进工作。与此同时,模型公司把价格战从“每百万 token 多少钱”推向“完成一件事到底要花多少钱”。快、便宜、可控和能够持续执行,开始被放在同一张账单上比较。

一、智能体常驻:从“回答问题”变成“持有职责”

OpenAI 在 DevDay 2026 推出 Dot。它由 GPT‑6 Astra 驱动,拥有独立云端电脑,可连接 4000 多款应用,通过 ChatGPT、Slack、Teams 等渠道与人协作。用户可以一边继续提交新任务,一边让 Dot 在后台推进多个项目。它能监看客户反馈、准备修复、更新发布材料,也能在研究数据变化时重新运行分析并修改图表。

xAI 的 Team Bots 则把类似能力放进团队。一个共享机器人可以获得文件、应用、凭据、技能与记忆,连接 Notion、GitHub、Linear、Datadog 等系统,在 Slack 中跟进项目、拆解问题、创建工单,再调度其他代理执行任务。它的价值不在一次聊天有多惊艳,而在能否持续记住团队的规则和历史决策。

洞察与点评: 智能体的产品单位正在变化。以前卖的是“一次推理”,现在卖的是“一段可连续履行的职责”。这会重新定义计费、权限和责任边界:一个同事可以下班,一个持续在线的智能体却必须始终有人知道它正在做什么。

二、GPT‑6.1 Sol:前沿能力开始对准预算表

OpenAI 的 GPT‑6.1 Sol 针对智能体编程、计算机使用和专业知识工作做了升级。官方给出的定位很直接:性能接近 GPT‑6 Astra,标准输入和输出价格只有 Astra 的五分之一。API 价格为每百万输入 token 2 美元、输出 token 10 美元,缓存输入为 0.10 美元。

这个价格结构是给长时间任务准备的。智能体需要反复读取项目文档、工具输出和前几轮行动记录,缓存成本很快就会决定整条工作流的经济性。官方评测显示,GPT‑6.1 Sol 在软件工程、复杂 PDF 问答、业务流程、计算机操作和科学任务上,以更低成本缩小了与 Astra 的差距。

洞察与点评: 企业选模型时,单看榜单和 token 单价已经不够。更实用的指标是“每个完成任务的总成本”:包括工具调用、上下文复用、重试、人工接管和失败后恢复。价格战没有结束,只是从单次调用转移到了整条任务链。

三、Sonnet 5.5:“足够强”正在挤压旗舰模型的使用空间

Anthropic 推出 Claude Sonnet 5.5,称其相比 Sonnet 5 输出速度提高 30% 以上,典型工作的单任务成本最多降低 30%。模型的标称 token 价格并未下调,降本主要来自用更少步骤和更少输出完成同样工作。它面向范围明确的日常任务,包括修复程序错误,以及制作文档、幻灯片和电子表格。

这类模型的重要性很容易被旗舰发布会掩盖。真实工作中,大多数任务并不需要每次调用最强模型。如果一个中档模型能在更少步骤里达到验收标准,它就会拿走大量生产流量,把旗舰模型留给真正需要长程判断的任务。

重要警示: 本周各厂商公布的基准成绩大多来自自己的测试条件。实际应用要用本组织的文档、工具、权限和验收标准复测,否则“快 30%”很可能只快在可控的实验环境里。

四、Gemini 4 Argon:专业工作与网络安全被捆在一起

Google 公布 Gemini 4 Argon,将其定位为面向软件工程、金融、法律和网络防御的前沿模型。它的输出上限扩大到 100 万 token,用于支持长轨迹推理和大规模代码任务。Google 称,Argon 已用于内部代码迁移、数据中心内存优化和量子算法调优。

更值得注意的是发布方式。这个模型尚未直接面向所有人开放,而是先通过 Fairwind 计划向受信任的网络防御者提供。官方把误用防护、间接提示注入、失配监测和沙盒加固列为扩大发布前的四个重点。

洞察与点评: 前沿模型的“发布”开始不再是一个时刻,而是一段分层开放的过程。先给红队和专业防御者,再给付费开发者,最后进入大众产品。当模型能自动发现并修补漏洞时,如何分配早期访问权,本身就是产品的一部分。

五、小型决策模型:并非每个节点都需要大语言模型

Strands Decider 2B 是本周一个很有代表性的小模型。它只有 20 亿参数,不负责写长文或代码,而是从给定选项中做判断、评分并给出置信度。官方测试中,它可在常见本地硬件上以百毫秒量级完成决策,同时公开了权重、训练数据和脚本。

这类模型适合放在智能体工作流里做路由、工具选择、权限分类、记忆取舍和风险拦截。复杂问题交给大模型,大量简单判断交给小型决策模型,可以降低延迟和费用。

洞察与点评: 智能体的效率突破未必来自更大的模型,也可能来自更合理的分工。一个优秀系统不会让最贵的模型判断每一次“是或否”。

六、开发者工具可编程:能力边界与安全边界同时外移

Claude Code 推出 Mods,允许开发者用小型 TypeScript 函数改变编程智能体的行为。Mod 可在提示到达模型前重写内容,可拦截、修改或重试工具调用,也能批准或拒绝权限请求,以及在工具输出进入模型前删除密钥等敏感信息。

它让开发者可以替换内置功能、添加界面、嵌入生产防护和审计日志。这很强,也很危险。官方特别提醒,Mods 与 Claude Code 拥有相同的本机访问能力,并不运行在独立沙盒中,用户应像安装普通软件一样审查来源。

重要警示: “会写插件的 AI”会让定制速度飙升,也会让恶意或粗糙代码更快拿到本机权限。组织需要管理可用插件市场、审查代码和加载顺序,不能把“能安装”当成“可信任”。

七、图像编辑进入“少动一像素”的生产环节

Ideogram 4.5 把重点放在精确修改和多轮稳定性上。生成式图像工具的老问题是:修一个细节,它顺手把其他地方也改了。一张已经过客户审批的产品图,仅仅换一种颜色,却出现材质、边缘和背景漂移,往往意味着整张重做。

新版支持在高分辨率图像上进行局部编辑,并尽量保留裁切区域的边缘,便于无缝拼回原图。它的产品逻辑已不再是“从零生成一张漂亮图”,而是“在不破坏现有成果的前提下,只改指定部分”。

洞察与点评: 生成式工具进入工作流后,能够保持不变和能够生成新内容同样重要。生产级 AI 有时候需要展示创造力,更多时候需要学会克制。

八、声音模型抢占实时对话,“情绪”成为工程参数

ElevenLabs 发布 Eleven v4 与低延迟版 v4 Turbo。新模型不只追求读得更像真人,还要理解语气、节奏、情绪、角色和对话上下文。用户可以用自然语言或行内标签控制说话方式。v4 Turbo 面向实时智能体,官方报告的首段发声中位延迟约为 150 毫秒,支持 90 多种语言。

声音能力的变化会直接提高语音智能体的说服力。客服、陪练、游戏角色和有声内容都会受益,同时也会加大声音仿冒、授权和来源识别的难度。当系统只需十秒级样本就能复刻高相似声音时,产品必须同时设计授权、标记、投诉和撤销机制。

九、协作入口扩张:AI 正在从工具变成工作环境

OpenAI 本次 DevDay 一次公布了超过 20 项更新。除了 Dot 与模型,还包括 ChatGPT 资料空间、动态页面、协作式幻灯片、团队共享任务、会议插件、Slack 与 Teams 中的 @ChatGPT,以及“使用 ChatGPT 登录”。这些功能看似分散,其实指向同一件事:AI 平台正在承接项目的资料、讨论、产出和执行记录。

如果这一路径成功,用户将少一些“把文件发给 AI”的操作,多一些“AI 本来就在项目里”的协作。但这也会产生新的平台依赖:项目记忆放在哪里,跨平台能否导出,人员离职后什么记忆需要留下,都要在采用之前想清楚。

十、安全架构走向默认:隔离、审批、日志和可中止

常驻智能体的风险不只是“答错”。它们会访问应用、使用凭据、发送消息、修改文件,甚至触发支付。因此,本周产品的安全描述已经相当具体。Dot 把工作放在独立云端计算机中;主动研究默认使用只读工具;影响账户或会分享信息的操作需要自动审核或用户批准;高影响任务保留人工处理。

这些机制是正确方向,却不能因为写进产品页就被当成已经证明有效。长时间工作的智能体会遭遇累积误差、上下文污染、恶意指令和跨系统权限组合。真正的验收需要重复任务、故障注入、撤销测试和审计记录复盘。

重要警示: 不要一开始就把邮箱、代码库、付款和客户系统的权限一次性交给智能体。更稳妥的路径是先只读,再允许草拟,然后在明确审批和可回滚的范围内开放写入。

未来展望:不眠觉的 AI,更需要会记账的系统

本周最清晰的变化,是 AI 产品的“工作时间”被拉长了。它不再只处理一个提示,而是长期拥有任务、记忆、工具和权限。另一个同样重要的变化,是模型不再只比较聪明程度,还要比较完成任务需要几步、多少 token、几次人工接管。

未来几个月,智能体可能迅速普及,但市场不会只奖励“运行得最久”的产品。更可靠的胜者,会让每个长任务都能回答四个问题:做了什么,用了什么权限,依据是什么,出错后怎么撤回。会干活只是起点;能留下可核验的工作记录,才是企业真正敢于托付的前提。



留下评论