
码农受苦,万民有福。本周延续近四年来强度不减的模型发布,伸缩定律(Scaling Law)牢牢占据铁王座,智能的指数级爆发所言不虚。OpenAI、Anthropic、Google 与 Meta 在三天内密集更新旗舰或主力模型,能力继续上涨,OpenAI已公开宣布”欢迎AGI的到来!“。可以看到:产品设计明显分叉:有的强调电脑操作,有的降低长任务成本,有的把高危能力放进受控通道,有的训练模型在复杂流程中主动求助。
更值得留意的是模型之外的变化。NVIDIA 宣布收购 Hugging Face,世界模型开始把图像变成可交互界面,开源智能体重做安装、记忆与安全架构,学校则用一年暂停期重新评估生成式 AI。行业正在回答一个更现实的问题:当模型已经能连续工作数小时,它该从哪里获得权限,如何证明没有越界,失败后又由谁接管?
一、GPT-6 Astra 把电脑操作推到前台
OpenAI 发布 GPT-6 Astra,首批面向有限机构开放,随后向 ChatGPT Plus、Pro、Business、Enterprise 以及 API、Azure 和 AWS Bedrock 推送。官方把浏览器与电脑操作列为核心能力,并称其在 OSWorld 2.0 上以约 40 分钟完成任务,得分 72.6%;GPT-5.6 Sol 约需 75 分钟,得分 65.7%。在 Codex 的新机制中,旧上下文还可以被检索,长任务不必完全依赖一次次压缩摘要。
这类改进改变了“使用模型”的含义。用户交给系统的不再只是一个问题,而可能是一组要跨网页、文件、表格和应用完成的工作。模型要保持方向、处理插话、补齐常规缺口,并在可能改变结果的地方停下来提问。
洞察与点评: 电脑操作能力的竞争,不在鼠标移动得多像人,而在任务结束时有没有可检查的交付物。速度、权限边界、过程记录和验收证据必须一起看。
二、Claude Fable 5.1 用“每项任务成本”挑战旗舰定价
Anthropic 同时推出 Claude Fable 5.1 与 Mythos 5.1。两者使用同一底层模型,但安全配置和开放范围不同:Fable 5.1 面向普通用户,Mythos 5.1 通过受信任访问计划提供,重点支持网络安全与生命科学。Fable 5.1 的输入、输出单价保持不变,但缓存读取降价。Anthropic 估计,典型负载成本可下降约 25%,高度智能体化、上下文重复读取较多的任务最多可节省约 45%。
这说明模型定价正在从“每百万 token 多少钱”转向“把一项工作做完花多少钱”。长时间编码、研究和企业流程会反复读取相同材料,缓存、重试次数和人工复核成本往往比标价更能决定账单。
洞察与点评: 旗舰模型开始争夺高频工作,而不只争夺最难问题。今后的采购比较表需要增加完成率、平均重试、缓存命中和人工接管次数;单看 token 单价,很容易把便宜买成昂贵。
三、Gemini 3.8 把“主力模型”与“高危能力”分成两条通道
Google 发布 Gemini 3.8 Flash 与 Gemini 3.8 Flash Cyber。这是六周内第三次 Flash 更新。通用版瞄准长程编码、智能体任务和专业领域的多步推理,促销期价格为每百万输入 token 0.75 美元、输出 3.75 美元;网络安全版面向漏洞发现和自动修补,仅通过 Fairwind 计划向受信任的防御人员开放。
OpenAI 也承认 Astra 达到其准备框架中的网络安全“关键”门槛。模型在无生产防护的测试中发现并利用了两个此前未知的零日漏洞;公开版本会拒绝更高级的利用代码任务,更多防御能力通过 Daybreak 计划逐步开放。相似的分层正在成为头部实验室的共同方案。
重要警示: 高危能力的“受控开放”仍是一种制度设计,不是风险已经消失。身份验证、用途约束、行为监控、人工审查和事后追溯需要形成完整链条。
四、Meta Muse Spark 1.3 训练的是协作习惯
Meta 的 Muse Spark 1.3 没有把重点放在某一个醒目的榜单数字上。它面向长时间、多工作流任务进行训练:在信息混乱或相互冲突时自行补充上下文,发现计划缺口后修正,并持续记录已经学到的内容。遇到模糊指令时,它会追问;受阻时会请求帮助;执行有后果的动作前会确认。
这些看似像“交互细节”,其实直接决定智能体能否进入真实组织。一次性演示可以容忍模型猜测,跨部门流程却不能。模型需要知道何时继续、何时停下、何时把决定还给人。
洞察与点评: 更聪明的协作不等于更少交流。优秀智能体会减少无价值的确认,同时保留关键审批点。沉默执行与频繁汇报应当成为用户可配置的工作模式。
五、本地模型与混合路由开始改写账单
本周的开源与本地模型讨论集中在同一个结果:把日常任务留在本机,只把困难部分交给云端前沿模型。一位实践者展示的月度模型费用从 231 美元降到约 4 美元,方法并不神秘——分类、摘要、格式转换和简单代码修改由本地模型承担,复杂研究和高风险判断再升级到云端。
Qwen 3.8、GLM 5.3 Flash 等新模型继续扩大这种选择。厂商给出的速度和榜单仍需独立验证,但本地部署的价值已经不只是一句“保护隐私”。它还能固定版本、控制更新节奏、把数据保留在设备内,并在网络不可用时维持基本能力。
洞察与点评: 混合路由会成为企业 AI 的常见架构。真正的难点是把任务分级规则写清楚:什么可以本地完成,什么必须调用云端,哪些内容无论如何都不能外发。
六、NVIDIA 收购 Hugging Face:分发平台成为算力公司的入口
NVIDIA 正式宣布收购 Hugging Face。官方没有在公告中披露交易金额,但强调 Hugging Face 将保持开放、多云和多加速器支持,不要求开发者使用 NVIDIA 算力。该平台已有超过 1800 万开发者、300 万个模型、50 万个数据集和 100 万个应用,超过 20 万家公司使用它发现、评估、定制和部署模型。
这笔交易的战略价值不只在模型仓库。模型、数据集、评测、演示、推理服务和开发者身份汇集在同一入口,能够影响技术选择与部署路径。NVIDIA 已拥有芯片、网络、软件栈和云合作关系,如今又获得开源模型生态中最重要的分发层。
重要警示: “继续开放”需要用长期行为检验。社区会关注推荐排序、托管价格、竞品加速器支持、模型审核和数据使用政策是否发生倾斜。
七、世界模型开始挑战传统软件界面
World Labs 发布 Atlas。它从头训练,原生处理文本、图像、视频与 3D,可进行场景生成、空间重建和时空模拟;官方展示包括最长一分钟的 1440p 相机控制视频,以及面向机器人的现实到仿真工作流。Atlas 目前处于合作伙伴早期访问阶段。
Runway 的 Solaris 则把世界模型进一步推向交互软件。它以用户的点击、拖拽和语言指令作为下一帧条件,持续生成可操作的视觉环境。传统软件先设计数据结构和控件,再渲染界面;Solaris 试图让“画面本身”成为应用,用户直接操纵场景,系统即时回应。
洞察与点评: 生成式界面很吸引人,但稳定性要求比短视频高得多。一个按钮偶尔变形只是视觉瑕疵;支付、医疗或工程界面中的同类漂移可能造成实质错误。世界模型要进入生产环境,仍需可重复状态、明确约束和传统代码兜底。
八、语音与视频进入实时工作流
微软发布 MAI-Transcribe-2,强调嘈杂环境、专业领域和低成本转写;Meta 同期更新语音转写模型,Google 则把语音操作继续带入 Gmail、Docs 等办公产品。另一边,实时视频模型已能在直播或交互场景中根据输入连续改变画面。语音、画面和工具调用正在汇成同一条输入输出链路。
对用户来说,这会减少在录音、转写、摘要、任务拆分和内容生成之间来回搬运。对系统设计者来说,问题反而更多:谁在说话、哪一句触发了动作、实时生成是否误导、原始录音和派生文本保留多久,都需要清楚记录。
洞察与点评: 多模态产品的门槛不只是识别率。延迟、说话人归属、可撤销操作和证据保留,决定它能不能从炫技进入会议、客服和生产现场。
九、OpenClaw 2.0 与硬件标准:智能体在补基础设施
OpenClaw 2.0 是该项目迄今最大的一次更新,由 933 名贡献者参与,包含超过 1.6 万个合并请求,覆盖安装、消息、记忆、技能、模型、自动化、浏览器、原生应用、插件和安全。新版优先复用用户已有的订阅、API 密钥和本地模型,降低首次配置门槛。
Anthropic 预览的 Model Hardware Standard 则把相似问题推向物理设备:智能体怎样发现设备能力、获得有限授权、执行操作并留下记录。无论控制浏览器还是实验仪器,模型都需要一个比“能调用工具”更完整的运行环境。
洞察与点评: 智能体生态正在经历早期操作系统阶段。安装、权限、记忆、协议、日志和恢复机制看起来琐碎,却会比一次模型升级更长久地影响用户体验与安全。
十、学校按下暂停键,内容平台提高身份要求
纽约市公立学校宣布面向幼儿园前至八年级学生实施一年生成式 AI 暂停期,影响近 60 万名学生;高中阶段则保留 AI 批判性思维课程和少量课堂试点。政策没有简单拒绝所有 AI,而是按年龄、场景和教学目的拆分。
内容平台也在收紧。Anthropic 解释了不可见文本水印方案,音乐与职业平台继续清理批量生成的低质量内容。生成规模越大,发布端越需要回答作者身份、素材来源、自动化程度和纠错责任。
重要警示: 水印和检测器都不是可靠的单点证明。文本会被改写,元数据会被删除,模型也可能误判。更稳妥的办法是保存生成记录、编辑过程、素材许可与发布责任人。
本周结论:能力跃升之后,边界成为产品
本周的密集发布带来三个清晰变化。第一,模型开始围绕完整任务竞争,电脑操作、长期记忆和主动求助进入核心能力。第二,成本比较从 token 单价转向每项任务的总成本,本地模型、缓存和混合路由因此获得更大权重。第三,高危能力、开放生态和生成内容都需要新的边界设计,受控访问、权限记录和来源证明不再是上线后的补丁。
未来几个月,最值得观察的是看谁能把能力稳定地装进产品:模型知道什么时候继续,系统知道什么时候拦截,用户知道结果从何而来。发动机越来越强,还需要整车的制动、仪表、导航和维修体系尽快跟上。

留下评论