
本周攻坚的问题聚焦在账单的比拼:同一件事要调用多少次、等多久、由谁复核、数据留在哪里,出了错又能不能撤回。
从云端专用推理芯片、桌面级大内存计算,到开放权重模型、内置浏览器和本地智能体,几条看似分散的新闻都指向同一处——AI 正从“提供答案的模型”变成“持续执行的系统”。当执行成为主角,延迟、成本、权限、记忆和验收就不再是附属设置,而是产品本身。
一、OpenAI 自研芯片落地:算力竞争进入系统协同
OpenAI 公布首款自研推理芯片 Jalapeño 的初步结果。它没有被包装成取代所有 GPU 的通用加速器,而是针对大模型推理中的常见瓶颈做系统级优化。官方测试覆盖 GPT-OSS 120B、DeepSeek R1 670B 与 Kimi K2.5 1T,峰值能效提高约 1.5 至 1.9 倍,端到端延迟降低约 1.7 至 3.6 倍,面向交互式负载的整体性能提高约 2.1 至 4.1 倍。OpenAI 计划在年底前把它部署到自有基础设施,同时继续使用 NVIDIA 加速器。
值得留意的不是某个孤立数字,而是设计方法。OpenAI 称芯片从启动到流片用了九个月,并让 AI 参与部分架构探索和内核优化。模型、编译器、芯片与数据中心开始围绕同一类工作负载共同设计。大模型公司不必彻底变成芯片公司,却会越来越深地介入硬件定义。
洞察与点评: 推理芯片的价值不在跑赢一次基准,而在把高频工作负载变成稳定、可预测的服务能力。以后衡量算力,不只是“有多少张卡”,还要看芯片与模型、调度和网络是否真正咬合。
二、Apple 把大模型搬上桌面:本地计算不再只是轻量路线
Apple 同期发布 M6 与 M5 Ultra。M6 采用 2 纳米工艺,面向移动与常规专业设备;M5 Ultra 则把四颗芯片整合到一个系统中,最高提供 36 核 CPU、80 核 GPU、每秒 1.2TB 内存带宽与 512GB 统一内存。官方把“可在本地运行数千亿参数模型”列为核心场景。
这类机器不会取代训练集群,但会改变企业的部署选择。法律、医疗、工业设计和媒体制作中的部分工作,可以在本地完成检索、生成与初步审阅;敏感材料不必默认上传云端,长上下文任务也不必完全受按量计费约束。云端仍负责最难的推理,本地设备则承担高频、私密和低延迟的工作。
洞察与点评: “云端还是本地”正在变成错误提问。更现实的架构是分层路由:本地先处理,必要时再把明确授权的任务升级到云端。
三、开放权重模型继续压价:便宜只是入口,部署自由才是筹码
本周两款开放权重模型把竞争焦点放在成本与可部署性上。GLM-5.3-Flash 采用稀疏混合专家与线性注意力,总参数约 3200 亿、单次激活约 180 亿,并以 MIT 许可开放权重。Qwen3.8-Flash 原生支持 26.2 万上下文,可扩展到 100 万;其官方 API 报价约为每百万输入 token 1 元、输出 token 3 元。
厂商给出的速度、训练资源和基准成绩仍需独立复测,但趋势已经清楚:开放模型不再只靠“可下载”吸引开发者,而是在编码、工具调用、长上下文和多模态任务上争夺真实工作负载。企业获得的不只是更低单价,还包括私有部署、定制、审计和供应商切换的空间。
市场同时出现 NVIDIA 可能收购 Hugging Face 的报道,传闻金额为 129 亿美元。截至本周末,双方并未发布正式公告,这一消息不能当作已完成交易。不过,传闻本身说明模型分发、数据集、评测与开发者社区正在成为算力巨头争夺的基础设施。
重要警示: 未经官方确认的并购报道只能作为市场信号,不能写成交易事实;厂商自报基准也不等于第三方结论。
四、智能体赢在“脚手架”:验证正在取代生成成为瓶颈
NVIDIA 公布的 AVO 智能体系统,在 ARC-AGI-3 公开交互环境上从约 30% 的基础成绩提升到 100%。它依赖的并非单次模型升级,而是视觉解析、行动规划、结果检查和失败恢复组成的系统循环。这个结果来自公开集合与官方报告,不能直接外推到未公开竞赛,但它再次表明:智能体表现越来越取决于模型之外的脚手架。
开源社区也在集中建设运行器、会话管理、工具协议和评测框架。模型负责提出候选行动,系统则要保存状态、控制权限、判断任务是否真的完成。只要任务持续时间拉长,最昂贵的环节往往不再是生成,而是审阅和验证。
洞察与点评: 下一轮产品差异不会只藏在参数里,还会藏在日志、重试、检查器和人工批准点里。能把错误尽早截住的系统,往往比偶尔给出惊艳答案的系统更有商业价值。
五、ChatGPT 与 Claude 都在接管工作流:AI 从窗口变成工作台
ChatGPT 的产品更新集中在“让任务自己流动”。定时任务可以由 Gmail、Slack 与 GitHub 等事件触发,并支持分享;Sites 则把生成、部署、身份验证和数据能力放进同一条应用构建链路。GPT-5.6 Sol 的 API 与额度价格还在三个月促销期内下调,进一步降低长期运行智能体的成本。
Anthropic 走的是另一条相似路线。Claude Cowork 获得独立的内置浏览器,Claude in Chrome 面向付费用户正式开放;记忆功能也开始在聊天与 Cowork 之间贯通,用户可以查看、编辑和删除记忆主题。浏览、记忆与文件操作一旦结合,AI 就不只是会话窗口,而是能持续接续工作的环境。
重要警示: 浏览器智能体仍可能受到提示注入、错误页面和权限扩散影响。登录状态、长期记忆和自动执行放在一起时,应默认采用最小权限、敏感站点隔离与关键动作复核。
六、本地优先智能体出现:隐私正在变成产品架构
Perplexity 发布 Portable Computer,先支持 NVIDIA DGX Spark,之后扩展到 RTX PC。它在本机运行 Qwen3.8 27B 或 PPLX 27B,负责读取文件、本地搜索和执行操作;只有在用户明确授权时,才把更复杂的任务升级到云端模型。
这与桌面级大内存硬件形成呼应。本地优先不再意味着功能残缺,而是把数据边界写进路由逻辑:哪些内容能离开设备,什么时候可以调用云端,返回结果如何落盘,都由系统明确决定。对需要处理合同、源代码、研究资料和客户数据的团队,这种架构可能比单纯追求最高榜单分数更重要。
洞察与点评: 隐私承诺如果只存在于服务条款里,很难验证;当它被落实为本地执行、显式升级与可检查日志时,才真正变成工程能力。
七、Google 把生成模型拆成专业工具:视频、语音与知识产品齐头推进
Google 本周的更新没有押注一个“全能模型”,而是同时推进多个专业入口。Gemini Omni 1.1 Flash 支持最长 40 秒的场景扩展、首尾帧控制与 1080p、4K 输出;360p 草稿模式最高可快约 60%,成本约为原来的三分之一。Gemini 3.5 Transcribe 则提供低延迟流式转写、说话人区分与逐词时间戳,覆盖 85 种以上语言。
应用层也在扩张。搜索的 AI Mode 新增航班积分价格提醒和美国酒店预订;Gemini Notebook 可以在获得授权的 Google Play 图书上生成带引用的回答、信息图、音频与测验。模型能力正在被拆成旅行、研究、转写和媒体制作中的具体动作。
洞察与点评: 用户很少为“更强的模型”本身付费,他们为少一次切换、少一轮返工和少十分钟整理付费。专业工具的胜负,最终由流程摩擦决定。
八、机器人学习开始靠演示“临场教学”
Skild AI 公布 S1 机器人基础模型,核心能力是通过一段人类演示视频,在不做额外训练的情况下理解新任务。官方展示覆盖最长约十分钟的多阶段操作,并称在内部实验中,一次演示的效果可接近数百个后训练样本。
如果这种能力能够跨硬件、跨环境稳定复现,机器人部署方式会显著变化:工程师不必为每个动作重新采集大规模数据,而可以像教新人一样先示范,再让系统执行。不过,目前结果主要来自厂商内部测试,复杂现场中的安全性、重复成功率和长期漂移仍需第三方验证。
重要警示: 单次演示成功不等于可量产。机器人一旦进入真实空间,评估必须覆盖失误后果、紧急停止、硬件差异与连续运行可靠性。
九、创意产业不再只做被训练的一方,而是开始入股
Stability AI 完成 7600 万美元 B 轮融资,新投资者包括 Electronic Arts、Sony Music、Universal Music Group、Warner Music Group 与 AMD Ventures。公司称新管理层上任以来累计融资达到 2.32 亿美元,并继续推进基于授权数据训练的 Stable Audio 3.0 开放权重音乐模型。
这组投资关系比融资额更值得观察。内容公司正在从版权争议的外部参与者,变成模型公司治理、授权和产品路线的内部利益相关方。未来生成式媒体的竞争,不只看画面和声音质量,还要看训练数据是否可说明、商业使用是否可授权、收益能否沿产业链分配。
洞察与点评: 创意 AI 的长期壁垒可能不是“能生成”,而是“能合法进入生产、发行与结算”。
十、欧盟透明度规则开始执行:机器可读标记进入合规清单
欧盟人工智能法案的透明度义务已于 8 月 2 日开始适用。与人交互的特定 AI 系统需要披露其机器身份,深度伪造等合成内容需要明确标示;部分输出还要带机器可读的来源标记。对于在适用日前已上市的系统,部分标记义务存在过渡期,但这不意味着可以忽略准备。
水印会被改写,元数据也可能被剥离,因此技术标记不能独自承担所有责任。更可靠的做法,是把生成记录、模型版本、素材许可、人工编辑和最终发布串成一条可追溯链路。监管要求正在把“内容从哪里来”变成产品设计问题。
重要警示: 企业不应把网页上的一句“由 AI 生成”当作完整合规方案。披露对象、机器可读格式、保存期限和责任主体都需要进入实际流程。
本周结论:真正稀缺的是可控交付
本周的十条线索可以归结为三个变化。第一,算力开始分道:云端专用芯片、本地大内存设备和开放权重模型共同存在。第二,产品开始常驻:浏览器、记忆、事件触发和本地文件让智能体跨越一次性对话。第三,验收走到前台:日志、权限、来源标记和人工复核决定系统能否真正进入业务。
接下来最值得追踪的指标也将改变。模型分数虽然还是新模型的焦点,但市场更关注每项任务的完成成本、平均人工接管次数、敏感数据外传比例、失败后的恢复时间,以及结果能否被独立核验。
AI世界已经形成清晰的SOTA格局,不只有寡头的垄断企图,更有开源的揭竿而起。未来的战场是攻城略地,用户不再是奴隶,有选择权的用户将能决定战局。谁能把计算放到合适的位置,把权限关在清楚的边界里,并把每一次执行变成可以检查的交付,谁就更接近真正的成功。

留下评论