——“最强模型”越来越像一支车队,用户要找的是那辆能把自己的货送到终点的车
2026年9月22日,Anthropic 官网换上了 Claude Opus 5.5。页面没有拿参数规模做标题,最醒目的是两个数字:比 Opus 5 便宜约40%,同时在多项编码与知识工作评测中超过刚刚发布不久的 GPT‑6 Astra。
几乎同一时间,OpenAI 又为 GPT‑6 家族补上了 Sol 与 Luna。Astra、Sol、Luna,Opus、Fable、Mythos——模型公司正在用星辰和神话为产品命名,普通用户却面对一个很朴素的问题:我究竟该选哪一个?
答案正在变得反直觉。2026年的模型竞争,已经不再是一场百米赛跑。它更像拉力赛:有的车直道最快,有的车省油,有的车能穿过泥地,还有的车允许你拆开发动机,装进自己的工厂。
因此,比较 Opus 5.5、GPT‑6 和中国前沿模型,不能只问“谁最聪明”。必须同时追问:它能否持续完成长任务?单位成果要花多少钱?是否适合中文语境?数据能否留在自己的控制范围内?
两位冠军,赢在不同赛道
本文所说的 GPT‑6,主要指旗舰型号 GPT‑6 Astra。OpenAI 后续推出的 Sol 与 Luna,更像将 Astra 的部分能力下放到速度与价格更友好的日常档位,不能直接等同于旗舰。
单看同一组公开评测,Opus 5.5 的优势相当醒目。Anthropic 公布的数据中,Opus 5.5 在 Terminal-Bench 4.0 上得到66.4%,GPT‑6 Astra 为57.9%;FrontierCode 1.1 分别为54.4%和53.3%;模拟专业知识工作的 GDPval-AA 中,Opus 5.5 也领先。到了科学智能体任务 Terminal-Bench-Science,局面反转:GPT‑6 Astra 为64.6%,Opus 5.5 为58.7%。在商业自动化 AutomationBench 上,Astra 也以41.4%略高于 Opus 5.5 的40.0%。这些数据来自 Anthropic 的发布材料,具有参考价值,但仍属于厂商公布结果,不能当作无条件的终局裁决。Anthropic:Claude Opus 5.5
第三方 Artificial Analysis 给出的图景更接近“互有胜负”。在高推理强度下,其综合指数为 Opus 5.5 得54分、GPT‑6 Astra 得51分;Opus 在知识工作、长上下文和若干编码项目上领先,Astra 在 SaaS 自动化、专业文档推理和知识准确性上更强。更重要的是,当推理档位和测试工具变化,二者的名次也会变化。Artificial Analysis 对比
榜单测到的是“模型+推理强度+工具+运行框架”的组合,不是一颗被单独摆上秤的大脑。 换一个智能体外壳、给模型更多思考预算,甚至调整提示词,结果都可能改变。
Opus 5.5:像一位耐心、节制的高级合作者
“会写代码”只是 Opus 5.5 的起点。它更突出的本领,是长时间工作时较少迷路。Anthropic 把它定位为编码、智能体和专业知识工作的日常旗舰:面对跨文件修改、代码迁移、审计、复杂文档和多工具任务,它倾向于先理解上下文,再做较少但更完整的动作。
这种能力对真实工作很重要。一次回答写得漂亮,并不等于能接手一个持续十小时的工程任务。长程智能体经常开局顺利,却在第十二步忘了第二步的约束,又在第三十次工具调用后开始重复劳动。Opus 5.5 的价值,就体现在少走弯路、减少返工。
它的价格也改变了旗舰模型的成本结构:每百万输入、输出 token 分别为4美元和20美元,缓存读取仅0.20美元;GPT‑6 Astra 则为10美元和50美元,缓存输入1美元。两者都提供约100万 token 的上下文窗口。Anthropic 定价;OpenAI 模型文档
不过,“单价低”仍不等于“每项任务都便宜”。高推理档位的 Opus 有时会生成更多思考 token;Astra 虽然单价高,却可能用更短轨迹完成某些任务。采购者应该计算每个成功交付的成本,而不是只比较每百万 token 的价签。
如果你的核心工作是大型代码库、研究综述、复杂材料消化、长文档编制,或需要一个能持续协作、表达自然的模型,Opus 5.5 通常是更稳妥的第一选择。
GPT‑6 Astra:更像一台会使用整个工作台的机器
GPT‑6 Astra 的野心更大。OpenAI 对它的定位越过了聊天和代码,直接指向端到端专业工作:浏览网页、操控软件、处理表格、制作演示文稿、执行研究流程,并在信息不足时判断何时继续、何时询问、何时停止。
这种“行动中的判断力”,可能比多答对几道题更有商业价值。OpenAI 公布的 OSWorld 2.0 结果显示,Astra 在计算机操作任务中取得72.6%,完成时间比 GPT‑5.6 Sol 少约47%;它在科学研究、数学与网络安全方面也表现突出。与此同时,OpenAI 明确承认,Astra 已达到其网络安全能力分级中的 Critical 水平,因此部署了更严格的监控和保护措施。能力越强,系统有时也越可能暂停合法但敏感的任务。OpenAI:GPT‑6 Astra;GPT‑6 Astra 安全概览
所以,Astra 更适合这些用户:需要模型跨浏览器、终端和办公软件完成整条工作流;从事高难度科学、工程或数据分析;已经深度使用 ChatGPT、Codex、Azure 或 AWS;愿意为复杂任务的上限、工具生态和安全控制支付更高价格。
它未必是每封邮件、每次摘要、每段常规代码的经济选择。旗舰模型用来改一句通知,像开着重型工程车去楼下取快递——当然能到,只是没有必要。
中国模型:不再是一支追赶者队伍
谈“中国目前的前沿模型”,不能再只列一个总冠军。国内头部模型已经分化为几条路线:
智谱 GLM-5.3 与 Kimi K3,代表开放权重旗舰的能力上沿。 Artificial Analysis 当前同口径测试中,GLM-5.3 max 综合指数45,Kimi K3 max 为44。GLM 在智能体知识工作、自动化和终端任务上更强;Kimi 在 Humanity’s Last Exam、专业文档推理、物理推理与长上下文项目上占优。二者都提供约100万 token 上下文和开放权重,Kimi K3 还支持原生视觉输入。GLM-5.3 与 Kimi K3 对比;Kimi K3 发布说明
DeepSeek V4 把“旗舰能力的价格”压到了新的位置。 V4-Pro 支持100万 token 上下文,官方 API 的每百万缓存未命中输入和输出价格分别为3元、6元;其开放权重也给私有化和二次开发留下空间。DeepSeek 自己坦率地表示,V4-Pro 的内部编码体验接近 Opus 4.6 非思考模式,但与其思考模式仍有差距。这种不把“接近”写成“超越”的表述,反而更有参考价值。DeepSeek V4 发布说明;DeepSeek API
通义千问 Qwen3.7 Max 的强项是完整工程生态。 它提供100万 token 上下文,支持函数调用、结构化输出、联网搜索、缓存,以及文本、图像和视频输入;国内 API 标价约为每百万输入1.65美元、输出4.951美元。它未必在每张能力榜上领先,却适合已经使用阿里云、需要高并发服务、稳定接口和企业交付的团队。阿里云 Qwen3.7 Max 文档
字节 Seed2.1/Seed2.0 与 MiniMax M3,则把竞争推向原生多模态和产品化。 Seed 系列强调视频、图像、音频、文本的统一理解以及 GUI 操作;MiniMax M3 强调100万上下文、编码与原生多模态。对内容生产、视频理解、语音交互和面向消费者的应用而言,这些能力往往比纯文本榜单更重要。ByteDance Seed 模型组合;MiniMax 模型主页
从综合指数看,当前中国开放模型与 Opus 5.5、GPT‑6 Astra 的最高档仍有距离;但在价格、开放权重、中文任务、本地云接入和部署自主权上,它们已经形成了另一条竞争曲线。把中国模型理解成“九折版美国旗舰”会错过它们真正的价值:一套不同的技术经济学。
用户真正需要的,是一张任务地图
如果你是个人用户,不妨按下面的顺序选择:
- 写作、研究、长文档与复杂编程优先:先选 Opus 5.5。它更像一位能读完材料、记住约束并把成品收拾干净的合作者。
- 跨软件执行、深度科研、复杂自动化优先:先选 GPT‑6 Astra。若日常任务较轻,可退到 GPT‑6 Sol 或 Luna,把 Astra 留给真正困难的问题。
- 中文资料、超长文本与低成本优先:DeepSeek V4、Qwen3.7 是更现实的日常主力;前者价格极低且可开放部署,后者云平台与企业工具链更完整。
- 希望本地或私有部署:优先测试 GLM-5.3、Kimi K3、DeepSeek V4 等开放权重模型。这里要额外核查许可证、硬件需求、量化损失和运维能力;“权重可下载”并不自动等于“部署很便宜”。
- 视频、图像、音频是一等公民:重点考察 Seed、Qwen 多模态与 MiniMax,而不要用纯文本综合榜替你做决定。
机构和企业最好少开一场品牌辩论,多做一次小型“任务联赛”:抽取20至50个真实任务,遮去模型名称,由业务人员按准确性、返工次数、完成时间、合规性和总成本评分。测试时固定工具、提示词、推理档位与成功标准,并记录失败类型。
这里有一条简单的分界线:
高价值、低频、失败代价大的任务,买能力上限;高频、规则明确、可以自动验收的任务,买成本效率;涉及敏感数据与稳定供应的任务,买控制权。
现实中的最佳方案往往是分层路由:便宜模型承担分类、抽取、改写和初步检索;国内旗舰处理中文长文档与规模化调用;Opus 5.5 或 GPT‑6 Astra 只接手高难度推理、最终审校和复杂智能体任务。旗舰模型从“默认入口”变成“升级通道”,整个系统反而更可靠。
榜单之外
所有公开比较都有局限。厂商测试可能选择有利项目,第三方评测也受推理预算、服务商版本、工具框架和采样波动影响;新模型发布后的早期数据尤其容易变化。中文公文、古籍整理、行业知识、长表格处理和中国本地软件操作,也常常没有被国际基准充分覆盖。
因此,本文无法替任何用户宣布一个永久冠军。它只能给出截至 2026年9月24日 的阶段性判断:Opus 5.5 是当前编码与知识工作的强势效率型旗舰;GPT‑6 Astra 在科学、自动化、计算机操作和复杂工作流上拥有更高的系统雄心;中国前沿模型则以开放、成本、中文、多模态和部署自主权建立了自己的主场。
下一轮发布也许很快就会改写分数。但用户真正积累下来的,不该是一串模型名字,而是一套知道何时升级、何时降档、何时把数据留在自己手里的选择机制。
当模型的星辰继续升起,方向盘仍应握在人手中。
参考资料与延伸阅读:
- Anthropic:Introducing Claude Opus 5.5——能力、效率、价格与安全评测。
- OpenAI:GPT‑6 Astra——发布说明、专业工作、科研与计算机操作表现。
- OpenAI:GPT‑6 Astra API 模型文档——上下文、价格、工具与接口能力。
- Artificial Analysis:Opus 5.5 与 GPT‑6 Astra——第三方同口径对比。
- DeepSeek V4 官方发布说明——模型架构、开放权重、上下文与定位。
- 阿里云:Qwen3.7 Max 模型文档——功能、上下文与区域价格。
- Artificial Analysis:GLM-5.3 与 Kimi K3——国内开放权重旗舰对比。
- ByteDance Seed 模型组合;MiniMax 模型主页——国内多模态与产品化路线。

留下评论