Claude Fable 5 正式发布:Anthropic 史上最强公开模型全解析(跑分、价格、对比 GPT-5.5)
Anthropic 于 6 月 9 日发布 Claude Fable 5:Mythos 级能力首次全面开放。SWE-Bench Pro 80.3% 碾压 GPT-5.5,幻觉率不到对手一半。本文整理官方与第三方全部跑分对比、$10/$50 定价、6月22日免费窗口与安全机制。
Claude Fable 5 正式发布:Anthropic 史上最强公开模型全解析(跑分、价格、对比 GPT-5.5) - AI 资讯 - 一站式VPN开发平台2026年6月9日,Anthropic 正式发布 Claude Fable 5 —— 这是该公司有史以来公开提供的最强 AI 模型。它与同日发布的受限版 Claude Mythos 5 系出同源:同一个 Mythos 级底层模型,Fable 5 是"加上安全护栏、面向所有人开放"的版本,而 Mythos 5 仅通过 Project Glasswing 向美国政府与受信任机构定向开放。

Fable 5 是什么?和 Mythos 5 什么关系?
简单说:一个模型,两种发行方式。
Claude Fable 5(公开版):能力即 Mythos 级,但在网络安全、生物/化学、模型蒸馏等高风险领域内置拦截 —— 触发时会自动回退到 Claude Opus 4.8 来回答。Anthropic 称这类回退平均出现在不到 5% 的会话中,95% 以上的会话全程由 Fable 5 本体回答。
Claude Mythos 5(受限版):在部分领域解除限制,号称"全球网络安全能力最强的模型",目前仅向经审查的关键基础设施机构与美国政府(Project Glasswing 合作框架)开放。
值得玩味的是发布时机:就在几天前,Anthropic 还公开呼吁各大 AI 实验室建立"前沿 AI 研发的协同刹车机制",警告模型正在逼近递归自我改进的临界点。一边喊刹车、一边放出史上最强公开模型,这也让 Fable 5 成为本周科技圈争议最大的发布。
跑分:对比 GPT-5.5 和 Gemini 3.1 Pro
Anthropic 官方与第三方(Vellum、Weights & Biases 等)公布的数据显示,Fable 5 在几乎所有能力基准上都是当前最强(SOTA):
软件工程(最大亮点)
基准 | Fable 5 | Opus 4.8 | GPT-5.5 | Gemini 3.1 Pro |
|---|---|---|---|---|
SWE-Bench Pro(智能体编程) | 80.3% | 69.2% | 58.6% | 54.2% |
FrontierCode Diamond(高难编程) | 29.3% | 13.4% | 5.7% | — |
SWE-Bench Pro 领先 GPT-5.5 超过 21 个百分点;在 Cognition 的 FrontierCode 评测中即使开"中等推理力度"也是全场最高分。早期客户 Stripe 的反馈是:"把数月的工程工作压缩到了几天"。

知识、推理与视觉
基准 | Fable 5 / Claude | GPT-5.5 | Gemini 3.1 Pro |
|---|---|---|---|
知识与推理综合评分 | 1932 | 1769 | 1314 |
GDP.pdf(视觉理解,无工具) | 29.8% | 24.9% | 16.7% |
AA-Omniscience 幻觉率(越低越好) | 36.18% | 85.53% | 49.87% |
幻觉率是这次最被低估的数字:Claude 家族 36.18% 的幻觉率不到 GPT-5.5(85.53%)的一半,对金融、法律、医疗等"答错要负责"的场景意义重大。Hebbia 的金融基准上 Fable 5 也拿下了所有模型中的最高分。

价格与可用性
API 定价:输入 $10 / 百万 token,输出 $50 / 百万 token(约为此前 Mythos Preview 的一半,但是 Opus 4.8($5/$25)的两倍、GPT-5.5($5/$30)的两倍上下)
最大输出:单次最高 128k token
订阅用户:Pro / Max / Team / 按席位的 Enterprise 用户 6月22日前免费使用;6月23日起改为积分(credits)计费
API 与企业平台:已全量开放(模型 ID:
claude-fable-5)
安全机制:1000 小时红队,无通用越狱
高风险领域(网络攻击利用、危险生物/化学研究、模型蒸馏)自动拦截并回退 Opus 4.8
外部红队累计 1000+ 小时测试,未发现通用越狱(英国 AISI 在初步测试窗口内"有所进展")
Mythos 级模型流量统一保留 30 天,仅用于安全目的,不用于训练
需要注意的取舍:约二十分之一的会话实际由 Opus 4.8 接管 —— 对绝大多数业务场景无感,但安全研究者已提醒"你以为在用的模型未必是真正在回答的模型"。
对开发者和企业意味着什么?
三个判断:
编程智能体的代差出现了。80.3% 的 SWE-Bench Pro 意味着大量真实工程任务可以端到端交给模型,"AI 结对程序员"正在变成"AI 工程师"。
贵,但单位产出未必贵。$10/$50 的价格是 GPT-5.5 的两倍,但如果一次做对、少返工,综合成本可能反而更低 —— 特别是配合 128k 输出做大型重构。
6月22日是个时间窗口。订阅用户当前可免费用满 Mythos 级能力,想评估的团队应抓紧这两周完成 PoC。
Neuronicx 平台已同步关注 Claude 全系产品动态,Claude Pro 会员、API 接口等数字产品可在商城直接选购,新模型相关产品上架会第一时间更新。