核心关键点:Mythos5.1 和 Fable5.1 是完全相同基座权重,唯一差异是安全护栏策略Anthropic Fable5.1:通用安全护栏,公开商用; Mythos5.1:放宽生物、网络安全领域的双重用途护栏,仅对经过严格审核的可信机构开放(Glasswing 可信访问项目),不是全新基座模型Anthropic 基础规格:1M 上下文窗口,最大输出 128k token;知识截止 2026.6;Adaptive Thinking 自适应思考永久开启,默认 High 档位;定价同 Fable5.1:输入 $10 / 百万 token,输出 $50 / 百万 token,缓存读取 $0.25 / 百万 token
一、基准分数(官方)
表格
| 评测基准 | Mythos5.1 | Fable5.1 | Opus5.5 | 任务含义 |
|---|---|---|---|---|
| Terminal-Bench4.0 Agent 编码 | 60.9% | 55.8% | 66.4% | 真实工程跨文件终端编码 |
| Terminal-Bench-Science 0.1 科研 Agent | 52.6% | 52.6% | 58.7% | 科研、分子、蛋白、仿真 Agent |
| GDPval-AA v2 专业知识 | 1853 Elo | 1853 Elo | 1846 Elo | 财报、法律、咨询等真实业务任务 |
| OSWorld2.0 Computer Use 电脑操作 | 77.9% | 77.9% | 81.8% | 虚拟机、跨软件自动化操作 |
注意:除安全护栏带来的领域能力释放差异,通用基准数值与 Fable5.1 完全一致;仅在网络安全漏洞挖掘、生物大分子 / 药物研发任务上,Mythos5.1 能做到 Fable5.1 被拦截的任务Anthropic
二、Mythos5.1 核心能力
1. 生命科学 / 生物医药 Agent(最核心特长)
这是 Mythos5.1 区别 Fable5.1 的王牌场景,Fable5.1 会拦截很多高风险生物、毒理、病原体设计请求,Mythos5.1 在可信机构审核范围内可以完整执行全流程科研闭环:
- 蛋白 / AAV 衣壳设计、靶点筛选、蛋白质复合物设计;自主选择结合位点、调用生信工具、分析序列、评估结合亲和力,失败自动 Debug
- 基因组、单细胞数据分析,自主设计机器学习模型处理生物数据集;可生成全新科学假设,部分假设可直接进入实验室验证
- 分子动力学仿真、药物分子设计、毒理预测、生物文献批量挖掘,自主设计实验方案、规划对照、分析实验误差
历史前代 Mythos 5 实测:14 个蛋白靶点,9 个得到有效候选药物方案,进入真实研发管线36氪
2. 网络安全防御 Agent(仅防御侧,不开放无限制攻击)
面向基础设施防御、漏洞挖掘、威胁情报分析(不允许生成恶意攻击 Exploit,护栏依然禁止无限制红队攻击)
- 源码漏洞审计、二进制漏洞分析、威胁溯源、恶意代码逆向分析、安全建模;
- 识别固件、底层内核漏洞,自动写 PoC 验证漏洞(仅限防御研究场景),输出修复方案、风险评估报告;
- 复杂基础设施攻击面测绘、日志分析、入侵溯源,适合关键基础设施安全研究。
3. 超长时域通用 Agent(和 Fable5.1 一致)
多天无人值守长任务,抑制长会话目标漂移,任务中断后接续执行、自动汇报进度; 适合:大型系统架构改造、复杂尽职调查、多轮科研迭代、跨多仓库代码重构;自动拆解子任务、子 Agent 调度、失败恢复。
4. 专业知识工作 & 多模态文档识图
1853 Elo 的 GDPval-AA,顶级商业、法律、财务、工程文档处理; 读取高密度工程图纸、生物电镜图、蛋白结构图、多层财务表格,引用溯源严谨,幻觉控制强。
5. Computer Use 电脑自动化
OSWorld2.0 77.9%,跨浏览器、专业科研软件、运维工具,长时间连续操作,自动重试失败步骤。
6. 深度数学、物理仿真 Agent
物理、流体、材料仿真,写仿真代码,复现学术实验,验证理论假设,处理多变量嵌套推理。
三、技术原理
- 基座:Decoder-only Transformer,与 Fable5.1 完全相同权重,Adaptive Thinking 永久开启,自动按任务复杂度分配推理算力,默认 High 档位。
- 后训练:长 Horizon 长周期 Agent 轨迹微调,大量多天连续任务、失败重试轨迹训练,抑制长任务漂移;宪法对齐,但针对生物、网络安全领域的安全分类器被替换为宽松版本,普通领域对齐逻辑不变。
- KV 缓存深度优化:长会话 Agent 缓存复用成本大幅下降 75%,适合连续多日科研任务。
- 分级安全机制:
- Mythos5.1 不是无限制 “越狱模型”,依然存在安全边界;
- 仅对可信访问项目内的机构开放;高危滥用场景依然拦截;
- Fable5.1 在生物 / 网络安全双重用途任务会自动拦截,Mythos5.1 在授权范围内允许开展防御、药物研发类研究。
四、Mythos5.1 核心特长
✅授权环境下,完整开放生命科学端到端科研 AgentFable5.1 会阻断很多前沿生物设计任务,Mythos5.1 在可信机构内可跑完从靶点筛选、序列设计、仿真、数据分析、写论文的完整药物研发闭环。
✅关键基础设施安全防御研究源码漏洞挖掘、威胁情报、恶意样本分析,适合政企 / 科研机构做防御侧安全研究。
✅多天超长周期深度科研 Agent适合跨多轮迭代的科研项目,自主产生新颖科学假说,自动调度外部科研工具,失败自主修复。
✅和 Fable5.1 同等顶级通用推理能力商业、法律、大型代码工程、文档理解能力与 Fable5.1 持平。
五、Mythos5.1 的核心突破
- 同基座双护栏模式:同一套模型权重,通过安全分类器切换模型可用边界。不需要重新训练基座,就可以在可信环境释放生命科学、网络安全防御能力,兼顾通用安全和科研价值。
- 生物科研 Agent 全链路闭环:可以独立完成从假设生成、方案设计、工具调用、数据分析、实验复盘的完整科研流程,不再只是文献阅读。
- 高级漏洞分析能力用于防御:在授权场景,对底层源码、固件漏洞深度审计,辅助关键基础设施防御。
- 长任务稳定性:多天连续 Agent 任务,目标漂移抑制,长会话保持目标不跑偏。
六、三者横向对比(Mythos5.1 / Fable5.1 / Opus5.5)
表格
| 项目 | Mythos5.1 | Fable5.1 | Opus5.5 |
|---|---|---|---|
| 基座权重 | 和 Fable5.1 一致 | 同 Mythos5.1 | 独立新基座 |
| 安全护栏 | 生物 / 网络安全护栏放宽(可信机构白名单) | 标准通用护栏,拦截高危生物 / 攻击类请求 | 中等护栏,高危任务降级 Opus4.8 |
| Terminal-Bench4.0 | 60.9% | 55.8% | 66.4% |
| Terminal-Bench-Science | 52.6% | 52.6% | 58.7% |
| 定价 | $10 / $50 | $10 / $50 | $4 / $20 |
| 默认 effort 档位 | High | High | Medium |
| 核心定位 | 可信机构:生物医药 + 基础设施安全研究旗舰 | 公开商用,通用超长时域科研 / 业务 Agent | 企业工程平价旗舰,大规模代码工程、企业自动化 |
一句话总结:Mythos5.1 ≈ Fable5.1(一样模型),只是安全护栏针对生物医药、基础设施安全防御做了授权范围内的松绑;通用业务、常规科研能力和 Fable5.1 完全相同。Opus5.5 是独立基座,工程编码更强、价格更低,但前沿生物科研能力弱于 Mythos5.1。