大模型在长程任务里有个通病:任务越复杂,思考越啰嗦。来回纠结、反复确认,Token 烧了一大把,却没有给出更好结果。
ArkAPI 现已全线上线 Anthropic最新模型Claude Opus 5,一款兼顾极致通用推理、自主智能体、科研仿真、安全对齐的综合性模型。
Anthropic给Opus 5的定位非常清楚,专门为日常工作设计,官方表示,它的运行效率远远高于其他型号,可以说是综合性能相当能打的模型。
比如 Opus 5 在软件工程等领域的任务上表现卓越,在 Frontier-Bench v0.1 中,Opus 5 的性能优于所有其他模型,并且在单位任务成本更低的情况下,比 Opus 4.8 的性能提升了两倍以上。
在 CursorBench 3.2 上,用最大推理强度运行模型,Opus 5 的得分仅比 Fable 5 的峰值得分低 0.5%,但单位任务的成本仅为后者的半数。
在知识型工作和问题解决类任务中,Opus 5 的测试表现同样优异。ARC-AGI 3,用于测试模型解决全新问题的表现,Opus 5 的得分是排名第二的模型的 3 倍。
而在 OSWorld 2.0 这一计算机性能基准测试中,Opus 5 在任何预算条件下均优于所有其他型号,其最佳成绩仅相当于 Fable 5 的三分之一不到。
除此以外,Opus 5 还拥有更为强大的视觉生成能力。Opus 5 能够精准可视化气流在空气动力学(以及非空气动力学)物体表面的流动情况。
以及制作精致的可交互式细胞示意图。
大多数人又要问了:Fable 5 还有存在的必要吗?干脆停产得了!
但其实Fable 5 和 Opus 5,或许根本就不是一个赛道的产品。
Fable 5 瞄准极致场景,超大型科研项目、跨领域巨型商业规划、长期自治的复杂 Agent,动辄几十万 Token 的长周期任务,要的是全局统筹能力和极致的深度。
而 Opus 5 覆盖的,是剩下的日常高频场景,程序员写代码改 Bug、企业做文档分析、中小型自动化办公、普通的智能体流水线。
说白了,绝大多数人花着旗舰的钱,用的其实是次旗舰就能搞定的需求。
Opus 5 完全可以精准解决这个痛点,用一半的价格,给到 99% 的旗舰体验,把中间最庞大的用户群体牢牢攥在手里。
同时,在部署前的测试中,通过自动化行为审计发现,Opus 5 比 Opus 4.8、Sonnet 5 和 Fable 5 更好地遵循预先设定的准则,并表现出最低的欺骗性行为率,并且最不容易被误导而遭到滥用。
Anthropic 认为,这可以极大程度避免可能带来的难以逆转的副作用,Opus 5 也是他们迄今为止最安全的模型。
这是ArkAPI 平台上架的第 88 款模型,支持命中缓存功能及 256K 上下文长度。你可在 Claude Code、Codex、OpenClaw、Hermes Agent、WorkBuddy、OpenCode、Cursor、TRAE、Kilo Code、Cline、Roo Code 等工具与应用接入 API,感受它更可靠的指令遵循与长程任务完成能力。
ArkAPI 致力于成为用户首选的“Token 工厂”,提供多样、高速、稳定且经济的模型 API,已上架Claude、ChatGPT、Gemini、GLM、DeepSeek、KiMi 等百款热门模型,覆盖语言、图像、音频、视频、嵌入与重排序全任务场景。仅需一个密钥,即可灵活调用,助开发者加速构建生成式 AI 应用。新用户可获得 1 美元赠金体验平台所有模型。多款模型免费,让开发者实现“Token 自由”。
国内站:https://www.iarkchat.com/
国际站:https://api.aigcark.com/