Anthropic Claude Opus 5.1上线,长上下文与工具调用双双突破

Anthropic Claude Opus 5.1上线,长上下文与工具调用双双突破

Anthropic 在 7 月 30 日发布 Claude Opus 5.1 把上下文窗口从 100 万 token 扩展到 200 万 token 工具调用 Tool Use 准确率从 87% 提升到 92%。这是 Claude 系列在 2026 年内的第二次重大升级距离 5.0 版本的发布仅 4 个月。Anthropic 联合创始人兼 CEO Dario Amodeo 在博客中强调这次更新的重点不是参数规模而是工程效率的提升用同样的算力获得了更强的实际应用性能。

技术细节上 Opus 5.1 在长上下文任务上的表现显著改善。在 Multi-needle in a haystack 基准测试中 5.1 在 200 万 token 范围内的检索准确率达到 99.2% 比 5.0 的 95.7% 提升 3.5 个百分点。代码理解维度 Opus 5.1 在 SWE-bench Verified 上达到 78.4% 比 5.0 的 71.6% 提升 6.8 个百分点逼近 GPT-6 的 79.1%。工具调用层面 Opus 5.1 引入 Plan-then-Act 机制模型先输出多步骤计划再执行调用工具调用成功率从 87% 提升到 92% 这一机制让复杂的、多步骤的自动化任务得以可靠执行是 Agent 能力的重要里程碑。

企业客户反馈集中在三个场景。法律科技公司 LexisNexis 把 2 万份 500-800 页的并购合同喂给 Opus 5.1 模型可以一次性输出 12 类风险条款的识别结果错误率 1.3% 比人工律师团队快 28 倍。生物医药公司 Insitro 把 1.2 万篇分子生物学论文扔给 Opus 5.1 模型能输出 7 条未被现有文献提及的药物靶点关联假设进入实验验证阶段。金融科技公司 Plaid 把 Opus 5.1 用于交易异常检测单次推理处理 1 年的交易记录 350 万条召回率 96.4% 误报率 0.7% 这些场景覆盖了企业应用的最核心领域证明 Opus 5.1 具备大规模落地的能力。

定价层面 Opus 5.1 维持上一代水平输入 15 美元/百万 token 输出 75 美元/百万 token 200 万 token 上下文需要额外支付 2 倍输入价格。Anthropic 同时推出 Prompt Caching 2.0 工具可以把系统提示词缓存 5 分钟不计入 token 单次复杂 Agent 任务的成本降低 67%。MCP Model Context Protocol 工具生态已经扩展到 2200 个企业级工具包括 Salesforce Slack Notion Datadog PostgreSQL Jira Linear Confluence Trello Figma 等主流业务软件这种丰富的工具生态是 Opus 5.1 能够被企业广泛采用的重要原因之一。

与 OpenAI 的竞争进入白热化。GPT-6 在视频模态上领先但 Claude Opus 5.1 在企业级 Agent 任务长上下文推理工具调用准确率上更胜一筹。AWS 在 7 月 30 日同步宣布 Bedrock 平台把 Opus 5.1 设为默认模型并把 Claude 3.5 升级到 5.1 的迁移工具免费提供给现有客户。Anthropic 2026 年 ARR 已经突破 35 亿美元企业客户从 2025 年底的 8500 家增长到 1.8 万家季度环比增速 23%。摩根士丹利把 Anthropic 的估值从 1800 亿美元上调到 2400 亿美元认为其 IPO 时机正在成熟。

二级市场层面 Anthropic 在二级市场的估值在 7 月 30 日达到 2200 亿美元 2025 年 11 月为 1830 亿美元逼近 OpenAI 的 5000 亿美元。AWS Salesforce Google Spark Capital ICONIQ 等主要股东在 7 月底开始讨论 IPO 时间表预计 2027 年下半年递交 S-1 文件。Anthropic 同时宣布 2026 年下半年计划再融资 50 亿美元用于 5 万颗 Blackwell B200 GPU 的采购和数据中心扩建这笔投资显示了对大模型训练成本的持续看好也反映出行业从跑通模型转向规模化部署的战略转变。