恒美微站
首页
关于我们
建站服务
主题模板
案例展示
资讯中心
联系我们
从初代 Claude 到 Claude 5:一文看懂 Anthropic 如何把“安全助手”做成 Agent
首页
资讯中心
/
从初代 Claude 到 Claude 5:一文看懂 Anthropic 如何把“安全助手”做成 Agent
从初代 Claude 到 Claude 5:一文看懂 Anthropic 如何把“安全助手”做成 Agent
发布时间:2026/8/2 4:40:06
从初代 Claude 到 Claude 5一文看懂 Anthropic 如何把“安全助手”做成 Agent图 1Claude 处理多项任务的概念插画。图片来源Anthropic《Introducing Claude 4》提到大语言模型很多人先想到 GPT但在长文档分析、自然写作和编程领域Claude 同样是一条不能忽视的技术主线。Claude 由 Anthropic 开发。与“先发布模型再讨论安全”的叙事不同Anthropic 在产品诞生前就把可控、可解释和安全对齐放在研究中心。此后 Claude 的每次重要升级都围绕几个很稳定的问题展开模型怎样既有能力又遵循清晰原则怎样读懂更长的文档和代码库怎样在速度、价格和智能之间做选择怎样从回答问题走向使用工具和完成任务本文将沿着这四个问题回顾 Claude 从 2021 年 Anthropic 成立到 2026 年第五代模型的完整发展路径。先给结论Claude 的历史是一条“助手 → 工作台 → Agent”路线如果把六年的变化压缩成一行可以写成安全研究 → Constitutional AI → 长上下文 → 分层模型 → Artifacts → 操作电脑 → 混合推理 → Claude Code → 长任务 Agent这条路线与“模型越来越大”有关却不只由规模推动。Claude 真正形成辨识度的地方是把安全训练、长上下文、产品工作区和工具执行逐步组合起来。2021Anthropic 成立聚焦可靠、可解释、可控的AI2022Constitutional AI研究用一组原则指导模型自我批评和改写2023Claude 正式发布上下文从 9K 扩展至100KClaude 2 与 Claude2.1200K上下文和工具调用测试2024Claude 3Haiku、Sonnet、Opus三档模型Claude 3.5 Sonnet与 ArtifactsComputer Use 公测2025Claude 3.7 Sonnet混合推理与 ClaudeCodeClaude 4推理过程中调用工具和长任务Agent2026Claude 4.x 持续迭代Fable 5 与 Mythos 5Claude Sonnet 5Claude 关键里程碑2021—2026阶段代表节点真正改变了什么研究奠基Anthropic、Constitutional AI把“模型应遵循什么原则”写进训练方法产品起步Claude 1、Claude 2从合作伙伴测试走向公开聊天和 API长文本优势100K、Claude 2.1 的 200K可一次分析长文档、报告和代码库模型分层Claude 3 Haiku/Sonnet/Opus用户可按速度、成本和能力选模型工作空间Claude 3.5、Artifacts输出从聊天气泡进入可编辑工作区工具执行Computer Use、Claude CodeClaude 开始点击、输入、修改和测试Agent 化Claude 4、Claude 5推理与工具交替持续完成多步骤任务012021—2022先有 Anthropic 的安全研究后有 ClaudeAnthropic 于 2021 年初成立由 Dario Amodei 和 Daniela Amodei 等人领导。官方早期材料给公司的定位不是“聊天机器人公司”而是研究如何构建可靠、可解释、可控制的大规模 AI 系统。2022 年 12 月Anthropic 发布 Constitutional AI也就是“宪法式 AI”研究。这里的“宪法”并不是国家法律而是一组用自然语言写出的行为原则。它的简化训练流程是模型先生成回答根据原则批评自己的回答修改不符合原则的内容用修改后的回答进行监督学习再让 AI 根据同一套原则比较候选答案使用 AI 反馈进行强化学习即 RLAIF。图 2Constitutional AI 包含监督学习和基于 AI 反馈的强化学习两个阶段。图片来源Anthropic《Claude’s Constitution》传统 RLHF 主要由人类标注者比较回答Constitutional AI 则尝试让模型在明确原则的指导下参与监督。这么做不能自动解决所有安全问题但有两个重要价值原则可以公开阅读和讨论比隐含在大量标注数据中更透明部分监督可由 AI 扩展减少人类反复接触有害内容的需要。因此Claude 从一开始就不只是模型名称也承载了 Anthropic 对“helpful、honest、harmless”——有帮助、诚实、无害——这一目标的探索。022023Claude 正式登场长上下文成为第一张名片2023 年 3 月 14 日Anthropic 正式发布 Claude。初始版本已经过 Notion、Quora 和 DuckDuckGo 等合作伙伴测试并通过聊天界面和 API 提供能力。当时有两个版本Claude能力更强的主模型Claude Instant更快、更便宜的轻量模型。Claude 在摘要、问答、写作、搜索辅助和编程等任务上提供服务但真正迅速形成差异化的是它的上下文窗口。从 9K 到 100K一次读进一本书2023 年 5 月Claude 的上下文从 9K 扩展到 100K token约相当于 7.5 万个英文单词。用户可以一次提交数百页材料让模型跨章节检索、总结和比较。需要注意上下文窗口大不等于每个细节都能百分之百记住。长文本能力还取决于信息位置、任务难度、提示方法和模型本身的检索能力。Claude 2 与 2.1长文本进入企业场景2023 年 7 月Claude 2 发布并通过公开测试网站 claude.ai 面向更多用户。它提升了编程、数学和推理能力也能生成更长回答。11 月发布的 Claude 2.1 又把上下文扩大到 200K token约相当于 15 万个英文单词或 500 多页材料同时加入系统提示词和工具使用测试。至此Claude 的早期形象已经很清晰它不只适合闲聊更希望成为处理合同、财报、论文、技术文档和代码库的工作助手。032024Claude 3 建立 Haiku、Sonnet、Opus 三档体系2024 年 3 月Claude 3 家族发布。Anthropic 没有只给出一个模型而是同时推出三种定位Haiku速度最快、成本最低Sonnet能力、速度和价格的平衡档Opus面向高难任务的旗舰档。这套命名后来成为理解 Claude 的关键。Haiku、Sonnet、Opus 不是第 1、2、3 代而是同一代产品中的不同能力层级。Claude 3 还补上了图像输入能力可以分析照片、图表、页面截图和技术图示。Claude 从纯文本助手变成了视觉语言模型。这一步的意义并不只是“模型更多”。对于开发者而言同一套模型家族可以覆盖大量低延迟请求日常分析和内容生成少量但复杂、价值更高的任务。042024 年中Claude 3.5 Sonnet 与 Artifacts把聊天框变成工作区2024 年 6 月Claude 3.5 Sonnet 发布。它以 Sonnet 档的速度和价格在多项能力上超过上一代旗舰 Claude 3 Opus。这说明模型进步不一定表现为“旗舰越来越贵”也可能表现为原本只有最高档才能做到的事逐渐下放到更实用的中间档。与 3.5 Sonnet 同时出现的 Artifacts对普通用户的影响甚至不亚于模型升级。当 Claude 生成代码、文档、图表或网页时结果不再全部挤在对话消息中而是显示在独立区域用户可以预览、修改和继续迭代。它改变了 Claude 的产品形态对话负责描述意图Artifact 负责承载作品。AI 产品由“问一句、答一句”开始转向“对话旁边有一张持续编辑的工作台”。052024 年末Computer Use让 Claude 学会操作人类的软件2024 年 10 月Anthropic 发布升级版 Claude 3.5 Sonnet并公开测试 Computer Use。图 4Computer Use 让 Claude 根据屏幕画面移动鼠标、点击和输入。图片来源Anthropic《Introducing computer use》传统工具调用通常要求开发者为每个服务准备结构化 APIComputer Use 尝试走另一条路让 Claude 像人一样观察屏幕、移动光标、点击按钮和输入文字。这意味着即使旧软件没有专门为 AI 提供接口模型也有机会通过原有图形界面完成任务。但官方在发布时也明确说明这项能力仍处于实验阶段可能缓慢、笨拙或出错。Computer Use 还会引入新的安全问题例如网页中隐藏的提示注入、误点按钮和高权限操作。因此Computer Use 的历史意义不是“AI 已能完全代替人操作电脑”而是大模型的输出第一次系统性地从文字扩展成界面动作。062025Claude 3.7 把快速回答与深度推理合进同一个模型2025 年 2 月Claude 3.7 Sonnet 发布。Anthropic 将其称为混合推理模型普通模式可以快速回答Extended Thinking 可以在复杂问题上投入更多推理API 用户可以控制思考预算在成本、速度和质量之间调整。这与单独维护“普通模型”和“推理模型”的思路不同。Claude 3.7 希望让同一个模型既能快速响应也能在需要时深入思考。Claude CodeClaude 找到了最重要的 Agent 场景Claude 3.7 发布时Anthropic 还推出 Claude Code 研究预览版。图 5Claude Code 最初以终端工具形态发布。图片来源Anthropic《Claude 3.7 Sonnet and Claude Code》Claude Code 不只是把代码复制进聊天框。得到授权后它可以搜索并读取代码库编辑多个文件执行命令和测试根据失败结果继续修改提交代码或参与 GitHub 工作流。这构成了一个典型 Agent 闭环理解目标 → 观察环境 → 采取行动 → 检查反馈 → 修正方案编程之所以成为 Agent 最早成熟的场景之一是因为结果相对容易验证代码能否编译、测试能否通过、页面能否运行都能给模型提供清晰反馈。072025Claude 4 从“会推理”走向“边推理边使用工具”2025 年 5 月Claude Opus 4 和 Claude Sonnet 4 发布。它们延续混合推理路线并增加了一个关键能力在 Extended Thinking 过程中调用工具。模型可以形成这样的循环分析问题 ↓ 搜索资料或运行代码 ↓ 读取工具返回结果 ↓ 继续推理 ↓ 再次调用工具或输出结论相比“先想完再一次性调用工具”推理与工具交替更适合研究、编程和长时间任务。Claude 4 发布时Claude Code 也从研究预览走向正式可用并逐渐进入终端、IDE、GitHub 和自动化流程。同年后续的 Sonnet 4.5、Haiku 4.5 和 Opus 4.5则继续强化编程、Computer Use、智能体执行与成本效率。此时 Claude 的竞争重点已经从“能不能回答”转向“能不能持续做完”。082026Claude 4.x 快速迭代第五代开始重构模型层级2026 年初Claude Opus 4.6 和 Sonnet 4.6 延续 Agent 与专业工作的方向。Sonnet 4.6 提供 100 万 token 上下文测试并强化 Computer Use、长上下文推理、Agent 规划和知识工作。随后 Opus 4.7、Opus 4.8 继续改善工具效率、长任务可靠性和自我检查。这里不必把每个小版本都看成全新一代它们更像 Claude 4 家族的快速工程迭代。Fable 5 与 Mythos 5能力与访问边界开始分层2026 年 6 月Anthropic 发布 Claude Fable 5 与 Claude Mythos 5。根据官方说明两者使用相同的底层模型但部署方式不同Fable 5加入更强安全防护面向通用用户和高难知识工作Mythos 5在部分领域放宽防护仅通过可信访问计划提供给少量网络安全和研究合作方。这代表一个新的行业问题当模型在网络安全、生物研究等领域的能力变得更强时“是否开放”不再只是产品定价问题也涉及能力分级、身份验证和使用审计。Sonnet 5把第五代 Agent 能力带到主流档2026 年 6 月 30 日Claude Sonnet 5 发布并成为 Free 和 Pro 计划的默认模型。官方把它定位为更具 Agent 能力的 Sonnet可以制定计划、使用浏览器与终端并以更低成本持续执行多步骤任务。截至 2026 年 7 月Claude 的第五代并不是单一旗舰Fable 面向最高难度的通用任务Mythos 面向受限的高能力专业场景Sonnet 面向更大规模的日常 Agent 工作负载。Claude 的名字到底应该怎样读Claude 的命名比单纯的数字版本更复杂可以分成三层。名称组成表示什么示例Claude产品与模型家族总称Claude.ai、Claude API3、4、5模型代际Claude 3、Claude 4、第五代.5、.6、.7、.8同一代中的重要迭代Sonnet 3.7、Opus 4.8Haiku快速、低成本档Claude 3 HaikuSonnet能力与成本平衡档Claude Sonnet 5OpusClaude 3/4 时代的高能力档Claude Opus 4.8Fable第五代通用高能力模型Claude Fable 5Mythos受限访问的高能力专业模型Claude Mythos 5所以“Opus 比 Sonnet 数字大”这种说法并不准确因为它们不是数字而“Sonnet 5 一定强于所有 Opus 4.x”也不能仅凭代际得出需要看具体任务、成本和评测条件。真正推动 Claude 演进的五条主线1. 安全对齐从附加规则变成训练方法Constitutional AI、新版 Claude Constitution、系统卡和分级部署都说明安全不是发布页面最后的一段免责声明而是 Claude 技术与产品设计的一部分。2. 长上下文从卖点变成基础设施从 9K、100K、200K 到 100 万 token 测试Claude 长文本能力逐步服务于代码库、合同、研究报告和企业知识库。但上下文越长越需要检索、压缩和验证机制。3. 模型从单一旗舰变成成本曲线Haiku、Sonnet、Opus 的设计让开发者不必在所有任务上使用最贵模型。第五代进一步出现 Fable、Mythos 和 Sonnet 的角色分工。4. 产品从聊天窗口变成工作环境Projects、Artifacts、连接器和文件能力让对话拥有长期材料与可编辑输出Claude 不再只是“发消息的机器人”。5. 输出从文字变成可验证的动作Computer Use、工具调用和 Claude Code 把输出扩展到点击、搜索、编辑文件、运行测试和操作外部系统。能否可靠完成闭环开始比单次回答更重要。从 Claude 的历史中不应得出哪些结论误区一Claude 只是一款更长上下文的聊天机器人长上下文是早期优势但 Claude 后续最重要的变化已经转向 Artifacts、Computer Use、编程和 Agent。误区二有“宪法”就不会犯错Constitutional AI 是对齐方法不是正确性证明。Claude 仍可能产生错误事实、误解要求或执行错误操作。误区三上下文窗口越大记忆就越可靠窗口表示模型最多能接收多少内容并不保证所有位置的信息都被同等准确地使用。误区四Computer Use 等于可以放任模型操作电脑界面操作会受到提示注入、误操作和权限过大的影响。涉及删除、支付、发布和发送信息时应保留人工确认。误区五官方基准分数就是你的实际效果基准测试依赖提示词、工具、采样次数和测试环境。生产选型仍应使用自己的真实任务评估。结语Claude 的下一阶段是“更长时间地保持可靠”Claude 的发展路线可以概括为2021—2022 年Anthropic 建立安全与可控研究基础2023 年Claude 产品化并凭长上下文形成特点2024 年三档模型、视觉能力和 Artifacts 构成完整产品体系2024 年末Computer Use 让模型开始操作外部环境2025 年混合推理和 Claude Code 建立 Agent 闭环2026 年第五代模型开始按照成本、风险与访问权限重新分层。Claude 最初希望成为一个“有帮助、诚实、无害”的对话助手今天它正在变成能阅读项目、使用工具、修改文件并持续推进任务的协作者。下一阶段真正困难的问题可能不再是“模型能否做出一次惊艳演示”而是它能否在数小时甚至数天的任务里持续理解目标、正确使用权限、发现自己的错误并交付可验证的结果这也是从大语言模型走向真正 Agent 系统时最值得关注的分界线。官方资料与延伸阅读Anthropic2021Anthropic raises $124 million to build more reliable, general AI systemsAnthropic2022Constitutional AI: Harmlessness from AI FeedbackAnthropic2023Introducing ClaudeAnthropic2023Claude’s ConstitutionAnthropic2023Introducing 100K Context WindowsAnthropic2023Claude 2Anthropic2023Introducing Claude 2.1Anthropic2024Introducing the next generation of ClaudeAnthropic2024Claude 3.5 SonnetAnthropic2024Introducing computer useAnthropic2025Claude 3.7 Sonnet and Claude CodeAnthropic2025Introducing Claude 4Anthropic2026Introducing Claude Sonnet 4.6Anthropic2026Introducing Claude Opus 4.8Anthropic2026Claude Fable 5 and Claude Mythos 5Anthropic2026Introducing Claude Sonnet 5本文资料截止于 2026 年 7 月 31 日。Claude 的模型名称、默认模型、价格和开放范围变化较快请以 Anthropic 官方页面和开发者文档为准。本文配图均下载自相应的 Anthropic 官方发布页仅用于技术科普和版本说明图片版权归 Anthropic 或相应权利人所有。发布到 CSDN 时建议保留图注与来源链接。下一篇预告Claude 的 Haiku、Sonnet、Opus、Fable、Mythos 命名体系到底怎么理解