研究解读 · 进化解读

Anthropic 研究 40 万次 Claude Code 会话:专业度比会编程更决定 AI 编程成败

23.5 万用户、跨 7 个月的会话分析:专家验证成功率是新手近两倍,但十大职业彼此只差 7 个百分点内
五句话看完
  • Anthropic 分析了 2025 年 10 月至 2026 年 4 月约 40 万次 Claude Code 交互会话,覆盖约 23.5 万用户
  • 典型会话里,用户做出约 70% 的「做什么」决策(规划),Claude 做出约 80% 的「怎么做」决策(执行)
  • 用户在某任务上的专业程度(不是编程背景)越高,会话成功率越高:专家级验证成功率 28% 到 33%,新手级仅 15%
  • 在能产出代码的会话里,10 大职业类别的成功率彼此相差不超过 7 个百分点,都和软件工程师十分接近
  • 7 个月间,花在修 bug 上的会话占比从 33% 降到 19%,运维、写文档、数据分析类会话翻倍,平均任务估值涨约 25% 到 27%
立场提示:本文数据全部来自 Anthropic 对自家产品 Claude Code 的隐私保护分析,不是独立第三方研究。成功率、专业度、职业、任务估值这些标签,都由 Claude 模型阅读脱敏后的会话记录自动打出,非人工核验。下文只转述数据本身,判断留给你。
1研究背景

40 万次对话里,人和 AI 到底谁说了算

Anthropic 近日发布研究报告,对 2025 年 10 月至 2026 年 4 月间约 40 万次 Claude Code 交互会话做了分析,想回答一个问题:没有编程背景的人,能不能指挥 AI 智能体完成复杂技术工作?

这是迄今对真实 Claude Code 使用情况规模最大的一次公开分析,约 40 万次交互会话、约 23.5 万名用户、横跨 7 个月。研究盯着一件事看:用得好不好,到底取决于什么。

为什么值得看:两条结论彼此呼应。能产出代码的会话里,10 个最大职业的成功率都和软件工程师相差不到 7 个百分点;而专家级用户拿到「验证成功」的比例(28% 到 33%),接近新手(15%)的两倍。按这份数据,决定成败的是一个人对手头这件事有多懂,而不是他会不会写代码。

怎么在不侵犯隐私的前提下分析这么多真实对话?研究用的是隐私保护分析:让 Claude 模型自动阅读每一场脱敏后的会话记录,打上标签,再和系统自动记录的遥测数据(比如这场会话到底有没有增删代码行)交叉核对。研究者不读任何一个人的具体聊天记录,只看跨越大量用户后的整体规律。两套数据吻合度很高,被 AI 判定为「创建或改动了代码」的会话里,超过 90% 在遥测里确实有代码变动。

~40 万
分析的 Claude Code 交互会话数(2025 年 10 月到 2026 年 4 月)
~23.5 万
覆盖的用户数,只统计跨越足够多用户后的聚合结果
90%+
AI 分类为「改了代码」的会话,遥测里确实有代码变动的比例
7.7%
被判为「没有明确目标」、后续成功率分析中剔除的会话占比

范围说明:本研究只看命令行、Claude.ai 和 Claude Code 桌面端的交互会话,不含 claude -p 单条命令的 headless 模式,也不含通过第三方开发环境、软件工具包跑的批量使用。

2人机分工

用户定方向,AI 干细活

研究把会话里的每个决策拆成两类。规划决策管「做什么、走哪条路、什么算完成」,执行决策管「改哪个文件、写什么代码、用什么语言、跑哪条命令」。再让分类器判断每个决策是人拍板还是 Claude 拍板,给每场会话算出两个数。

规划决策(做什么):用户拿大头
用户 70%
Claude 30%
执行决策(怎么做):Claude 拿大头
用户 20%
Claude 80%

说白了:人定方向,AI 干细活。这个分工在会话里稳定地反复出现。

再换个角度看,把「决策」换成「动作」。一场 Claude Code 会话是人和 Claude 一来一回:用户写一条指令,Claude 就跑去干一串活,然后用户再写下一条。典型会话来回约 4 轮,历史数据里,每条用户指令平均引发约 10 个 Claude 动作,有时超过 100 个。Claude 每一轮要读文件、改代码、跑命令,平均写下约 2400 字的输出。