Claude Fable 5 官方提示指南:十几条可直接抄的调法,从治过度规划到治假进度汇报
- Anthropic 发布了针对 Claude Fable 5 和 Claude Mythos 5 的官方提示工程指南,列出这一代模型相对 Claude Opus 4.8 的行为差异,以及对应该怎么改提示词和工程脚手架
- 指南给出十几段可以原样粘进系统提示词的指令文本,分别用来治过度规划、拦住自作主张的重构、压缩啰嗦输出、划定该停下问用户的边界
- 一段专门的审计式指令要求模型汇报进度前对照本轮会话里的工具调用结果核实,Anthropic 表示这在专门设计来诱导编造的测试任务中几乎消除了虚假状态汇报
- 指南建议给长程异步 agent 加一个 send_to_user 工具,让必须原样展示给用户的内容跳过总结直接送达
- 文档提醒:如果提示词要求模型把内部推理过程复述进回复文本,可能触发 Fable 5 的 reasoning_extraction 拒答类别,导致请求被自动降级到 Claude Opus 4.8
这篇文档要解决什么问题
Anthropic 近期发布了 Claude Fable 5 与 Claude Mythos 5 的官方提示工程指南,总结了这一代模型相对 Claude Opus 4.8 的行为变化,以及需要跟着调整的提示词和工程脚手架写法。
说白了这是一份调参说明书:新模型更能干,但几个默认行为变了,老提示词和老工程框架照搬会踩坑。文档把每个变化都配上一段可以原样粘进系统提示词的指令,让你照着改。
先看它比上一代强在哪(一笔带过)
文档列了七项相对 Claude Opus 4.8 的提升,这里逐条一句话带过,不展开:
- 长程自主:没人盯着也能连着干几小时到几天,长复杂任务里不断线、不忘原本要干什么
- 首次即中:一些过去要反复迭代数天才跑通的系统,早期测试者反馈单次就实现正确(测试者口径)
- 视觉理解:读密集技术图、网页应用、详细截图更准,输出还更省 token,会用 bash 和裁剪工具处理翻转、模糊、噪点图
- 企业工作流:财报分析、表格、幻灯片、文档上更守指令、不跑题、产出更专业
- 代码审查调试:找 bug 的召回率明显高于 Opus 4.8(网络安全领域除外),能跨代码库和历史记录搜索
- 歧义处理:给一堆多线程的复杂请求、让它自己定下一步,也能接住
- 子代理协作:更敢并行派发子代理,也更稳地维持和长跑子代理、同级 agent 的异步通信
另外它跑安全分类器,会拦三类请求:攻击性网络安全(做 exploit、恶意软件、攻击工具)、生物与生命科学(实验方法、分子机制),以及提取模型内部的总结思考。良性的相关工作也可能被误触。可以配置服务端或客户端 fallback,让被拒的请求自动回退到 Claude Opus 4.8。
治过度规划:一句话让它够了就干
任务一模糊、effort 一调高,Fable 5 就容易想太多:把对话里已经确定的事实再推一遍,把它压根不会采纳的方案也罗列一遍,铺垫拖得老长。下面这段指令就是让它有信息就直接动手。
- 反复复述已知事实、把讨论过的决定再拿出来掰
- 罗列一堆它根本不会走的方案
- 长篇解释根因,铺垫远多于结论
- 有足够信息就直接动手
- 要权衡时给一个推荐,而不是穷举清单
- 先给结论,思考过程留在 thinking 块里
When you have enough information to act, act. Do not re-derive facts already established in the conversation, re-litigate a decision the user has already made, or narrate options you will not pursue in user-facing messages. If you are weighing a choice, give a recommendation, not an exhaustive survey. This does not apply to thinking blocks.
顺带一个工程侧的提醒,和这节配套:长任务能力(long-horizon autonomy)指模型能在没人盯着的情况下连续工作很久,几小时甚至几天不断线。代价是单次请求会变长,在较高 effort 下、任务需要收集上下文加自我验证时,一次请求可能跑几十分钟,自主运行可能延续数小时。迁移前先把客户端超时时间、流式展示、用户侧进度指示都调好,最好把工程框架改成定时异步轮询任务状态,别用阻塞等待硬等它返回。
效力挡位怎么调,怎么防止它自作主张重构代码
effort(效力挡位)是 Fable 5 上平衡「聪明、慢、贵」的主控开关,分 low、medium、high、xhigh 四档。默认用 high,最吃能力的任务用 xhigh,常规活调 medium 或 low。关键是:这代的低档也常常超过上一代的 xhigh。任务做完了但比需要的慢,就降档。点下面四个挡位看各自定位。
effort 像相机的对焦模式:平时用 auto 挡就够用,最难拍的那一张才切到手动精细挡。挡位不是越高越好,是越难的活才往上推。
挡位调高有个副作用:Fable 5 会在高 effort 下顺手多干活,主动加功能、做重构、加没必要的校验。想拦住这种「自作主张收拾一遍」,加下面这段:
Don't add features, refactor, or introduce abstractions beyond what the task requires. A bug fix doesn't need surrounding cleanup and a one-shot operation usually doesn't need a helper. Don't design for hypothetical future requirements: do the simplest thing that works well. Avoid premature abstraction and half-finished implementations. Don't add error handling, fallbacks, or validation for scenarios that cannot happen. Trust internal code and framework guarantees. Only validate at system boundaries (user input, external APIs). Don't use feature flags or backwards-compatibility shims when you can just change the code.