风险提示:理性看待区块链,提高风险意识!
币界网
USDT USDT $1.00 0.01%
XRP XRP $1.43310000 0.19%
BNB BNB $637.54000000 0.02%
USDC USDC $0.99963000 0.01%
SOL SOL $86.49000000 0.99%
TRX TRX $0.32360000 1.25%
BTC BTC $67,234.00 2.34%
ETH ETH $3,456.00 1.23%
CoinMeta Skill
限时免费体验

让 AI 更快获取有效、准确、可行动的币圈全景信息

Claude官方指南:如何节省Token多干活

摘要

作者:Biteye核心贡献者Aloof、CarrieAnthropic 最近发布了一篇 Claude Code 官方指南,专门回答一个问题:如何让每一个 Token 都真正服务于当前任务。 在一次 Claude Code 会话中,Token 不只花在思考和生成代码上...

Claude官方指南:如何节省Token多干活

作者:Biteye核心贡献者Aloof、Carrie

Anthropic 最近发布了一篇 Claude Code 官方指南,专门回答一个问题:如何让每一个 Token 都真正服务于当前任务。 

在一次 Claude Code 会话中,Token 不只花在思考和生成代码上,也会消耗在重复读取对话历史、搜索无关文件、处理冗长日志,以及反复携带已经失去价值的 Context 上。同一个任务,仅仅因为会话管理方式不同,实际消耗和完成效率就可能相差很大。 

这些无效消耗背后,涉及 Model、Input、Output、Context 和 Prompt Cache 等一整套运行机制。不过,理解原理并不是采取行动的前提。

Anthropic 已经将整篇文章浓缩成六条操作建议,我们不妨先把答案拿走。 

抄作业!官方最值得照着做的6条建议 

一图速览:

IlnZFdY76nG6fWm2DoaWx2tFHOCzNzFRgwuoip8B.jpeg

01|任务做完就 /clear

一个任务结束后直接 /clear,再开始下一个任务;如果之后还想找回当前 Session,可以先 /rename

02|开局定好 Model 和 Effort

根据任务难度选择 Model 和 Effort,并尽量在整个 Session 中保持不变;Fast Mode 也尽量在开局确定。

03|使用 @ 直接引用文件 

需要 Claude 处理具体文件时,直接 @文件;已经加入当前 Context 的文件,不需要重复 @

04|高输出命令加 quiet flag

测试、Build、日志等高输出命令尽量使用 quiet flag 或精简 reporter,只保留必要结果。

05|新 Session 先跑 /context

新 Session 开始先运行 /context,检查当前加载的内容;精简 CLAUDE.md,关闭当前任务用不到的 MCP。

06|长时间离开前先 /compact

任务没结束但准备长时间离开,先运行 /compact;如果只是最近几轮跑偏,则使用 /rewind

拆开账单,看看Token到底花在哪?  

这些 Token 到底是怎么花出去的?Claude Code 的 Token 消耗,可以粗略理解成两件事:每个 Token 有多贵+一共处理了多少 Token。

而要看懂这笔账,关键就是 Model、Input & Output 和 Cache。

01 | Model :同样一个 Token,为什么价格不一样?

Claude Code 虽然按 Token 计算消耗,但真正占用的是模型运行所需的推理算力。同样一个 Token,模型越大,处理 Input 和生成 Output 时需要做的计算越多,因此价格也更高。简单、明确的任务用较轻量的模型就能完成,真正困难或模糊的任务,再交给更强的模型。

所以,Model 决定的其实是每个 Token 的基础价格。而 Effort 控制的是模型每轮投入多少 Thinking;Thinking 本身属于 Output Token,因此 Effort 越高,往往意味着模型会生成更多用于思考的 Token。

oBaNxNo1pH6ygA4G2doOb1LEvx2p15eamu6G7ei7.jpeg

图片来源:Claude官方文档

02 | Input & Output:模型每一轮到底读了什么、又写了什么?  

一次请求在模型中主要经历两个阶段:Prefill 和 Decode

Prefill 是“读”。Claude 读取的不只是输入的 Prompt,还会读取 System Prompt、CLAUDE.md,以及当前会话中已经加入的文件、命令输出和此前的对话内容,这些都属于 Input Token

Decode 是“写”。Thinking、Tool Call 和最后展示给你的文字,都属于 Output Token。不同的是,Output 必须一个 Token 一个 Token 顺序生成。例如,一段 200 Token 的输出,相当于模型连续运行 200 次生成过程。因此 Decode 占用 GPU 的时间更长,Output Token 的单位价格通常约为 Input Token 的 5 倍

Qhz7nNx6VIDDkdu4fyP063fnCl2TMZhsFSLJ6DXh.jpeg

图片来源:Claude官方文档

03 | Cache:为什么同样的 Input,不一定每次都重新算? 

Claude Code 会自动使用 Prompt Cache。如果下一次请求的前半部分与上一轮保持一致,服务器不需要重新 Prefill 整段内容,而是直接读取之前保存的计算状态,只对新增内容重新计算。

这也是 Cache 最直接的价值:命中缓存的 Input Token,成本只有普通 Input 的约 1/10;首次写入缓存则会比普通 Input 更贵,最高可到 2 倍,但之后每一轮都可以低价复用。

因此,一轮请求的实际账单更接近:

  • 历史内容 → Cache Read × 0.1

  • 新增内容 → 正常 Input 价格

  • 模型生成 → Output 价格

不过缓存并非永久存在。Claude Code 订阅用户的缓存会在约 1 小时没有新请求后过期,每次新 Turn 都会重新计时;API key 默认缓存时间则是 5 分钟,可开启 1 小时缓存。超过时间再次回来,下一轮往往需要重新 Prefill 整段 Conversation。

对症下药,token消耗高的优先排查点

看懂 Token 花在哪里,再回头看官方这些建议,其实都指向四件事:Context、Session、Model 和 Prompt

YuYGsqxfxoYgqpgchOrooYmIaC5D57UFSw1THNm6.jpeg

01|Context:是不是让 Claude 看了太多 

如果你发现 Claude Code 的 Token 消耗明显偏高,优先排查四个地方:Context 是否过重、Session 是否过长、Model 是否过贵,以及 Prompt 是否让 Claude 做了太多无效探索。 

怎么做

  • 新 Session 先运行 /context,检查当前加载内容。

  • 精简 CLAUDE.md,关闭当前任务不需要的 MCP。

  • 需要处理的文件直接使用 @ 引用。 

  • 测试、日志等高输出命令使用 quiet flag。

  • 高输出、强探索、结果可压缩的任务,可以交给 Subagent。 

核心原则:只让 Claude 看到当前任务真正需要的信息。 

02|Session:是不是记了太多没用的历史? 

同一个 Session 使用时间越长,之前读过的文件、运行过的命令和对话历史也会不断累积。

使用建议:

  • 当前任务完成 → /clear

  • Context 太长,但任务还没完成 → /compact

  • 准备长时间离开 → /compact

  • 最近几轮跑偏 → /rewind

  • 不同任务尽量使用不同 Session。

核心原则:该清就清、该压就压,只保留当前任务需要的历史。

03 Model:是不是用了过贵的配置? 

不同模型的 Token 单价不同,Effort 也会影响推理消耗。不是所有任务都需要最强模型和最高推理强度。

使用建议:

  • 简单任务优先使用更轻量的 Model 和 Effort。

  • 复杂 Debug、架构设计等任务再提高配置。

  • Model 和 Effort 尽量在任务开始前确定。

  • Fast Mode 同样尽量提前确定,过程中减少频繁切换。

核心原则:根据任务难度匹配模型能力,不要“大炮打蚊子”。

04|Prompt:是不是让 Claude 绕了太多路? 

Prompt 越模糊,Claude 越需要自己搜索文件、判断范围和反复试探,这些过程同样会消耗 Token。

使用建议:

  • 明确任务目标和修改范围。

  • 涉及具体文件时直接使用 @ 引用。

  • 明确需要 Claude 完成的结果。

  • 稳定的项目规则放进 CLAUDE.md,特定工作流通过 Skills 按需加载。

比如:

❌ 帮我看看登录为什么有问题

✅ @login.ts 修复登录失败问题,并运行对应测试

核心原则:Prompt 不是越长越好,而是让 Claude 少猜、少搜、少走弯路。

总结下来,Claude Code 省 Token 并不是简单地“少用”,真正需要管理的,不只是一次用了多少 Token,而是哪些内容进入了 Context,以及它们在那里待了多少轮。 

写在最后

Anthropic 这次给出的建议,其实都围绕同一个目标:用更少的无效消耗,完成同样的任务。

从选对 Model 和 Effort,到控制 Context、管理 Session、保护 Prompt Cache,核心不是一味“少用 Token”,而是知道 Token 花在哪里,再把不必要的部分省下来。

以上内容均根据 Anthropic 官方文档梳理整理,方便大家直接对照实操。

评论 (8)

登录 后即可发表评论
渡鸦
渡鸦 53分钟前

Claude Code省Token得从多方面管理,知道钱花哪了才能省钱,这些建议有用。

0 回复
壹零零柒
壹零零柒 54分钟前

任务做完就/clear,Session管理好了,能减少很多不必要的Token消耗。

0 回复
潜水的鸟
潜水的鸟 55分钟前

开局定好Model和Effort这点很关键,别一上来就用贵的,简单任务用轻量的就行。

0 回复
王_1
王_1 55分钟前

Prompt得写明确,别让Claude瞎猜,不然Token都浪费在搜索试探上了。

0 回复
卓小马
卓小马 57分钟前

Cache能省成本,不过得注意有效期,别超过时间又得重新计算,挺麻烦的。

0 回复
更多