在使用 Claude Code 进行大规模代码重构或复杂项目开发时,开发者常常会发现 Token 消耗速度远超预期。这不仅增加了 API 调用成本,还可能导致上下文窗口过早溢出,影响对话的连贯性。核心问题往往不在于模型本身的智能程度,而在于配置文件中未对“记忆”和“工具调用”进行有效约束。通过精细化配置 AGENTS.md 文件,我们可以从源头切断冗余信息的产生,实现显著的 Token 节省。
精准定义角色与边界
AGENTS.md 是 Claude Code 在每次会话开始时自动读取的系统级指令集。许多用户习惯在其中填入长篇大论的背景介绍,这会导致初始 Prompt 占用大量 Token。优化的第一步是精简角色定义。不要描述“你是一个优秀的程序员”,而应直接指定技术栈和行为规范,例如:“你是精通 Rust 和 Go 的后端专家,只关注性能与安全。”同时,明确禁止闲聊和无关解释。通过设定严格的输出边界,迫使模型仅在必要时生成内容,从而避免无意义的寒暄和过度详细的背景复述,这在长周期项目中能累积节省可观的 Token 量。

利用上下文缓存机制
Claude 平台支持上下文缓存功能,这是降低重复 Token 消耗的关键技术手段。在 AGENTS.md 中,你可以指示模型识别哪些部分是“静态知识”。例如,将项目结构、API 文档规范或通用的代码风格指南标记为无需每次重新生成的参考内容。当这些固定信息被成功缓存后,后续的对话只需传输变化的逻辑部分。此外,定期清理过期的对话历史,并手动重置上下文窗口,也能防止旧代码片段持续占用宝贵的 Token 预算。对于大型仓库,建议分模块维护多个 AGENTS.md,仅加载当前工作目录相关的规则,避免全量加载带来的资源浪费。

结构化指令与迭代策略
高效的 Token 使用还依赖于清晰的指令结构。在编写任务描述时,采用 Markdown 列表和明确的步骤指引,比段落式的大段文字更易于模型解析,且能减少因歧义导致的多次追问和修正。例如,使用“1. 分析... 2. 修改... 3. 测试...”的结构,能让模型一次性准确执行,减少多轮交互产生的额外开销。同时,建立“小步快跑”的开发习惯,将大任务拆解为小而具体的子任务,每次只处理一个函数或模块。这样不仅提高了代码质量,也确保了每次对话都在有限的 Token 预算内高效完成,避免了因单次请求过长而引发的截断或高昂费用。
本文链接:https://ai-claudecode.cn/jiaochen/claude-code-agents-md-token-xhyhsz-token-yhzn/