🧠 图解记忆: 成本控制要同时管上下文、模型路由、缓存、并发与终止条件,并以单位成功任务衡量。
💡 答案要点
背景(高频题):
面试官问"你用 AI 编程工具成本怎么控制"——这是 AI 编程落地的真实痛点,能讲出具体技巧说明你真在用。
先搞懂 Token 花在哪(核心机制):
上下文滚雪球:会话越长,重复携带的历史、工具定义和检索结果越多
输出通常比输入更贵,但倍率和价格取决于供应商、模型与缓存命中
→ 优化方向 = 减少无关上下文 + 控制输出 + 用真实 usage 和账单验证七大优化技巧(面试可讲):
| # | 技巧 | 效果 |
|---|---|---|
| 1 | 明确任务边界:说明目标、文件范围、验收条件和禁止改动项 | 少走弯路,减少无效读取与返工 |
| 2 | 及时结束或压缩会话:一个目标完成后开启新任务,长任务保留决策摘要 | 避免历史上下文滚雪球 |
| 3 | 精简持久规则:只保留每次任务都需要的约束,低频流程按需加载 | 降低每轮固定上下文开销 |
| 4 | 限制检索范围:排除构建产物、依赖目录和大体积无关文件 | 避免读取噪声 |
| 5 | 工具按需启用:只暴露当前任务需要的 MCP Server 与工具 | 减少工具描述和误调用 |
| 6 | 模型分层:用评测结果把检索、小修改、复杂重构分配给合适模型 | 在质量、延迟和费用间取舍 |
| 7 | 隔离探索任务:让搜索、日志分析和验证在独立上下文执行,只回传结论与证据 | 保持主任务上下文聚焦 |
核心认知(面试金句):
上下文越干净,AI 回答越精准。省钱和提效从来是一件事——省 Token 不是抠门,是让每一分钱花在刀刃上。
面试话术:
"控制 Coding Agent 成本不能背固定节省比例。我会先看 usage,区分持久规则、工具描述、仓库检索、对话历史和输出分别占多少;然后通过缩小文件范围、按需启用工具、结束已完成会话、隔离探索任务和模型分层逐项优化,并用相同任务集比较成功率、耗时、Token 与返工次数。"
版本: v2.31 | 更新: 2026-05-12 | by 二狗子 🐕
