BLOG · 2026-07-21

我为什么从 Claude Code 换到了 Pi Agent

用了很久的 Claude Code。从 Opus 4.6 一路用到 4.7,说实话,体验不差——Anthropic 的模型在代码能力上确实有东西。但就像我上一篇文章吐槽过的,A 厂的问题从来不在模型本身:封号、限流、模型说禁就禁、账单像过山车一样飘忽不定。之后也尝试在Claude Code上使用第三方模型,如:GLM 5.2、Deepseek V4等等。但随着模型升级,Claude Code的功能也在增加。如Claude Code的workflows功能很强,但一次任务动辄数十分钟、长则数个小时。Token消耗都是数百万起,这种情况总给我一种”花钱不受我自己控制“的感觉…

后来有一段我切到了 Codex。GPT 系列沉稳、谨慎、不太犯错——但偶尔谨慎到让你想敲键盘。"这个改动会不会有风险?要不要再确认一下?你真的要这么做吗?"——行了行了我知道了,你倒是动手啊!还有就是传Codex有SSD杀手的可能性,动不动就是几个几十个G的项目文件。说实在我不知道它在做些什么一个问题需要几十个G甚至上T的数据量。

然后 Pi Agent 出现了。

先说一个你可能没注意到的数字

你付给 AI 编程助手的钱,大部分不是花在写代码上,而是花在了 你还没开始写代码之前 。

Claude Code 每开一个会话,系统提示大约 14,000 个 token。这是什么概念?每次你打开终端输入第一行指令之前,14K token 已经烧掉了。这些 token 在告诉模型:你是谁、你能用什么工具、你要怎么说话、你不能做什么、你要怎么处理权限、你要怎么管理子任务、你要怎么格式化输出……一大串。

Codex CLI 也差不多。这些"重型" Agent 的设计哲学是:把模型当成一个需要详细说明书的新手,所以把所有规则写在前面。

Pi Agent 反着来。它的系统提示只有大约 1,000 个 token。四个工具——read、write、edit、bash。没了。

这不是偷懒。这是一种判断:”前沿模型已经被 RL 训练得足够好了,它天生就知道怎么当编程助手,不需要你再写一万字的说明书。” 把规则写进提示,不如把 token 留给真正的任务。

省下来的 token,谁来买单?你!

Databricks 那份报告说了什么

大概在 7 月初,Databricks 的 CTO Matei Zaharia 发了一份内部评测报告,在他们自己的数百万行代码库上对比了各种编程 Agent。这个代码库涵盖 Scala、Go、Rust、Java、Python、TypeScript 等十几种语言——远不是那种"只有几个 Python 文件"的玩具测试。

报告的地址:
https://www.databricks.com/blog/benchmarking-coding-agents-databricks-multi-million-line-codebase

报告的核心结论之一是:”Harness(就是 Agent 的外壳、中间层)对成本的影响比模型本身还大。“

几个关键数据:

同一个模型(Opus 4.8),通过 Pi Agent 运行比通过 Claude Code 运行便宜 2.08 倍,而且任务完成质量完全相同。Pi 做到的秘诀很简单——每次对话轮次发送的上下文少了大约 3 倍。上下文少了,模型处理得快了,不需要反复回看几十条工具定义。

还有一个震撼的数据:GPT 5.5 跑同一个任务,Codex harness 消耗了 1,235,000 个 token,而 Pi 只消耗了 665,000 个 token——几乎少了一半。

这还没完!报告还戳破了一个常见的幻觉:便宜的单token价格 ≠ 便宜的总成本。A厂的Sonnet 5每token比Opus 4.8便宜1.7倍,看起来很划算。但实际跑任务时,Sonnet花了更多时间反复读代码、绕圈子、试错——最终每个任务的成本是 $2.09,而Opus是 $1.94。Sonnet完成任务成本更高,而且任务完成率还低了6个百分点(81% vs 87%)。

这就像请了两个顾问。一个时薪便宜,但做事拖拉——同样一份报告,他要翻来覆去地查资料、改方案、推倒重来,最后花了20个小时。另一个时薪贵不少,但拿到任务三下五除二,8小时交活。最后你一看总账单:便宜的那个反而多花了一倍的钱。你在雇人的时候,算的是"时薪多少"还是"把这事干成要多少钱"?

Databricks 的答案是:”单任务成本“才是唯一值得看的指标。

而 Pi Agent 在“单任务成本”这个指标上,几乎所有模型都做到了最优——不是因为它的模型特别强,而是因为它够轻。它不在你和模型之间塞任何不必要的东西。还记得我之前说给Deepseek V4加一个强制深度思考协议吗?在Pi下,我只需要提高DS V4的深度思考深度。然后…然后效果比之前在Claude下添加那个劳什子协议要强悍很多。

多模型工作流:不同的事,找不同的人

上一篇文章我聊过我的多模型协同系统:DeepSeek 做调研、写代码,GPT 审核计划、调整思路。但当时这套流程跑在 Claude Code 里,切换模型其实很别扭——毕竟它骨子里是个 Claude-first 的工具。

Pi天生是模型厂商无关的,它不假设你一定用哪家的模型。不用堂而皇之的说我是为了哪个模型做”优化“!你可以在配置文件里随便切换:这一轮用Fable做架构设计,下一轮用DeepSeek实现代码,再用GPT做审查——全在一个终端里完成,不需要开三个不同的工具。

再往上一层,Pi还有一个叫pi-crew的扩展(社区开发的,MIT开源),让你可以用YAML定义多Agent工作流。比如这样:

研究员(用 DeepSeek)→ 写初稿
实现者(用 Opus 4.8)→ 写代码
审查者(用 GPT 5.5)→ 检查质量

每个Agent各自处理一个子任务,跑完交给下一个。不同模型各司其职,便宜的干粗活,贵的做精细活。

还有一个更激进的做法——IndyDevDan在YouTube上演示的Pi-to-Pi通信:直接让两个Pi Agent互相聊天。生产环境的Agent和开发环境的Agent通过网络通信,协调完成一个Bug修复——而生产端全程自动脱敏,不会泄露任何信息。两个 Agent是平等的,没有"上级派活给下级",像一个真正的两人团队在合作。这个和使用一个模型里的不同Agent对话是有本质上区别的,同一个模型的不同Agent对话很容易因为幻觉变成最后聊的你都看不懂的样子了!

这些在 Claude Code 里不是做不了,但要么很重、要么很贵、要么你根本摸不到底层。Pi把控制权交给你,而不是替你决定"你应该怎么工作"。

不光是写代码

到这里你可能觉得Pi Agent是一个纯编程工具——但它不是。

因为Pi本质上只是一个连接你和大模型的极简通道,所以你能用大模型做的事情,Pi都能帮你做,而且更快、更省token。

比如我写这篇公众号文章。之前的流程是:在Claude Code里给指令,Claude Code先加载14K系统提示,再加载项目说明(CLAUDE.md),再加载我指定的参考资料,然后才开始真正工作。现在用Pi,同样的任务,起步就省了十几K token。

再比如日常的零碎需求:让 AI 帮你整理个表格、写封邮件、分析一段日志、查几个 Linux 命令的用法——用 Pi 就是一句话的事,不会有大段系统提示在你前面挡路。

我自己最近的日常使用场景:

  • 写文章:Pi帮我搜集资料、整理大纲、起草初稿(这篇就是)
  • 家庭网络管理:让Pi上的DeepSeek帮我分析Prometheus监控数据,检查节点健康度
  • 多模型协同开发:eVoiceClaw系列产品里,复杂的功能让Opus或者Fable做设计、DeepSeek或者GLM做实现、GPT做审查——一个 Pi 终端全搞定
  • 随手问答:懒得搜的东西,直接问Pi,token开销几乎可以忽略

说白了,Pi 给你的是一种"想用就用"的轻松感。不用担心这个会话是不是开了太多工具导致 token 爆炸,不用担心切个模型是不是又要重新配置,不用担心系统提示里某条规则是不是让你的 AI 变"笨"了。

它就是把控制权交还给你。

也不是没有代价

Pi 的极简意味着你得自己承担一些事情。

Claude Code 的系统提示里藏了很多"保姆级"的规则:怎么管理上下文、怎么压缩对话、子任务的权限边界在哪……这些 Pi 都不替你处理。你要自己学一点 context engineering,学会写好的 AGENTS.md,学会在合适的时候开始新会话。

另外,Pi 没有内置的子 Agent、Plan Mode、Todo 列表、权限弹窗这些东西——你需要的话,得自己去装扩展或者写脚本。它的哲学是"我不帮你做决定,但给你所有工具让你自己做"。

这有点像 Arch Linux 和 macOS 的区别。一个给你最小内核,剩下你自己搭;一个替你做好所有决策,你只管用。

对我来说,能接受。因为我慢慢发现,那些被"自动化"掉的东西,很多我其实不需要。真正需要的那几个,我自己配一下也不费什么功夫——而且配完之后的行为完全可控,没有黑盒。

所以呢

过去几个月,我从 Claude Code 切到 Codex 再切到 Pi Agent。不是哪个工具不好——每个都在某个阶段帮了我很多——而是我发现自己在变。我不再需要一个什么都替我包办的助手了。我更需要一个不挡路的、轻量的、让我能自由选择和组合的通路。

Pi Agent 就是这个通路。

Databricks 的报告给了一个旁证:在真实的、复杂的工程任务面前,轻就是好。 少发 token 就是省钱。少加载的规则就是留给模型更多的思考空间。其实这个也是符合我自己的多模型协同系统的设计里面:尽量少的给AI限制!

如果你现在用的是 Claude Code 或者 Codex,我不建议你立刻全切——每种工具都有它最适合的场景。但如果你和我一样,开始对臃肿的系统提示感到疲惫,开始在意每一笔 token 花在了哪里,开始想让不同模型做它们各自擅长的事——那 Pi 值得你试一下。

开源、MIT 许可、45,000+ GitHub stars、你只付需要付AI的 API 费用。对了:Pi 是支持那些Coding plan和订阅的!

也许你也会和我一样,用了之后回不去。


下一篇聊什么还没想好。也许是那个折腾了几个月还差一点的贝叶斯智能路由方案,也许是白锦龟背竹的养护心得。反正,不着急。