Pi 的极简主义正是其优势
AI 大幅降低了编写代码的成本,因此许多公司为了追求更好的性能,正在构建越来越庞大的工具:更长的提示词、更复杂的编排、更多层级,以及更高的复杂度。这也使得这些工具的使用成本天然更高。Pi 则选择了相反的道路。
Pi 是一套刻意贯彻极简主义的编程智能体运行框架(coding harness)。它开箱仅提供 4 个工具,其系统提示词和工具定义合计不到 1,000 个 token。它的理念是:大多数工作用基础能力就能完成;如果需要更多,就自行构建。
越来越多的证据表明,Pi 的设计不只是更干净,也更便宜、性能更好。用户发现,即使还未针对各自的工作流和需求添加扩展,未经扩展的原生 Pi 也能取得业界领先的结果。正如 Databricks 和 Shopify 的案例所示,Pi 在两者中都交出了理想答卷。
案例研究
Databricks 研究:每项任务的成本
Databricks 最近分享了他们的研究结果:《在 Databricks 数百万行代码库上评测编程智能体》。研究的目标是弄清:哪些编程智能体能在真实编码任务中提供最佳表现,以及任务表现如何随价格变化。
为了避免已经趋于饱和的外部基准测试带来的偏差,他们基于工程团队日常实际执行的任务构建了自己的基准。结果符合我们的预期,却也揭示了许多业内人士可能未曾料到的事实。正如他们所说:“……模型所依赖的运行框架会显著影响成本和质量”;“在许多情况下,像 Pi 这样简单的运行框架在我们的工作负载上表现最好。”

当 Pi 与 Opus 4.8 的 xhigh 推理强度组合时,它取得了最高的整体通过率,成本也显著低于 Claude Code 和 Codex。
极简运行框架,带来可量化的影响
Pi 的优势在于:它不会试图用一大堆会淹没在指令层级中的默认设置和说明去包裹模型。相反,Pi 尽量不妨碍模型发挥,团队可以只加入工作流真正需要的能力。
Databricks 的研究之所以有洞见,是因为它将模型本身与运行框架分开考察。
他们报告称:当以相同的推理强度、通过不同运行框架运行同一个模型时,“每项任务的成本会显著不同(某些情况下超过 2 倍),而质量保持一致”。我们把这称为 Pi 的“上下文纪律(context discipline)”。“Pi 每轮发送的上下文大约只有三分之一。它更好地管理了上下文,维持更紧凑的工作集,并以更少的运行轮次完成任务。”
我们也认同,评估时必须考虑端到端的工程经济性,而不能只看每个 token 的价格。这一点同样适用于模型层面:例如,我们观察到,运行复杂工作流时,Haiku 4.5 的成本常常高于 Sonnet 4.6,尤其是涉及代码执行时;原因很简单,智能体需要更多轮次才能成功完成任务。
如今,这种现象也出现在运行框架层面:搭配高效运行框架的更强、更昂贵模型,可能反而比搭配低效运行框架的较弱、较便宜模型更省钱。
Shopify 构建 Pi Autoresearch:可扩展性胜过臃肿
极简主义是 Pi 的核心理念之一。它能成立,是因为“极简”不等于“不灵活”。事实上,Pi 是首个为可扩展性和自编辑能力而打造、且得到广泛使用的智能体基础设施。
来自 Shopify 的案例进一步验证了 Pi 的设计。在 Shopify Engineering 的这篇文章中,David Cortés 介绍了如何直接将 pi-autoresearch 构建为 Pi 扩展:只需对 Pi 说“Pi,请为 Autoresearch 创建一个扩展……”。Pi 会读取自己的扩展文档,并据此开始构建新的工作流。
Autoresearch 是一个面向编程智能体的自主优化循环。当你提出一项改动,它会运行实验,找出哪些做法有效、哪些会造成回归。只要目标可以衡量,它就能淘汰这些回归,并持续自我改进。
对 Shopify 以及其他团队而言,Autoresearch 扩展很快成为严肃的内部生产力工具。Shopify 报告的案例包括:单元测试“快了 300 倍”、React 组件挂载速度提升“20%”、多个项目的构建时间缩短,甚至连 pnpm 的性能也有所改善。

关键在于,Pi 并不把这些工具作为开箱默认能力交付;相反,它让你可以极其轻松地自己构建它们。与其假设供应商比你更了解工作流、并试图交付无所不包的工具集,Pi 假设你最了解自己的需求,并把扩展能力交到你手上,让你塑造自己的工作流。
为什么现在极简更胜一筹
大约一年前,人们还可以认为原生运行框架具有结构性优势,因为模型就是围绕它们构建的。但这个论点已经越来越站不住脚。
如今的前沿模型通常已经非常擅长理解终端(或终端式)编码环境,并在其中行动。Anthropic 最近将 Claude Code 的系统提示词缩短了 80%,就是一个明确信号。因此,问题越来越不在于运行框架有多“原生”,而在于它如何管理上下文、避免冗余,并用干净的基础原语开展工作。模型需要一个清晰的环境接口,以及一个不浪费上下文的运行框架。
Pi 提供了这些条件:更少的提示词开销和重复上下文、更低的运行成本、更少不必要的抽象。由于它可扩展,你不会失去能力,反而获得了选择性:只有当复杂性“证明自己值得付出成本”时,才把它加进来。
我们也看到本地模型正在快速发展;在 Earendil ,我们认为它们很有前景。Pi 的上下文纪律在这里尤其有价值。本地模型通常拥有更小的上下文窗口,而预填充可能耗时很长,因此维持稳定的提示词前缀至关重要。上下文纪律意味着:除非用户明确要求,我们不会改动上下文,从而避免动辄耗时数分钟的重新预填充。再结合默认系统提示词和工具集的极简设计,这让 Pi 成为本地模型的理想运行框架。
Pi 正在证明,这三者可以兼得:更低成本、更简洁,以及更高性能。