算力拾荒者:如何用闲置GPU降低Token成本

前英伟达工程师Neil Movva创立Sail Research,专捡低价算力,将每Token成本降至最低,为长时程AI Agent铺路。本文解读其策略与市场洞察。
从英伟达到“算力拾荒者”
在AI算力争夺战中,绝大多数公司都在追逐最先进的Nvidia GPU,但前英伟达工程师Neil Movva却反其道而行之。这位毕业于斯坦福大学的工程师,曾在Nvidia参与Volta GPU的性能优化,将BatchNorm性能提升20%,后来又在Apple和Together AI深耕推理基础设施。2025年底,他与同学Samir Menon创立了Sail Research,2026年6月获得8000万美元融资,估值达4.5亿美元。
他的理念很简单:“没有坏芯片,只有坏价格。”别人抢购最贵的GPU,他研究AMD、TPU、Trainium等替代品;别人要求99.99%的可用率,他接受95%甚至更低;别人嫌弃间歇性风电、太阳能,他却想把这些“没人要”的算力聚合起来。这种“拾荒者”打法,核心目标是极致压低Token成本,为长时程AI Agent解锁无限的后台智能消耗。
为什么速度不再重要
Neil在播客中提出一个关键观点:当AI Agent在后台连续运行数小时甚至几天时,每秒输出100个Token还是10个Token并不重要,重要的是每美元能买到多少“智能”。这背后的趋势是测试时计算扩展——给Agent更多时间,它能给出更好的答案。从Opus 4.5开始,模型已经能稳定运行1小时,未来将扩展到几天。
他强调,人的注意力是瓶颈。当你坐在电脑前等待响应时,你限制了Agent的工作量。未来的协作模式是:你早上醒来,工作已在夜间完成。因此,后台任务将消耗绝大多数Token,预计从今年的50%增长到未来的90%。
哪些任务适合后台Agent
Neil指出几个典型场景:
- 深度研究:覆盖1万甚至更多来源的权威信息索引,如客户Parallel Web Systems构建的EB级互联网索引。
- 网络安全:生成代码比破坏代码容易,但漏洞发现需要指数级的尝试。Fable等工具已能主动渗透测试,甚至有人调侃“安全成了工作量证明”。
- 复杂代码审查:用多种方式检查历史代码,寻找内存错误、业务逻辑漏洞等。
值得注意的是,智能能力的前沿是锯齿状的——大模型不一定能发现小模型能找到的问题,Haiku可能发现Fable遗漏的漏洞。这意味着多样化模型组合比单一最强模型更有效。
英伟达的生态策略
Neil还分析了英伟达的定价策略:理论上可以不断提价,但更看重长期生态。如果少数大客户拿走过多GPU,会积累过强议价权,破坏生态平衡。因此,英伟达宁愿扶持CoreWeave等竞争性云厂商,也不亲自做NeoCloud,避免与下游客户竞争。这种克制策略确保了即使某家客户转向AMD或自研,其他客户也能补位。
对开发者的启示
对于AI使用者和开发者,Neil的“拾荒者”哲学提供了一套实用思路:
- 重新评估延迟需求:如果任务可以异步运行,不必追求最低延迟,选择更便宜的算力。
- 拥抱开源模型:开源权重让你拥有控制权,不易被锁定。
- 组合模型策略:不要只依赖单一最强模型,混合使用不同大小模型可能更高效。
- 关注总成本:计算每单位“智能”的成本,而非单纯比较Token价格。
这套打法不仅适合创业公司,也能帮助个人开发者更经济地使用AI能力。