我每月愿意花大约 200 美元使用前沿模型。钱从账户里扣掉,我也确实得到了一种过去买不到的东西:随时可以调用的代码能力、研究能力和第二视角。

这笔支出证明智能有价,却不能替任何一座数据中心证明回报。用户愿意付钱,应用公司能不能留下毛利,云厂商能不能从应用收入中收回服务器、电力和折旧,是三次不同的结算。

对创业者来说,结算来得更早。模型每多思考一轮,账单就多一笔;答案看起来更聪明,客户却未必多付钱。只把模型包进一个聊天框,相当于按零售价买 token,再用包月价格卖给最会消耗 token 的人。

先算一次调用

Claude Sonnet 4.6 的公开价格为例,输入为 3 美元/百万 token,输出为 15 美元/百万 token。一次调用使用 1 万输入和 2000 输出 token,模型成本约为 0.06 美元。Anthropic 模型定价

10000 * 3 / 1000000 + 2000 * 15 / 1000000 = 0.06 美元

单次回答并不贵。长上下文、搜索、截图、工具结果、失败重试和多轮 Agent Loop 才会把成本推高。Google 给出的托管 Agent 说明中,一次交互可能消耗 10 万到 300 万 tokenGemini Agent 文档

产品不能只统计模型第一次返回答案花了多少钱。完整交付成本还包括搜索和第三方工具、人工复核、失败任务、免费额度、退款以及为低质量结果付出的客服时间。

单次贡献利润
= 任务收入
- 模型与工具成本
- 人工复核成本
- 失败和退款成本

我会先用一个很粗的门槛筛项目,完整交付成本不能超过售价的 20%。一次任务需要 10 元才能交付,客户至少应当愿意支付 50 元。早期试验可以暂时越线,成熟产品不能把“以后模型会降价”写进盈利前提。

客户到底在买什么

Codex 这类生产力工具减少了开发时间,推荐和广告系统提高了消费转化。这两类价值目前最容易核算。

客户得到的东西可以核算的结果常见收费方式当前成熟度
更少的人工和等待工时、交付周期、单位产量席位、订阅、按量已跑通
更多收入转化率、客单价、留存和复购订阅、广告、收入分成已跑通
更少损失欺诈、坏账、事故和合规成本按交易、按资产、节省分成已跑通,主要由传统机器学习验证
更少资本占用库存天数、停机时间、空驶和能耗按资产、按用量、节省分成在垂直场景中成立
新的数字体验陪伴、教育、游戏角色和个人智能订阅、内购、会员支付需求成立,长期毛利待验证
可授权的知识产权药物候选物、材料配方和工业设计预付款、里程碑、授权和版税合同路径成立,兑现周期很长
被完成的交易采购、预订、招聘匹配和理赔抽佣、按结果收费仍在早期

风险产品的付款理由尤其直接。Stripe Radar 按筛选的交易收费,客户买的不是一份模型回答,而是少发生几笔欺诈和拒付。Stripe Radar

药物发现走的是另一条路。Isomorphic Labs 与药企签订的合作包含预付款、研发里程碑和未来销售版税。模型调用只是研发成本,真正出售的是候选药物和知识产权。Isomorphic Labs

同样是 AI,付款人、结算周期和失败方式完全不同。把它们都叫作“降本增效”,会漏掉最重要的账单。

模型之外的毛利

应用公司很难靠比云厂商更便宜地获得算力建立护城河。模型降价时,竞争对手也会一起降价;前沿模型进步时,原来收费的功能可能在下一次基础模型更新里免费出现。

客户的数据、业务规则、系统权限、结果验证、责任边界和分发渠道,决定应用层能留下多少利润。模型接口可以替换,重新整理数据、接入权限、建立评测和获取客户仍然要花钱。

Agent Native:让产品形成智能闭环 里区分了离线和在线 token。离线调用用来整理知识、案例、评测集和决策树,在线调用只调度与当前任务有关的部分。这样可以提高回答质量,也避免每次都让最贵的模型重读整个世界。

分类和抽取交给小模型,前沿模型只处理困难部分;计算、排序和格式转换交给普通程序;给 Agent Loop 设置预算、轮数和提前终止条件;对重复上下文使用缓存;离线任务使用批处理。

这些优化可以降低成本,却不能挽救没人付钱的产品。Query 驱动的垂直 AI 满足 可以找到具体需求,下一步还要找到付款人。有人搜索“怎么选保险”,不代表他会为一篇答案付费;如果结果能完成保单整理、缺口计算或理赔材料检查,才出现可以计价的任务。

query 到第一笔利润

  1. 找到一个具体 query,确认用户现在怎样解决、花多少时间、承担什么损失。
  2. 先用人工和现成模型完成一次,不急着开发平台。
  3. 记录完整成本,包括失败调用、搜索、复核和交付时间。
  4. 在自动化之前收一次钱。没有付款,满意反馈不算验证。
  5. 只有客户支付金额能覆盖五倍以上的交付成本,才继续压缩流程和扩大用量。

能生成答案却不能结束一项工作,或者只有试用没有付款的想法,到第四步就会暴露。

应用收入能否接住基建

投资市场讨论 AI 时,经常把“有用”和“赚钱”揉在一起。我自己的订阅支出可以证明前沿智能已经产生真实效用,应用公司的账单却还要继续往下传:

用户得到结果并付钱
  -> 应用公司扣除模型成本后留下毛利
  -> 云厂商从调用量中获得经营利润
  -> 经营利润覆盖数据中心、电力、折旧和下一轮设备替换

任何一段断掉,AI 仍然可能有用,上游投资却未必有好回报。应用为了争夺用户补贴调用费,收入会停在应用层;云厂商竞相降价,价值会流向用户;设备更新快于折旧,利润又会被下一轮资本开支吞掉。在 AI 周期、滞胀与四层仓位框架AI 供应链吸血 — 底层机制与泡沫信号 中,我会继续沿着这几笔账检查上游资本开支。

每次调用前,产品至少应该知道这次 token 会进入哪一份交付物,替谁省下多少时间、减少什么损失,或者促成哪一笔交易。说不清这件事,就先别调用。