我每月愿意花大约 200 美元使用前沿模型。钱从账户里扣掉,我也确实得到了一种过去买不到的东西:随时可以调用的代码能力、研究能力和第二视角。
这笔支出证明智能有价,却不能替任何一座数据中心证明回报。用户愿意付钱,应用公司能不能留下毛利,云厂商能不能从应用收入中收回服务器、电力和折旧,是三次不同的结算。
对创业者来说,结算来得更早。模型每多思考一轮,账单就多一笔;答案看起来更聪明,客户却未必多付钱。只把模型包进一个聊天框,相当于按零售价买 token,再用包月价格卖给最会消耗 token 的人。
先算一次调用
以 Claude Sonnet 4.6 的公开价格为例,输入为 3 美元/百万 token,输出为 15 美元/百万 token。一次调用使用 1 万输入和 2000 输出 token,模型成本约为 0.06 美元。Anthropic 模型定价
10000 * 3 / 1000000 + 2000 * 15 / 1000000 = 0.06 美元单次回答并不贵。长上下文、搜索、截图、工具结果、失败重试和多轮 Agent Loop 才会把成本推高。Google 给出的托管 Agent 说明中,一次交互可能消耗 10 万到 300 万 token。Gemini Agent 文档
产品不能只统计模型第一次返回答案花了多少钱。完整交付成本还包括搜索和第三方工具、人工复核、失败任务、免费额度、退款以及为低质量结果付出的客服时间。
单次贡献利润
= 任务收入
- 模型与工具成本
- 人工复核成本
- 失败和退款成本我会先用一个很粗的门槛筛项目,完整交付成本不能超过售价的 20%。一次任务需要 10 元才能交付,客户至少应当愿意支付 50 元。早期试验可以暂时越线,成熟产品不能把“以后模型会降价”写进盈利前提。
客户到底在买什么
Codex 这类生产力工具减少了开发时间,推荐和广告系统提高了消费转化。这两类价值目前最容易核算。
| 客户得到的东西 | 可以核算的结果 | 常见收费方式 | 当前成熟度 |
|---|---|---|---|
| 更少的人工和等待 | 工时、交付周期、单位产量 | 席位、订阅、按量 | 已跑通 |
| 更多收入 | 转化率、客单价、留存和复购 | 订阅、广告、收入分成 | 已跑通 |
| 更少损失 | 欺诈、坏账、事故和合规成本 | 按交易、按资产、节省分成 | 已跑通,主要由传统机器学习验证 |
| 更少资本占用 | 库存天数、停机时间、空驶和能耗 | 按资产、按用量、节省分成 | 在垂直场景中成立 |
| 新的数字体验 | 陪伴、教育、游戏角色和个人智能 | 订阅、内购、会员 | 支付需求成立,长期毛利待验证 |
| 可授权的知识产权 | 药物候选物、材料配方和工业设计 | 预付款、里程碑、授权和版税 | 合同路径成立,兑现周期很长 |
| 被完成的交易 | 采购、预订、招聘匹配和理赔 | 抽佣、按结果收费 | 仍在早期 |
风险产品的付款理由尤其直接。Stripe Radar 按筛选的交易收费,客户买的不是一份模型回答,而是少发生几笔欺诈和拒付。Stripe Radar
药物发现走的是另一条路。Isomorphic Labs 与药企签订的合作包含预付款、研发里程碑和未来销售版税。模型调用只是研发成本,真正出售的是候选药物和知识产权。Isomorphic Labs
同样是 AI,付款人、结算周期和失败方式完全不同。把它们都叫作“降本增效”,会漏掉最重要的账单。
模型之外的毛利
应用公司很难靠比云厂商更便宜地获得算力建立护城河。模型降价时,竞争对手也会一起降价;前沿模型进步时,原来收费的功能可能在下一次基础模型更新里免费出现。
客户的数据、业务规则、系统权限、结果验证、责任边界和分发渠道,决定应用层能留下多少利润。模型接口可以替换,重新整理数据、接入权限、建立评测和获取客户仍然要花钱。
Agent Native:让产品形成智能闭环 里区分了离线和在线 token。离线调用用来整理知识、案例、评测集和决策树,在线调用只调度与当前任务有关的部分。这样可以提高回答质量,也避免每次都让最贵的模型重读整个世界。
分类和抽取交给小模型,前沿模型只处理困难部分;计算、排序和格式转换交给普通程序;给 Agent Loop 设置预算、轮数和提前终止条件;对重复上下文使用缓存;离线任务使用批处理。
这些优化可以降低成本,却不能挽救没人付钱的产品。Query 驱动的垂直 AI 满足 可以找到具体需求,下一步还要找到付款人。有人搜索“怎么选保险”,不代表他会为一篇答案付费;如果结果能完成保单整理、缺口计算或理赔材料检查,才出现可以计价的任务。
从 query 到第一笔利润
- 找到一个具体
query,确认用户现在怎样解决、花多少时间、承担什么损失。 - 先用人工和现成模型完成一次,不急着开发平台。
- 记录完整成本,包括失败调用、搜索、复核和交付时间。
- 在自动化之前收一次钱。没有付款,满意反馈不算验证。
- 只有客户支付金额能覆盖五倍以上的交付成本,才继续压缩流程和扩大用量。
能生成答案却不能结束一项工作,或者只有试用没有付款的想法,到第四步就会暴露。
应用收入能否接住基建
投资市场讨论 AI 时,经常把“有用”和“赚钱”揉在一起。我自己的订阅支出可以证明前沿智能已经产生真实效用,应用公司的账单却还要继续往下传:
用户得到结果并付钱
-> 应用公司扣除模型成本后留下毛利
-> 云厂商从调用量中获得经营利润
-> 经营利润覆盖数据中心、电力、折旧和下一轮设备替换任何一段断掉,AI 仍然可能有用,上游投资却未必有好回报。应用为了争夺用户补贴调用费,收入会停在应用层;云厂商竞相降价,价值会流向用户;设备更新快于折旧,利润又会被下一轮资本开支吞掉。在 AI 周期、滞胀与四层仓位框架 和 AI 供应链吸血 — 底层机制与泡沫信号 中,我会继续沿着这几笔账检查上游资本开支。
每次调用前,产品至少应该知道这次 token 会进入哪一份交付物,替谁省下多少时间、减少什么损失,或者促成哪一笔交易。说不清这件事,就先别调用。