← 全部随笔

大模型 API 成本怎么算?

插图

一次请求里,发给模型的系统提示词、历史对话、用户问题,都会算输入 Token;模型生成的回答,会算输出 Token。很多时候,多轮对话变贵,不是模型突然“涨价”,而是你每一轮都把前面的聊天记录又带了一遍。

所以算成本可以先记这个公式:输入 Token × 输入单价 + 输出 Token × 输出单价,再乘调用次数。

做 AI 应用时,最容易烧钱的地方有三个:Prompt 写得太长、历史上下文全塞进去、让模型输出很长的回答。优化也从这三处下手:压缩历史、限制输出长度、小任务用便宜模型,大任务再上强模型。

面试里如果被问“怎么控制大模型 API 成本”,别只说省 Token。可以按输入、输出、模型选择、缓存、限流这几个关键词展开。

插图
插图
插图
插图
插图
插图
READ NEXT / 下一篇别再用百度查问题了,AI搜索差在哪?2026.05.01