ChatGPT是怎么一个字一个字"蹦"出回答的?
ChatGPT、Claude、DeepSeek,名字不同,核心技术一样——大语言模型(LLM)。
它干的事情只有一个:你给它一段话,它算出下一个最可能的字,拼上去,再算下一个。聊天时看到回答一个字一个字往外蹦,就是这个过程。
但模型不认识汉字。所有输入会先被切成叫Token的小碎片,一个汉字大概1-2个Token。GPT-4的上下文窗口128K Token,大约能塞进一本10万字的小说。
能猜得准,靠的是Transformer这个架构。2017年Google提出来的,核心是“自注意力机制”——处理到“猫”这个词的时候,它能同时看到句子里所有其他词,判断哪些词跟“猫”关系更大。GPT-4把这个结构堆了120层,参数1.8万亿个。
光有架构还不行,训练分三步走。先拿整个互联网的文本做预训练,学会语言规律;再用人工写好的问答对做有监督微调(SFT),学会“有人问了该怎么答”;最后用RLHF,让人类对多个回答打分,模型学会哪种回答更好、哪些该拒绝。
它所有的能力都来自“预测下一个Token”。猜对了看起来像懂了,猜错了就是幻觉——编出看着合理但完全错误的内容。记住这一点,用AI的时候心里就有底了。
✳
READ NEXT / 下一篇租房 vs 买房:我是怎么算这笔账的?2026.04.26