大模型不是懂世界的专家,是靠海量文本练出”下一句怎么接”的高手。弄清参数、训练、推理这三件事,你才不会神话它,也不会小看它。
快速结论
- 大模型本质是从海量文本中学”下一个词概率”的模型。
- 参数是训练学到的内部权重,规模越大容量越广。
- 训练分预训练(学语言)和微调(学任务)两阶段。
- 推理是生成过程,温度等参数影响随机程度。
它到底在做什么
剥离光环,大模型核心任务极朴素:给定前文,预测下一个最可能出现的词,再把这个词接上,继续预测。整段回答就是这么一词一词接出来的。它学的是语言的概率规律。
所以大模型”懂”的是语言模式,不是世界真相。它说的很多事听起来有理,是因为训练文本里这类表达多,不代表它真验证过。理解这一点,才不会把它的话当权威结论。
参数是什么
参数(权重)是训练过程中模型内部调整出的海量数字,是它”记忆”语言规律的地方。参数越多,模型能装下的模式越细,对复杂语义的把握越细腻。规模是能力的底座之一。
但参数多不等于一定聪明,还要看数据质量和训练方法。盲目追参数量是误区,同样参数下,干净数据加好方法能拉开差距。参数是硬件,数据和训练才是引擎。
训练的两阶段
预训练用海量无标注文本,让模型学通语言规律和广博知识,这一步算力最重、周期最长,是”打底子”。此后的模型像个博览群书但没专项训练的通才。
微调用特定任务或数据继续训练,让模型适配具体场景,比如按指令作答、按格式输出。预训练给广度,微调给适配。两阶段分清,才知道该在哪一环投入。
推理是怎么发生的
你提问后,模型进入推理:基于前文逐词预测,每步从候选词里按概率挑一个接上,直到结束。推理消耗算力,也决定响应速度与单次成本,是模型”干活”的时刻。
推理有可调参数,比如温度:低温度更确定保守,高温度更发散创意。不同任务选不同温度,写代码要低、 brainstorm 可高。温度是控制输出性格的旋钮。
它不会真懂的边界
大模型没有真实感官和经验,不”经历”世界,只处理文本符号。它答”太阳从哪边升起”,是基于语料共识,不是观测。遇到训练里少见的真实因果,它会自信地编。
所以面对需要真实验证、实时事实、专业判断的事,要当它”博学但不可靠”,用工具和人类把关补足。清楚边界,才不会在关键处被它的笃定带偏。
幻觉从哪来
幻觉根子在”预测下一个词”这件事本身:模型优先选概率高的续写,哪怕那是编的。当问题超出它的可靠知识,它仍会接着编出通顺但假的答案,因为它没有”我不知道”的硬开关。
缓解靠外部约束:接检索让它基于真实资料答、在提示词里画红线、对关键结论要求溯源。理解幻觉的机理,才知道为什么 RAG 和约束能压住它,而不是指望模型自觉。
大模型和小模型
同一架构,参数少的叫小模型,参数多的叫大模型。大模型容量大、能力强但贵且慢;小模型便宜快、能本地跑,但复杂任务易露怯。选型看任务要多少”脑力”。
蒸馏能把大模型能力迁移到小模型,让简单任务不必砸大资源。理解这层,你就不会凡事都上最大模型,而是按任务复杂度分层用模型,成本和体验才平衡。
和 Agent 的关系
大模型是 Agent 的”大脑”,负责理解与决策;Agent 在此基础上接工具、管记忆、跑流程。没有大模型,Agent 不会思考;没有 Agent,大模型只是会聊天的模型。
理解这层,你就明白为什么 Agent 的能力上限受模型制约,也为什么光有大模型不够——还要有工程把它的”想法”变成”动作”。两者是脑与身的关系。
常见三个误解
误解一:模型懂世界,其实它只懂语言模式。误解二:参数越大越聪明,其实数据和训练同样关键。误解三:它说的都可信,其实它会自信地编。
三者都指向同一件事:把大模型当”概率续写器”而非”全知专家”,能力边界就清楚了。不神话也不小看,才能用得准。
怎么初步判断一个模型
看三件事:在你任务上的实测表现、单次推理成本、响应延迟。榜单排名只是参考,真落到你的场景跑一遍,才知道合不合用。模型好不好,用你的数据说话。
还要看可控性:能否私有部署、能否调温度、是否有安全护栏。把这些纳入选型,而不是只看参数规模。理解模型本质,选型才不盲从。
图:大模型三件事 核心要点(运营GO 整理)
| 概念 | 是什么 | 注意 |
|---|---|---|
| 参数 | 训练所得权重 | 多≠一定聪明 |
| 预训练 | 学语言广博 | 算力最重 |
| 微调 | 学任务适配 | 两阶段分清 |
| 推理 | 逐词生成 | 温度控性格 |
延伸阅读:什么是 RAG 检索增强生成、什么是 Prompt(提示词)。
下一步行动清单
- 把它当”概率续写器”,不神话也不小看。
- 区分预训练广度与微调适配,投入看环。
- 推理按任务调温度,写代码要低。
- 关键事实接检索并要求溯源,压幻觉。
- 选型用你的场景实测,不只看榜单。


