大语言模型是什么
看懂聊天助手背后的大语言模型,以及“会说”为什么不等于“全都懂”。
大语言模型(LLM)是用大量文本训练、能够处理和生成语言的模型。它把文字转换成 Token,通过预测后续 Token 来形成回答,因此很擅长语言任务,但流畅表达不等于真实理解或事实保证。
01
“大”体现在哪里
“大”通常涉及模型参数、训练数据和计算规模。规模扩大后,模型能够处理更丰富的语言模式,但也会带来更高的训练与运行成本。
02
从输入到回答
你的问题先被分成 Token,再转换为模型可计算的表示。Transformer 架构利用注意力机制分析上下文中不同部分的关系,随后逐步生成回答。
模型不是先在脑中写完整答案再展示,而是一步步预测后续内容。
03
LLM 是能力底座,不等于完整产品
聊天产品通常还加入系统指令、搜索、文件读取、安全规则和界面。两个产品即使使用相似模型,实际体验也可能明显不同。
工作例子:整理访谈记录
LLM 可以把一段访谈整理成主题、观点和待办事项。若原记录含有姓名或数字,它仍可能遗漏或改写,交付前要逐项对照原文。
这些概念不要混在一起
模型与聊天工具
模型是底层能力,聊天工具是加入界面、规则和其他功能后的产品。
语言流畅与真正理解
模型能生成连贯语言,但不能据此假定它具备人的经验、意图和责任意识。
可以这样用
- 理解并转换自然语言形式
- 根据上下文续写和归纳
- 协助构思、分类与提取
不能这样假设
- 自动获得训练截止后的事实
- 保证推理过程始终可靠
- 像当事人一样理解现实处境
动手练习 · 约 10 分钟
观察模型如何依赖上下文
- 先问:请写一封邮件。
- 再补充收件人、目的、语气和长度。
- 比较两次结果,写下哪些上下文改变了答案。
常见问题
ChatGPT 就是大语言模型吗?
ChatGPT 是应用产品,背后使用语言模型,并结合界面、工具和安全机制。
参数越多就一定越好吗?
不一定。任务适配、数据质量、工具能力、速度和成本同样重要。
LLM 会记住所有聊天吗?
当前对话可见范围、产品记忆功能和数据政策各不相同,应查看所用产品的具体设置。