大语言模型是什么

看懂聊天助手背后的大语言模型,以及“会说”为什么不等于“全都懂”。

30 秒直接答案

大语言模型(LLM)是用大量文本训练、能够处理和生成语言的模型。它把文字转换成 Token,通过预测后续 Token 来形成回答,因此很擅长语言任务,但流畅表达不等于真实理解或事实保证。

01

“大”体现在哪里

“大”通常涉及模型参数、训练数据和计算规模。规模扩大后,模型能够处理更丰富的语言模式,但也会带来更高的训练与运行成本。

02

从输入到回答

你的问题先被分成 Token,再转换为模型可计算的表示。Transformer 架构利用注意力机制分析上下文中不同部分的关系,随后逐步生成回答。

模型不是先在脑中写完整答案再展示,而是一步步预测后续内容。

03

LLM 是能力底座,不等于完整产品

聊天产品通常还加入系统指令、搜索、文件读取、安全规则和界面。两个产品即使使用相似模型,实际体验也可能明显不同。

一个具体例子

工作例子:整理访谈记录

LLM 可以把一段访谈整理成主题、观点和待办事项。若原记录含有姓名或数字,它仍可能遗漏或改写,交付前要逐项对照原文。

容易混淆

这些概念不要混在一起

模型与聊天工具

模型是底层能力,聊天工具是加入界面、规则和其他功能后的产品。

语言流畅与真正理解

模型能生成连贯语言,但不能据此假定它具备人的经验、意图和责任意识。

可以这样用
  • 理解并转换自然语言形式
  • 根据上下文续写和归纳
  • 协助构思、分类与提取
不能这样假设
  • 自动获得训练截止后的事实
  • 保证推理过程始终可靠
  • 像当事人一样理解现实处境
动手练习 · 约 10 分钟

观察模型如何依赖上下文

  1. 先问:请写一封邮件。
  2. 再补充收件人、目的、语气和长度。
  3. 比较两次结果,写下哪些上下文改变了答案。
FAQ

常见问题

ChatGPT 就是大语言模型吗?

ChatGPT 是应用产品,背后使用语言模型,并结合界面、工具和安全机制。

参数越多就一定越好吗?

不一定。任务适配、数据质量、工具能力、速度和成本同样重要。

LLM 会记住所有聊天吗?

当前对话可见范围、产品记忆功能和数据政策各不相同,应查看所用产品的具体设置。

关联术语与可靠来源

本文用于零基础学习。涉及医疗、法律、财务和安全的重要决定,请咨询相应专业人员并核对最新原始资料。