LESSON 03 · HOW IT WORKS

生成式 AI 为什么会回答,也会出错?

大语言模型根据训练中学到的语言模式和当前上下文,逐步预测接下来更合适的 Token。它擅长生成连贯内容,但不是自动核验事实的数据库。

阅读约 7 分钟无需数学基础最后核对:2026-07-14
  1. 01 发展历程
  2. 02 核心概念
  3. 03 工作原理
  4. 04 能力边界
  5. 05 提示方法
  6. 06 安全核对
  7. 07 第一次实操

一句话回答

生成式 AI 会回答,是因为它从大量数据中学习了语言和内容模式;它会出错,是因为生成目标首先是形成符合上下文的输出,而不是保证每句话都经过真实世界验证。

本节你会学到

  • 训练与使用两个阶段
  • Token 和上下文是什么
  • AI 幻觉为什么出现
  • 联网搜索如何帮助但不能保证正确

第一步:模型在训练中学习模式

训练不是把所有网页逐字存成一个可搜索文档库,而是通过大量样本调整模型参数,让模型逐渐学会文字之间的关系、常见表达、概念联系和任务模式。

训练资料、数据质量、模型结构、计算资源和训练方法都会影响最终能力。模型也可能继承资料中的错误、偏见和时间限制。

第二步:模型根据上下文逐步生成

Token

模型处理文字时使用的基本单位,可能是一个字、词的一部分或标点,不一定等于自然语言中的完整词语。

上下文

当前对话、系统要求、你提供的资料和工具返回内容共同形成模型本轮可参考的信息范围。

概率生成

模型根据已经出现的内容判断下一步更合适的 Token,再不断重复,最终形成句子和段落。

模型参数

训练过程中形成的大量数值关系,承载模型学到的模式,但不是一张可以直接查看的事实清单。

因此,同一个问题换一种说法、增加不同资料或采用不同模型设置,回答可能变化。自然流畅说明语言模式匹配得好,不代表事实已经核实。

AI 幻觉为什么会出现?

“幻觉”通常指模型生成了看起来合理、实际却错误、虚构或无法证实的内容。常见原因包括:

  • 问题缺少必要背景,模型只能根据常见模式补全。
  • 训练资料中没有相关事实,或资料已经过时。
  • 用户要求模型必须给出答案,模型倾向继续生成而不是停下。
  • 涉及精确数字、引用、法律条文或冷门人物时,语言连贯性不足以保证真实性。
  • 模型错误理解了你的任务或提供的资料。

降低幻觉的实用方法

提供原始资料;要求区分“已知事实、推断和不确定项”;让模型给出核对清单;重要结论回到官方文件、原始数据或专业人士处确认。

三道自测题

1. 模型生成流畅文字是否说明事实正确?

不说明。语言连贯性与事实准确性是两个不同问题。

2. 上下文包括什么?

包括当前对话、系统要求、用户资料以及可能调用的搜索或工具结果。

3. 联网搜索能完全消除幻觉吗?

不能。它可以补充资料,但仍需核对来源、日期和模型概括是否准确。

资料来源与核对说明

本页为入门解释,省略了模型结构和训练过程中的大量数学与工程细节。发布与核对:南阳芊洲人工智能科技有限公司,2026-07-14。