ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

<六>ChatGPT到底叫什么?——语言模型

2026/8/13 2:46:14 拓冰建站 浏览量
<六>ChatGPT到底叫什么?——语言模型 接着上篇https://www.cnblogs.com/webor2006/p/21815838继续前几篇一直在说 ChatGPT 是函数、是文字接龙。说实话这些说法虽然好理解但总感觉不太正式——它到底有没有个正经的学名还真有叫语言模型。这篇就来把这个名字掰开看看。一、模型到底是什么意思先别急着看语言咱们先搞懂模型这个词。生活里处处是模型。你手机上那个天气预报 App它就是用一个数学模型算出来的——大气温度、气压、湿度、风速几千个方程搅在一起最后给你一个数明天降雨概率 65%。它完美吗不完美。有用吗太有用了——你知道明天出门要不要带伞。再比如导航软件。它脑子里的路网模型 把真实世界简化成了点和线——路口是点道路是线。真实的马路上有坑、有树、有突然窜出来的小狗导航全不管它只管哪条线最短。简化了但够用。所以模型的核心思路就一句话把复杂到没法全搞懂的东西抓几个关键点用数学表达出来。那语言模型呢就是把语言这个复杂到离谱的东西用数学来描述。二、语言怎么用数学描述想想看说一句话这件事有多复杂。你发条朋友圈今天 emo 了——这四个字背后有你的成长经历(学会了中文和网络文化)有你当下的情绪(低落、不想说太直白)有语言的演化(emo 从 emotional 缩略而来在中文网络里变成了一个动词)还有你和你朋友之间的文化默契(他们知道这不是真抑郁是一种轻松的自嘲)。这事怎么用数学描述好像完全不可能。但语言模型给了一个极其聪明的角度把语言看成一个概率问题。什么意思想象你正在写一句话写到今天天气这四个字之后下一个字可能是什么真——可能性挺大(今天天气真不错)很——也常见(今天天气很好)糟——有可能(今天天气糟糕)紫——几乎不可能(今天天气紫色什么鬼)下一个字不是确定的是多种可能性各有一个概率。语言模型做的事就是把这种概率分布算出来。用数学符号写就是P(下一个词 | 前面说了什么)翻译成人话给定前面的话下一个词出现的概率是多少。比如P(好 | 今天天气) 0.35 → 好有35%的概率 P(很 | 今天天气) 0.25 → 很有25%的概率 P(糟 | 今天天气) 0.08 → 糟有8%的概率 P(紫 | 今天天气) 0.0001 → 几乎不会选这个概率分布不是随便给的它编码了三种语言规律。规律一语法约束为什么紫的概率那么低因为中文语法不允许天气后面直接接颜色词。模型从海量文本里学到了今天天气后面通常接形容词不接颜色所以紫的概率被压到几乎为零。规律二语义连贯猫会()——填什么爬树、抓老鼠概率高飞概率极低。不是语法不对(猫会飞语法没毛病)是现实世界里猫不会飞。模型从数据里学到了这个常识。规律三上下文相关同样都是它的()前面说的是我买了一部新手机还是我做了一道菜下一个词的概率分布完全不同——手机后面屏幕、摄像头概率高菜后面味道、卖相概率高。模型会根据上下文自动切换。所以语言模型的定义其实很简单就是算在某个上下文里下一个词出现的概率。换个角度理解语言模型做的事情就是把语法规则、常识逻辑、上下文关系——这些语言里看不见摸不着的规律——全部浓缩进了那一个个概率数字里。P(好|今天天气)0.35这一个数字背后是模型从几千亿字的文本里学到的关于今天天气后面该接什么的所有知识。三、75 年前就有人想到了你可能以为语言模型是近几年才有的概念。其实它的思想早在 1948 年就被人提出来了——比 ChatGPT 早了整整 75 年。这个人叫克劳德·香农信息论之父。他在 1948 年发表了一篇划时代的论文《通信的数学理论》里面藏了一个有趣的实验。他让志愿者玩一个游戏给你一段英文文本的开头比如 THE ROOM WAS NOT VERY LIGHT A SMALL OBLONG READI___请你猜下一个字母是什么。猜对了继续猜下一个猜错了就告诉你正确答案然后接着猜。结果呢人类能相当准确地预测下一个字母——大部分人会猜 N、G补全出 READING。香农的核心洞察是语言不是随机的是有规律的这个规律可以用概率来描述。他甚至还给出了一个数学公式来衡量语言的不确定性——也就是信息论里著名的熵H -∑ P(x) × log P(x)不用被公式吓到。它的意思其实很朴素如果一个事件各种可能性越平均(比如抛硬币正反各 50%)不确定性就越高熵越大如果某种可能性占绝对优势(比如今天天气后面接好的概率远高于紫)不确定性就低熵越小。语言之所以能被预测正是因为它的熵比完全随机要低得多——有规律可循。这个公式就是现代语言模型的数学基础。更有意思的是香农在 1948 年就预言了如果我们能精确计算语言的概率分布就能制造出一台写作机器生成像人类一样的文本。75 年后ChatGPT 做到了。所以每次用 ChatGPT 的时候不妨想一想——一个天才数学家在计算机都还跟房间一样大的年代已经在纸上画出了这一切的蓝图。四、规律是学出来的不是编出来的学完定义一个问题自然冒出来这些语法规律、语义规律、上下文规律是程序员一条一条写进去的吗完全不是。没人告诉 ChatGPT猫不会飞没人告诉它的不能跟在喜欢后面没人告诉它它要指代前面的名词。这些规律全是模型自己从数据里看出来的。怎么看的统计。训练数据里有几千亿个词。猫会爬树出现了成百上千次猫会飞几乎没出现过(除非童话故事)。我喜欢吃出现了几百万次我喜欢的吃几乎没出现。模型在训练过程中不断调整那 1750 亿个参数逐渐发现了这些统计模式然后把它们编码进参数里。最终你跟它说猫会__它给爬树高概率、给飞低概率——不是因为它理解猫不会飞是因为数据里就是这么分布的。这是一种思路上的彻底翻转。传统的做法叫演绎法语言学家总结规则 → 程序员写成代码 → 计算机执行规则。问题是语言太复杂了——语法规则成千上万条每条都有例外而且YYDS、绝绝子这种新词天天在冒规则永远追不上。语言模型走的是归纳法给你海量文本 → 自己从里面找规律 → 规律自动浮现在参数里。不需要任何人告诉它语法。它只需要做一件事看足够多然后统计。这就是大力出奇迹的第一次体现——不是靠精巧的规则设计而是靠海量数据加巨大算力。当数据量足够大时规律会自然浮现。这个思路看着笨但异常有效。这也是为什么大模型必须大不够大的话规律就浮现不出来。五、为什么归纳法更有效上面说了归纳法和演绎法两个路子。它们到底差在哪说个具体例子就清楚了。中文里我吃饭这三个字排列组合有几种可能我吃饭 —— 正常训练数据里出现了 500 万次我饭吃 —— 别扭只出现了 100 次(多半是打字错误)饭我吃完了 —— 也正常出现了 50 万次(话题前置语法上叫宾语提前)如果用演绎法语言学家得写一条规则说我后面接吃再接饭概率高再写一条例外规则说但如果后面有完了那饭可以提前。光这三个字就要写两条规则加例外。中文有多少个三字组合规则写不完。语言模型不需要任何人写规则。它就是把几千亿字的文本扫一遍统计每种组合出现了多少次概率自然就出来了。它不是在学语法是在做统计。做完了统计语法就在里面了。这就是归纳法的威力不需要理解为什么只需要看出现过多少次。够多就够准。学到这回头一看挺有意思——天气预报是模型导航地图是模型语言模型也是模型。本质上都是在干一件事把复杂得没法全搞懂的东西抓几个关键规律用数学表达出来。天气预报抓的是温度和气压语言模型抓的是 P(下一个词|前文)。一个数字 0.35背后是几千亿字文本里沉淀下来的语法、常识和上下文。更神奇的是这些规律不是谁一条条写的——是模型自己从数据里看出来的。75 年前香农在纸上画出的蓝图今天变成了真的。下一篇见加油