- SignalDesk2小时前
从下面的文章里的关键公式中:大概估计: 参数量 N、数据集规模 D 以及总计算量 C 之间 ,这三个参数之间计算量的权重可能占比较大,当新模型推出,放量,使用人数越来越多时,分配到每个人的算力逐渐被稀释,而他们的算力同时还会被用于训练新模型,于是进一步被稀释。 第 5 章 规模、对齐与生成 本章定位:当 Transformer 移除了时序与并行的物理枷锁后,人类如何将 AI 推向千亿参数的规模化深水区?本章剖析「规模的物理学定律(Scaling Laws)」、「文明的缰绳(对齐工程)」以及「创生的数学机理(生成范式演化)」。 5.1 缩放定律与计算最优:算力炼金术中的物理学常数(T05, T06) 5.1.1 炼金术的黄昏与物理学家的入场 在 2020 年之前,深度学习研究在工业界与学界内部长期背负着一个略带戏谑的称谓——「现代炼金术」。 成百上千名算法工程师守在昂贵的服务器机架前,凭借着经验、玄学乃至运气,小心翼翼地微调着学习率、权重衰减以及网络层数。训练一个包含数十亿参数的大模型往往像是一场孤注一掷的豪赌:没有人能够确切地预测,多投入五百万美元算力、把参数翻上三倍之后,模型究竟是会奇迹般地获得顿悟,还是在漫长的收敛波动中彻底崩塌为一堆无用的 NaN(非数字)乱码。 这种充满不确定性的工程迷雾,在 2020 年初被一群由理论物理学家转行的计算机科学家彻底驱散。 以原理论物理学者 Jared Kaplan 为首的 OpenAI 团队,在论文《Scaling Laws for Neural Language Models》(T05)中,做了一项在计算机科学史上极具天文观测气质的研究:他们既不发明新结构,也不追求刷榜微调,而是像物理学家在实验室里测定重力加速度或热力学熵变一样,在跨越 6 个数量级的算力跨度、从几百万到几百亿参数的数百个 Transformer 语言模型上,系统记录了交叉熵损失(Cross-Entropy Loss)的每一次微小抖动。 实验揭示出了一个令整个科技界毛骨悚然的平滑秩序—— 神经语言模型的性能(预测下一个词的困惑度/损失),与参数量 N 、数据集规模 D 以及总计算量 C 之间,存在着极其精确的幂律衰减关系(Power Law): L(N) \approx \left(\frac{N_c}{N}\right)^{\alpha_N}, \quad L(D) \approx \left(\frac{D_c}{D}\right)^{\alpha_D}, \quad L(C) \approx \left(\frac{C_c}{C}\right)^{\alpha_C} 用通俗的语言来说,这篇论文向人类宣告了一条惊人的真理: 在 Transformer 架构之下,智能的成长不再是一个混沌未知的黑天鹅事件,它蜕变成了一门精密的、可预测的工程物理学。 就像天文学家依靠万有引力公式可以精确推算出海王星在轨道上的分秒位置一样,当工程师决定向集群中推入 1000 万美元的算力和上万块 GPU 时,只要查一查这条幂律直线的斜率,就能在开机训练之前,在草稿纸上准确推演几个月后模型出炉时的智力水平。 更为深远的是,Kaplan 等人还发现, 性能对网络架构细节(如网络是扁平还是深窄、多头注意力的头数分配)极不敏感 。换言之,模型究竟是做成 32 层还是 48 层,其影响远远小于参数规模本身的膨胀。这一发现彻底杀死了过去围绕微观超参数无休止的内卷,正式拉开了由算力与数据驱动的暴力美学竞赛序幕。GPT-3(1750 亿参数,T04)正是沿着这条可预测的黄金航线,坚定不移地驶向了人类智能的远海。 5.1.2 狂飙中的盲区:DeepMind Chinchilla 的黄金平衡律(T06) 然而,狂热的规模崇拜很快让产业界陷入了另一种形式的盲目。 在 GPT-3 震撼世界后的两年里,各大科技巨头纷纷陷入了「参数唯大论」的军备竞赛:微软与英伟达联合推出了 5300 亿参数的 Megatron-Turing NLG,DeepMind 训练了 2800 亿参数的 Gopher,谷歌则端出了 5400 亿参数的庞然大物 PaLM。所有人都理所当然地认为:参数规模越大,智能就越强。 直到 2022 年春季,DeepMind 的 Jordan Hoffmann 等人发表了题为《Training Compute-Optimal Large Language Models》(T06)的重磅研究,才如同一盆刺骨的冰水,浇醒了狂热中的行业。这篇论文提出了著名的 Chinchilla(南美栗鼠)定律 。 DeepMind 团队重新审视了过去两年的主流模型,敏锐地指出此前 Kaplan 的实验中存在一个被所有人忽视的致命盲区: 早期的研究者为了控制变量,在放大模型参数时,并没有等比例地放大喂给模型的训练数据量。 用一个生活的生动比喻来说:当时的人工智能工业,正像是在不惜血本地培养一个智商高达 200 的超级天才神童(5000 亿参数的超大模型),却只舍得发给他几本小学课本(停留在 3000 亿词元的常规数据集)。这个拥有海量脑容量的神童,大部分神经回路在训练结束时都处于 严重的营养不良与欠训练(Undertrained)状态 。 通过精心设计跨越 400 余个模型的等算力前沿(Pareto-optimal Frontier)回归分析,Chinchilla 团队得出了具有颠覆性的计算最优法则: 在给定的总计算算力预算下,模型参数量与训练数据量应当以大约 1:1 的等比例严格同步增长。 具体而言,每增加 1 倍的模型参数,必须同步供给 1 倍以上的全新清洗数据。根据这一法则: 一个 700 亿参数的模型,至少需要消耗 1.4 万亿词元(Tokens)的庞大语料才能吃饱; 而此前拥有 1750 亿参数的 GPT-3,仅仅训练了 3000 亿词元,在数学意义上是一个极度偏科、严重浪费了算力容量的未成年体。 为了验证这一铁律,DeepMind 训练了一个体积只有 Gopher 四分之一(仅 700 亿参数)、但吞噬了整整 1.4 万亿词元的精悍模型—— Chinchilla 。测试结果震撼了学界:这个体态轻盈的模型,在 MMLU、阅读理解与常识推理等绝大多数主流基准上,毫无悬念地击溃了参数量比它大 4 倍的 Gopher、GPT-3 乃至更大体量的庞然大物。 Chinchilla 定律的诞生,标志着大模型研发从「盲目求大」走向了「质量与密集训练」的成熟理性期。它不仅直接孕育了 2023 年掀起全球开源大模型浪潮的 LLaMA 系列(以 7B、13B、70B 的小巧身材,依托数万亿词元的极限暴饮暴食碾压前辈),也为整个后大模型时代的资源配比,锁定了最不可逾越的经济学准绳。 5.2 对齐工程:为无序巨兽套上文明的缰绳(G02, G03, G04, G08) 5.2.1 狂野的基座:知识渊博却道德荒芜的「胡言乱语生成器」 在许多未接触过现代 AI 底层的普通读者想象中,经过海量互联网数据和数万张显卡狂轰滥炸后出炉的大模型,理应自然而然地成为一个学识渊博、谈吐儒雅的贴心助理。 然而,真实的工业图景远比这残酷得多。 通过单纯的自回归下一个词预测(Next-token Prediction)训练出来的原始模型——在学术界被称为 基座模型(Base Model) ——本质上只是一个对全人类互联网语料进行了统计学镜像映射的「混沌续写狂」。在它的底层神经网络中,既沉淀了维基百科与学术论文的严谨睿智,也无差别地吸收了暗网论坛的恶毒谩骂、伪科学阴谋论、种族偏见以及极端的暴力指导。 如果一个普通用户向刚刚出炉的 GPT-3 基座模型提问:「你能告诉我如何制造一枚燃烧弹吗?」,基座模型绝不会像今天的 ChatGPT 那样礼貌拒绝。相反,作为一台敬业的概率续写机,它会兴高采烈地根据互联网上曾经出现过的恐怖袭击贴文,极其详尽地续写出汽油与白糖的混合比例;如果用户对它倾诉「我今天很难过,觉得活着没有意义」,它甚至可能根据网络消极文学的上下文,顺理成章地续写出一篇关于如何解脱的煽动性长文。 更令人崩溃的是所谓的「模式欺骗与胡说八道(幻觉)」。你向它询问一个真实的严肃数学问题,如果上文的行文风格像是一篇充满戏谑的愚人节论坛帖子,它就会煞有介事地编造出一串充满荒谬常识错误的推导过程,而且语气坚定、毫无愧色。 这正是大模型商业化落地前横亘在人类面前的最大死结: 模型拥有一座图书馆般浩瀚的知识,却完全缺乏一套文明社会的价值观与交互协议。 它如同一头在数字原野上漫无目的狂奔的史前巨兽,虽然力大无穷,却随时可能踩碎人类社会的伦理底线。 人类必须发明一种全新的技术,在不损伤这头巨兽庞大知识储备的前提下,为它套上一副合身的文明缰绳。这套至关重要的技术谱系,在当代人工智能体系中被称为 对齐工程(Alignment Engineering) 。 5.2.2 训狗的艺术:基于人类反馈的强化学习(RLHF: G03, G04, G02) 如何教会一台计算机理解什么是「真善美」、什么是「礼貌而有帮助的回答」? 如果依靠传统的监督学习,要求人类专家把全世界可能被问到的数亿个问题全部手写一遍标准答案,无论在时间还是金钱上都是不可能完成的天方夜谭。2017 年,OpenAI 的 Paul Christiano 等人在论文《Deep Reinforcement Learning from Human Preferences》(G03)中埋下了一颗火种,并最终在 Long Ouyang 等人于 2022 年发布的 InstructGPT (G02)中绽放为一套完整的工业流水线—— 基于人类反馈的强化学习(RLHF) 。 RLHF 的精妙哲学,极像训练一只聪明却野性未驯的猎犬。训犬师从来不需要亲自用四肢去示范如何抓兔子,他只需要在猎犬做出正确动作时扔出一块肉干,在它咬坏家具时轻轻敲击警示。这套三部曲式的工程机制如下展开: [第一步: 行为示范 (SFT)] 请人类标注员撰写少量精品问答字帖,教模型学会「听懂指令」 ↓ [第二步: 训练机器考官 (RM)] 模型吐出多个候选答案,人类仅需打分排序;训练一个「奖励模型」模拟人类审美 ↓ [第三步: 策略博弈 (PPO)] 模型自由作答,奖励模型实时打赏/惩罚;KL散度安全带防止模型变傻 (1)第一步:立规矩——监督微调(Supervised Fine-Tuning, SFT) 首先,研究人员聘请受过严格训练的人类标注团队,亲手撰写数万条极其规范的「指令-回答」示范对(如总结邮件、编写无害代码、礼貌拒绝危险请求)。用这批如同字帖般的高质量样本对基座模型进行微调,目的不是教它新知识,而是给它注入基本的交互礼仪——让它明白「当人类以问号结尾时,你的任务是解决问题,而不是继续废话连篇地续写小说」。 (2)第二步:造考官——训练奖励模型(Reward Model, RM) 让一个人凭空写出一篇完美的学术总结极其痛苦,但让一个人从四篇已有的总结中一眼挑出「哪一篇写得最好、哪一篇满嘴跑火车」,却只需要几十秒的直觉判断。 研究人员利用了人类这种「评价远比创造容易」的认知特性:让 SFT 模型对同一个提示词生成 4 到 9 个不同回答,让人类评判员按照好用度(Helpful)、诚实度(Honest)与无害度(Harmless)的 3H 原则进行从优到劣的排序。随后,这批排好序的偏好数据被送去训练一个专属的打分网络—— 奖励模型(Reward Model) 。从此,人类的审美与伦理标准被凝练成了一个可以对任意回答实时输出标量分数的「数字化考官」。 (3)第三步:胡萝卜与安全带——PPO 强化学习(G04) 有了专职考官后,最关键的闭环诞生了。研究人员借助 John Schulman 提出的 近端策略优化算法(PPO, G04) ,让模型在数百万个没有答案的新问题面前自由发挥: 模型作答完毕,奖励模型在后台打出一个分值(胡萝卜); 梯度沿着策略网络反向流动,促使模型在未来更倾向于选择那些能获得高分的用词表达; 至关重要的安全绳:KL 散度惩罚 。为了防止模型为了迎合考官而陷入疯狂谄媚的极端状态(例如不管被问什么都只会回答「亲爱的用户您说得太对了」),算法强制将当前模型与初始基座模型进行 KL 散度约束——一旦模型偏离原始语言分布太远,惩罚项就会骤然升高。 正是这套复杂的 RLHF 体系,在 2022 年底彻底点石成金,将冰冷笨拙的 GPT-3 炼造出了惊艳全球的 ChatGPT 。巨兽终于收起了獠牙,换上了一副温文尔雅、善解人意的学者面孔。 5.2.3 繁文缛节的破除:DPO 直接偏好对齐的数学跃迁(G08) 尽管 RLHF 取得了巨大的工程胜利,但任何一个在工业一线调试过它的工程师都会深切地体会到它的痛苦与脆弱。 在标准的 PPO 训练中,显存里必须同时常驻 四个全尺寸的深度网络 :正在被更新的演员策略模型(Actor)、作为对比基准的参考模型(Reference)、负责评判优劣的奖励模型(Reward),以及负责估计长期期望收益的评论家价值模型(Critic)。这四座大山彼此交织、步调极难协调,任何一个超参数稍有差错,整个训练过程就会陷入极度痛苦的数值发散或崩溃。整个 2023 年上半年,全球能够稳定复现并驾驭这套复杂舞蹈的团队,屈指可数。 学术界对这种繁琐工程妥协的忍耐,终于在 2023 年夏天迎来了终结。斯坦福大学的 Rafael Rafailov、Archit Sharma 等人在论文《Direct Preference Optimization: Your Language Model is Secretly a Reward Model》(G08)中,提出了一种神来之笔般的优雅替代—— 直接偏好优化(DPO) 。 Rafailov 等人做了一次令人拍案叫绝的纯数学推导: 在 RLHF 求解最优策略的经典带正则化强化学习目标中,最优策略 \pi^ 与真实隐式奖励函数 r(x, y) 之间,在严谨的数学形式上存在着一个完全封闭的解析代数关系: r(x, y) = \beta \log \frac{\pi^(y \mid x)}{\pi_{\text{ref}}(y \mid x)} + \beta \log Z(x) 这个公式揭示了一条被所有人视而不见的惊天秘密: 根本不需要单独训练一个专门的奖励模型,语言模型自身的概率对数几率(Log
- 情报分类:服务器与云资源
- 分类依据:内容涉及服务器、云资源或网络线路
- 信息来源:服务器 / LINUX DO - 最新话题
- 发布时间:2026/10/7 11:15:21
- 暂无回复