专家为您带来最新的 AI 趋势
获取有关最重要且最有趣的 AI 新闻的精选洞察分析。订阅我们的每周 Think 时事通讯。请参阅 IBM 隐私声明。
推理模型,也称为思考模型或大型推理模型 (LRM),属于经过微调的大语言模型 (LLM)。该模型通过生成中间步骤(通常称为“推理轨迹”)实现多步问题求解;在输出最终回答之前,模型会借助推理轨迹对输出结果进行迭代优化。
推理模型经过训练,可运用复杂的思维链推理以及其他多步决策策略,代表着大语言模型性能的前沿水平,在数学、编程以及其他依赖逻辑推理的领域表现尤为突出。这类“思考模型”最初作为独立的专用模型类别推出,如今已经日益普及:当前大多数现代大语言模型都提供“思考模式”或是命名相近的推理能力。
“推理模型”这一概念由 OpenAI 于 2024 年 9 月通过 o1‑preview(以及 o1‑mini)首次推出;同年 11 月,阿里巴巴发布 “Qwen with Questions”(QwQ‑32B‑preview),12 月谷歌推出 Gemini 2.0 Flash Experiment。推理类大语言模型发展过程中的一个里程碑事件,是 2025 年 1 月开源模型 DeepSeek‑R1 的发布。此前推理模型所使用的微调训练流程均属于严格保密的技术,而深度求索发布了详尽的技术论文,为其他模型开发者提供了可参考的实现方案。此后,IBM Granite、Anthropic、Mistral AI 等厂商也陆续推出了各自的推理大语言模型。
简而言之,推理 LLM 接受的训练是花更多的时间“思考”后再做出反应。经验表明,加入这种“推理过程”可以显著提高 LLM 在复杂推理任务上的性能。这一成功扩大了 AI 模型在现实世界中的用例和领域,标志着生成式 AI 和 AI 智能体的持续发展迎来了一个重要的转折点。
但需要注意的是,诸如模型“思考过程”这类拟人化表述,只是便于理解的说法,并非字面意义上的真实行为。与所有机器学习模型一样,推理模型归根结底只是运用复杂算法进行预测(例如预测下一个应当输出的词汇),其输出结果反映的是从训练数据中学到的各类模式。推理类大语言模型并未表现出意识,也未出现其他通用人工智能 (AGI) 的特征。在 NeurIPS 2025 上发表的一篇被广泛引用的苹果研究论文,对现有模型的推理能力能否扩展至真正具备“可泛化”推理提出了质疑。
或许最贴切的说法是:推理大语言模型经过训练,会通过生成一串词元(词语)来“展示推导过程”,输出内容模仿人类的思考流程。这种将思考“语言化”的行为,似乎能够激活模型的潜在推理能力;而这类能力,是大语言模型从海量训练语料中隐性习得的,训练语料内包含大量人类直接或间接阐述自身思考过程的实例。
获取有关最重要且最有趣的 AI 新闻的精选洞察分析。订阅我们的每周 Think 时事通讯。请参阅 IBM 隐私声明。
在模型输出中添加“思维过程”可以帮助模型避免有害的认知捷径,并揭示从训练数据中了解到的更多潜在相关知识,从而弥补标准 LLM 推理的许多固有缺陷。
在推理大语言模型的相关研究语境下,AI 学术文献经常引用“系统 1”与“系统 2”思维。这组概念由诺贝尔经济学奖得主、行为经济学家丹尼尔・卡尼曼在其经典著作《思考,快与慢》中提出。系统 1 思维快速、无意识且依靠直觉,依赖启发式经验,几乎不需要耗费认知精力。系统 2 思维缓慢、审慎且讲求逻辑,需要投入集中的认知努力。多项研究一致表明:自回归大语言模型在默认状态下,倾向于表现出系统 1 式思维。
对于部分任务,系统 1 思维既行之有效,又具备较高的计算效率。但在许多其他任务场景下,依靠直觉的系统 1 思维就会能力不足、难以胜任。例如,Meta 研究院研究员 Jason Weston 与 Sainbayar Sukhbaatar 在 2023 年的一篇论文中指出:输入提示词中如果存在无关上下文或主观细节,大语言模型很容易受到干扰。
他们提出了一类称为“System 2 Attention”(S2A) 的技术,其中指示模型首先生成输入提示的重写版本,其中去除了不相关的上下文,然后回答重写的提示。实验中,S2A 在各种任务中的表现都优于标准推理,提高了准确性并减少了阿谀奉承。
从概念上讲,推理方法的隐含目标可以理解为实现类似“系统 2”的模型行为,即深入了解、评估和改进其潜在输出。
现代“思考模型”的理论基础,由两篇早期大语言模型研究论文奠定:一篇为谷歌研究院 2021 年发布,另一篇由东京大学研究人员于 2022 年撰写。两篇论文均证实,仅仅加入“逐步思考”这一提示语句(该技术称为思维链提示),就能够大幅改善模型的输出效果。谷歌 DeepMind 在 2024 年的一篇论文提出了一项范围更广的论断,即全新缩放定律:扩大测试时算力(生成输出结果所消耗的资源)对模型性能带来的提升效果,与扩大训练时算力(训练模型所消耗的资源)相当。思维链提示 (CoT) 仅仅是众多推理缩放(也称为测试时缩放)技术中的一种,S2A 同样属于该类技术。
现代推理类大语言模型更进一步:它们不再依赖提示工程,而是采用新颖的微调技术和复杂的工作流,从内在层面提高模型在推理阶段所使用的计算量。推理模型的优化既包括开发算法和训练数据的技术挑战,也包括设计理想的“思考过程”的哲学挑战。
推理 LLM 训练的初始阶段与传统 LLM 训练相同。与标准 LLM 一样,推理模型从大规模自监督预训练中获得其一般语言设施和世界知识,然后进行一定量的监督微调 (SFT) 以适应下游任务(例如会话式聊天机器人的使用)。核心创新在于新型强化学习 (RL) 技术的应用,激励模型在推理时生成中间“推理步骤”,然后再产生最终输出。
经过多年的研究和实验,推理方法的数量呈指数级增长,但它们的共同基本目标都是提高测试时间计算能力。除了作为基础(或指令调整后的)LLM 之外,推理模型的区别在于它们接受训练采用的具体决策策略以及用于激励该行为的具体算法。
从广义上讲,有两种主要方法可以增加推理时使用的计算量。对推理模型进行微调的目的是通过各种学习算法对其进行训练,使其能够采用上述几种方法中的一种(或两种)。
产生推理模型的学习范式,其本质通常是在解法可验证的问题(如编码任务或数学问题)方面进行训练和评估。因此,用于评估推理模型性能的基准指标通常侧重于这些领域。在主观性较强的领域,如创意写作领域,对推理影响的研究要少得多。
推理 LLM 兴起的核心是基于 RL 的微调的进步,包括 LLM 环境中基于规则的 RL 和深度学习驱动型 RL(“深度 RL”)。监督学习和自监督学习需要明确定义的静态训练任务,而 RL 非常适合多步骤推理最有用的动态、开放式和复杂任务。
使用 RL 来微调 LLM,从而赋予其抽象特性,这种做法并非推理模型独有。例如,在聊天机器人设置中使用的 LLM 的标准训练管道如下:
推理 LLM 通常会经历相同的训练阶段,并(在某个时候)增加强化学习阶段,以灌输基于 CoT 的高效推理过程。要实现这一目标,需要定义推理过程的目标 — 获得“奖励”的具体模型行为,例如在最终输出前生成 CoT 推理痕迹,然后以奖励最大化的方式优化模型权重。
由于很难甚至不可能为像推理过程这样抽象复杂的任务设计一个明确的奖励函数,使其对所有复杂问题的解决都有效,因此这种奖励信号通常来自训练过程中使用的单独奖励模型。在 RLHF 中,这种奖励模型本身根据人类反馈进行训练,并学习预测人类对给定响应的偏好程度。
在推理模型的 RL 背景下,奖励信号可以分为 3 大类:结果奖励模型 (ORM)、过程奖励模型 (PRM) 和基于规则的奖励系统。
结果奖励模型 (ORM) 顾名思义,用于校验推理模型最终输出结果的正确性,并生成奖励信号,据此对模型权重进行优化。这表面类似于损失函数在监督学习中的作用,不过其机制通常更为复杂。
损失函数通常用于衡量模型输出与基本事实之间的逐个词元差异,而有效的 ORM 必须能够识别数学问题的正确答案,即使所呈现的答案与现有的基本事实答案大相径庭,鉴于长 CoT 输出的高变异性,这种情况经常发生。同样,大多数现实世界的编码问题都有多种解决方案:全面评估代码输出通常需要一个能够高效执行和验证代码片段有效性的数据管道。其他输出质量(例如,是否遵循规定的格式或指令)可以使用标准 LLM 作为验证器。
虽然 ORM 是一种相对简单且计算效率高的解决方案,但它们可能会奖励一些推理步骤存在缺陷但仍能得出最终正确答案的情况,从而导致模型学习到次优的推理过程。
过程奖励模型 (PRM) 对每个推理步骤进行评分和奖惩,而非仅关注最终答案的准确性。这种方式可以输出粒度更细的奖励信号,并实现后续精细化模型调优,最终得到推理过程更可靠、更具备可解释性的模型。
但 PRM 的训练与落地部署成本更高,也更为耗时。早期具备影响力的 PRM 方案,例如 OpenAI 的 PRM800K 数据集,几乎完全依赖人工标注人员完成繁重的数据标注工作。后续诸多研究方案(包括影响广泛的 Math‑Shepherd)实现了该流程的自动化:依据某一推理步骤最终导出正确答案的概率,来推断该推理步骤是否有效。
为了避免奖励模型的成本和复杂性,一些基于 RL 的微调方法在设计训练任务时简化了评估模型输出的行为。
例如,DeepSeek-R1 和 R1-Zero 技术方案会提示模型将最终答案输出在独立方框内,无需专门的奖励模型解析整条完整回复,即可完成答案正确性校验。另一类基于规则的奖励系统会激励特定微观行为,例如让模型在输出中周期性插入“wait(等等)”,以此促使模型进行更多推演探索与自我纠错。事实证明,使用这类微观行为能够优化最终输出;同等重要的是,该类行为的校验方式简单,实现成本低廉。
DeepSeek 在训练其开源 R1-Zero 实验推理模型时,首创了一种简单易懂且极具影响力的强化微调技术。
以 DeepSeek-V3 作为基础,DeepSeek 直接从预训练转变为极其简单的基于规则的强化学习方案:
令人惊讶的是,在没有任何明确指令的情况下,DeepSeek-R1-Zero 学会了生成复杂的思维链并采用推理策略,在数学和推理任务中表现出色。换句话说,该模型仅被赋予在输出最终答案之前“思考”并最大限度提高最终答案准确性的任务,它自然而然地探索并“发现”了最优推理模式。
实际上,这种精简的方法存在重大缺陷:正如技术论文所解释的那样:“DeepSeek-R1-Zero 遇到了无休止重复、可读性差和语言混合等挑战。”尽管如此,这种纯粹 RL 方法成为了更精细方法论的基础,产生了广受欢迎的 DeepSeek-R1 模型。
虽然大多数基于 CoT 的 RL 范式旨在优化单个模型输出的有效性,但其他方法会生成多个最终或中间输出,其目的是识别和激励最佳推理步骤。
诸多此类方法依赖于基于搜索的优化算法,例如束搜索、思维树或蒙特卡洛树搜索 (MCTS),以生成和深入了解多个推理路径。过程奖励模型 (PRM) 评估每个推理步骤的质量与有效性,随后将奖励信号沿着导向理想结果的推理路径进行迭代反向传播。通过优化模型权重以最大化预期奖励,能够提升模型选择最优推理路径的概率。这对于面临大量潜在决策选项,或需要进行详尽长期规划才能得出准确最终答案的推理任务尤为有效。
基于搜索的算法本质上侧重于中间步骤,而采用方法则优先考虑最终结果。基于采样的推理缩放最基础的实现为简单的 N 选优 (best‑of‑N) 算法:向模型重复输入同一提示词共 N 次,使用结果奖励模型 (ORM) 对每一份输出结果打分,选取 ORM 评分最高的结果作为模型的最终答案。
经典的基于采样算法——自一致性,也叫多数投票法,该算法无需依赖 ORM。每项任务都以思维链提示开始。从模型解码器采样生成多份回复,每份回复拥有各自独立的推理路径。将采样输出结果中出现频次最高的最终答案确定为最优答案。该方式有两种用途:既可作为测试时缩放策略,降低随机性与模型幻觉;也可为基于有监督微调 (SFT) 的方法生成高质量推理数据集。
思考模型所采用的搜索与采样类方法,主要缺点是会带来更高延迟,也就是更长的响应时间,同时引入额外计算开销。不过,卡内基梅隆大学的相关研究提出观点:采用搜索或采样类推理算法的小模型,相比传统使用的大模型,可以实现更优的性能‑效率权衡。
微调推理模型最直接的方法之一,就是在包含具有挑战性的输入提示和相应的基于 CoT 的输出的数据集上使用监督学习。
依靠人工编写样例、以传统方式“手工”构建训练数据集,需要耗费极高的时间与人力成本;而推理模型与推理缩放技术的普及,大幅降低了生成合格合成训练数据的难度。斯坦福大学与艾伦 AI 研究所开展的研究表明:仅使用 1000 组经过筛选的问题‑推理轨迹配对数据集对 Qwen2.5‑32B‑Instruct 模型做微调后,得到的 s1 模型在竞赛数学题任务上的表现超越了 OpenAI 的 o1‑preview。
知识蒸馏同样可用于让小模型模仿大推理模型的思考过程:直接使用大“教师模型”生成的输出样本,通过 SFT 对小模型进行训练。DeepSeek 采用知识蒸馏方案,以 DeepSeek‑R1 作为教师模型,得到了多尺寸版本、经过推理能力调优的 Qwen 与 Llama 系列模型。
还有一类方法,依靠模型“自我提升”机制,自举构建由提示词与对应长思维链输出组成的数据集。自教推理器 (STaR) 先给模型少量优质推理轨迹作为少样本示例,再让模型为大量样本问题生成答案与推导理由。随后,模型会根据最终得出正确答案的推理进行微调,并迭代重复该整套流程。强化自训练 (ReST) 采用相近的思路,对强化微调所使用的奖励信号(或称“策略”)开展微调。以上两种方法衍生出了大量后续变体算法。
尽管推理 LLM 有许多优势,但它们并非没有缺点。
Anthropic 在 2025 年 7 月发表的研究指出,这类过度思考问题并不仅仅关乎效率。其论文《测试时计算的逆缩放》探讨了推理过程变长反而造成性能下降的场景,揭示测试时计算量与模型准确率之间存在反向关系。尽管已有实证表明,提升测试时计算量通常可以改善模型效果,但该研究发现多种场景下:在输出最终答案前生成更多推理词元,反而会放大模型缺陷与对齐问题。这一结论对“推理越多,模型输出就一定越好”的假设提出了质疑。
前文提到的苹果相关研究表明,在一系列低复杂度任务中,标准模型的表现优于推理模型;在高复杂度任务中,两种模型类型都彻底失败。苹果相关研究发现,推理模型“无法针对规划类任务形成具备泛化能力的问题求解能力;一旦任务复杂度超过某个阈值,模型性能直接归零”。
尽管推理微调通常会在数学、代码这类逻辑领域的复杂任务上带来显著提升,但也会造成其他领域性能下滑。举例来说:基于 DeepSeek‑R1 做知识蒸馏微调后的 Llama‑3.1 与 Qwen2.5 版本,对比原始基座模型,在 ArenaHard、Alpaca‑Eval‑2 这两项主流评测基准上出现明显性能退化;这两项基准专门衡量模型处理高难度指令的推理能力。尽管如此,采用目标范围更广的推理技术(例如用于微调 IBM Granite 3.2 的思考偏好优化 (TPO)),能够显著提升模型的指令遵循能力(但对数学、代码任务性能无实质性改善)。
用户必须为模型在“思考”期间生成的所有词元付费(并等待),而这些思考词元会占用可用的上下文窗口。有些使用场景需要额外的时间和计算资源,但对另一些场景来说,这是一种资源浪费。然而,在逐个任务、逐个提示的基础上不断地从推理模型切换到“标准”模型是不切实际的。
自最早的推理模型发布以来,AI 行业在很大程度上采用了“混合推理模型”,这类模型的推理或思考的“推理强度”,即它们在最终输出前生成的推理词元数量,是可以调整的。
2025 年 2 月,IBM Granite 3.2 成为首个提供可开关“思考”模式的大语言模型,允许用户在需要时利用推理能力,不需要时则优先考虑效率。当月晚些时候,Anthropic 的 Claude 3.7 Sonnet 紧随其后,为 API 用户新增了细粒度控制模型“思考”时长的功能。谷歌随后推出类似功能,支持调节 Gemini 模型的思考预算;紧接着 OpenAI 也允许对 o1、o3 推理模型设置推理强度,可选档位为“低”、“中”、“高”。
自此之后,该方案基本已经成为行业标准。尽管部分主流大模型系列,仍会同时推出独立的推理版与非推理版模型;但大多数厂商直接发布原生具备推理能力的模型,允许用户自行关闭推理强度。
从表面上看,向用户揭示模型的思维链有助于准确理解大语言模型如何得出最终答案,从而提供比标准模型通常可能实现的更高的可解释性。但 Anthropic 的研究表明:推理模型输出的思考过程,未必等同于它的真实内在想法。在一系列专门设计的测试任务中,研究人员发现 Claude 3.7 Sonnet 与 DeepSeek‑R1 均无法忠实还原自身推理过程。例如,向模型提供正确答案的提示线索后,模型在叙述所谓推导逻辑时,几乎不会提及这些提示线索。
借助您的 AI 合作伙伴 Bob,加速软件交付,实现安全的意图感知型开发。
使用 IBM watsonx Orchestrate 轻松设计可扩展的 AI 助手和智能体,自动执行重复任务并简化复杂流程。
借助 IBM 业界领先的 AI 专业知识和解决方案组合,让 AI 在您的业务中发挥作用。