“4、9、10、13,只用加减乘除,怎么凑出24?”这个很多人小时候在数学课上玩过的24点游戏,看似不起眼,却成了2023年大模型推理研究里最经典的一道考题。人类玩24点时会试错、会调整、会从答案倒推;那GPT-4呢?论文在100道中等偏难的24点题里测了GPT-4,用当时最流行的思维链(Chain of Thought,简称CoT)提示,成功率只有4%。没看错,就是4%。一个四则运算小游戏,把地表最强模型按在地上摩擦。问题出在哪?论文给出的诊断很扎心:大模型的核心推理机制,本质上还是“自回归”——从左到右,一个token一个token地往外蹦。这种机制擅长续写,但不擅长规划。一旦前几步写歪了,后面再怎么努力也救不回来。这让人想起卡尼曼在《思考,快与慢》里提出的双过程理论:人类决策时有两套系统。System 1是快思考,自动、无意识、凭直觉秒回;System 2是慢思考,理性、费力、讲逻辑。大模型当前的推理方式特别像System 1——反应快,但缺少System 2那种“停下来多想几步”的能力。而System 2的“思考”到底是什么?早在1950年代,Newell、Shaw和Simon就给出过一个影响深远的答案:人类解题,本质是在一个组合问题空间里做搜索——把问题分解成节点,把可能的操作看成边,形成一棵搜索树,再用启发式规则决定先走哪条分支。一个是缺“慢思考”的大模型,一个是大半个世纪前的搜索理论。来自普林斯顿大学和谷歌DeepMind的研究团队把这两者缝合到了一起,提出了ToT框架(Tree of Thoughts,思维树)。ToT的核心想法非常朴素:既然大模型一条道走到黑不行,那就让它像人类一样,每一步多试几个思路,评估一下哪个更有希望,不行就回头换一条路。每个“思路”就是树上的一颗节点,问题求解变成一次树上的搜索。用大语言模型解决问题的多种方法示意图。每个矩形框代表一个“思维”,即一段连贯的语言序列,作为解题的中间步骤。图2、图4、图6展示了思维如何生成、评估和搜索的具体例子。ToT让大语言模型像人类一样“深思熟虑”——探索多条推理路径、自我评估、必要时回溯。
[1] Yao S, Yu D, Zhao J, et al. Tree of Thoughts: Deliberate Problem Solving with Large Language Models[C]. NeurIPS 2023. arXiv:2305.10601.[2] Wei J, Wang X, Schuurmans D, et al. Chain-of-Thought Prompting Elicits Reasoning in Large Language Models[C]. NeurIPS 2022.[3] Wang X, Wei J, Schuurmans D, et al. Self-Consistency Improves Chain of Thought Reasoning in Language Models[C]. ICLR 2023.[4] Newell A, Shaw J C, Simon H A. Report on a general problem-solving program[C]//IFIP Congress. 1959.[5] 开源代码:https://github.com/princeton-nlp/tree-of-thought-llm
融会贯通
ToT这篇论文的价值,远不止于把24点从4%干到74%。它真正开启了一个研究方向:把大模型从“文本生成器”变成“问题求解器”。在ToT之后,大模型推理研究迎来了一波“搜索+推理”的复兴。RAP(Reasoning via Planning)把MCTS引入推理,LATS(Language Agent Tree Search)把ToT和强化学习结合,Self-Refine让模型自己批判自己——这些工作或多或少都能在ToT里找到源头。从PaperDaily已收录的论文来看,当下大模型推理优化的主流思路——无论是过程奖励模型(PRM)、推理时计算扩展(inference-time compute scaling),还是o1系列的长思维链——本质上都在回答ToT提出的同一个问题:如何让模型在生成答案之前“多想几步”。ToT给的答案是显式的树搜索,后续工作则探索了更高效的隐式方案。必须提醒的是,这里对后续工作的归纳仅基于PaperDaily已收录论文范围内的观察,并非全领域绝对结论。ToT的局限在今天的模型上依然存在——成本、思维分解的人工设计、评估器的不完美——这些也是整个“慢思考”路线共同的开放问题。对于普通从业者来说,ToT最大的启示可能不是某个具体算法,而是一个思维方式的转变:当模型能力不够时,与其硬换更大模型,不如在推理策略上花心思——用搜索、评估和回溯换智能,往往更划算。