从文字到行动 / 13 OF 20

多想一会儿,真的能少错一点吗?

NLP、Agent与世界模型的20段故事
资料核查截止 2026年9月7日 · 正文约 1,699

设想图书馆要处理两份资料:甲需要10分钟,乙需要15分钟,两台机器可以同时工作;最后合并需要5分钟,必须等两份都完成。忽略切换耗时,最快多久结束?

有人把三个数相加,答30分钟。也有人画出时间线:两台同时启动,第15分钟两份都完成,再合并5分钟,答案是20分钟。

数字和条件都是自拟教学题。差别不在于谁写了更多字,而在于有没有区分“同时做”和“必须等”。让模型增加中间计算,能否帮助它保留这些关系?

中间步骤如何参与后面的答案

普通直接回答,可以让模型读完题后立即生成结果。另一种方法,在提示中提供含中间步骤的示范,让模型在类似问题上也先展开步骤,再输出结论。2022年Wei等人的研究系统展示了这种思维链提示,简称CoT,在若干推理任务中的效果。1

对于我们的题,一份可核对的解答会先明确甲乙可以并行,再计算两者全部完成的时刻,最后加上合并时间。写出“第15分钟两份完成”后,这段文字成为后续计算可以利用的上下文,降低最后一步还要同时处理所有原始条件的负担。

这解释了中间步骤可能有用的路径,却不是说显示出来的文字完整揭示了神经网络内部计算。读者能检查公开解答是否成立,不能据此认为自己看到了模型所有真实内部过程。

也不能将那项研究概括为“任何模型加一句请逐步思考都会更准”。结果依赖模型、任务、提示和评价方式。论文中的逐步示范,与今天各产品的内部推理机制更不能直接画等号。

让学生使用草稿纸,是提供一种计算条件。草稿纸本身没有负责把30偷偷改成20。

多写一遍,和真正检查不是一回事

设想一个错误解答写:“甲10分钟,乙15分钟,合并5分钟,所以总共30分钟。再次检查,10加15加5确实等于30。”

它检查了加法,没有检查并行条件。第二遍算得越认真,错误结论看起来越结实。

真正针对这道题的验证,要把候选答案放回约束:如果甲从第0到第10分钟,乙从第0到第15分钟,合并从第15到第20分钟,每个操作都符合条件;而合并不可能早于第15分钟开始,因此20也是这个设定下的下限。

这份验证同时提供可行安排和不能更早的理由。它不依赖一句“我确认过了”。如果题目改成只有一台机器,第一步并行不再合法,答案才变成30分钟。

2022年的自一致性研究采用另一种办法:为同一题采样多条推理路径,再看最终答案的一致性,而不是只选一条生成路径。2

设想几条路径分别画时间线、先算瓶颈、列开始结束时刻,都得到20,可以增加选择这个答案的依据。但若所有路径都忽略“两台”,它们也可能整齐地投票给30。多个输出共享模型与资料,错误未必独立。全体起立,也可能只是全体坐错了车。

训练时练推理,与回答时多计算要分开

前两种办法主要改变回答过程:同一个模型,提供中间步骤的条件,或者让它生成并比较更多候选。还有一种办法,在训练时就更有针对性地改善解题行为。

设想我们有大量条件清楚、答案可验证的任务。模型生成候选解答后,程序核对最终数值或运行提交的代码,用结果提供反馈,再更新模型参数。训练因此增加了成功解题行为的倾向。

2025年的DeepSeek-R1研究展示了强化学习用于推理的一条代表路线。需要区分R1-Zero与R1:前者探索在已预训练基础模型上直接开展相应强化学习,后者还包含冷启动数据和其他训练阶段。它们都不是从完全空白、没有语言预训练的状态开始。3

对于数学和程序任务,规则核对或测试有时能提供相对明确的反馈。对于“这篇散文感不感人”,不存在同样方便的标准答案按钮。训练方法能扩展多远,受到可用反馈的质量与范围约束。

还要防止记错功劳:模型经过训练变得更善于使用中间步骤,是参数变化;给它更长的本次计算预算,是使用条件变化。两者可以结合,但“等了十秒”本身并不能证明发生了新的训练。

时间花在哪儿,比等多久更重要

设想同一道图书馆题,有三个方案。一个立即回答;一个写很长的情境描述;一个建立时间线并检查约束。后两个都更慢,只有第三个增加了直接支持结论的操作。

所谓回答时增加计算,可以用于生成更长的候选过程、搜索不同路径、调用验证工具或比较结果。不同做法的成本与收益不同。即使某个任务平均受益,也不能保证每一道题单调改善。

如果前提缺失,例如“乙是否必须等甲”,再多内部推演也不能确定用户没有提供的规则。此时有效进展可能是指出条件差异,而不是继续在同一条假设上加盖三层推理阁楼。

这把我们与上一章的检索联系起来:有些错误需要更多已知条件下的计算,有些需要外部证据。它们可以合作,却不能相互冒充。找不到规章,不是再加几遍分钟数能解决的;时间线算错,也不是引用十个网站就会变对。

开篇的答案是:多计算有机会减少错误,前提是额外步骤帮助保留条件、探索方案或验证结果。真正有用的“多想”,应在答案背后增加可以检查的依据。

两台机器最早第20分钟完成工作。至于模型花了多久宣布这个结果,是另一张账单。

参考资料

  1. Chain-of-Thought Prompting Elicits Reasoning in Large Language Models,Jason Wei等,2022。论文
  2. Self-Consistency Improves Chain of Thought Reasoning in Language Models,Xuezhi Wang等,预印本2022,ICLR 2023。论文
  3. DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning,DeepSeek-AI,2025。论文