Research KB 登录

PPR-2606.29150 Paper

Flow Reasoning Models: Turning Flows Into Efficient Recurrent Reasoners

id
updated
type paper
title Flow Reasoning Models: Turning Flows Into Efficient Recurrent Reasoners
authors Alec Helbling, Andrey Bryutkin, Mauro Martino, Duen Horng Chau, Nima Dehmamy, Hendrik Strobelt
venue arXiv preprint (2026)
arxiv 2606.29150
tier 0
lifecycle EXTRACTED
epistemic n/a
ingested 2026-09-10
version arXiv:2606.29150v3
source-hash sha256:b670af3b30fc93374a91d274da84247095237f3903d054fd540ad2214a59ba1c
admitted-under U0-user-directive
admission-note 用户指令性准入(2026-09-10,D18 U0):用户指定按 P1 入库。主题为离散结构化推理的连续流模型(Flow Reasoning Models),与库内既有自动驾驶规划谱系无引用边;注意其缩写 FRM 与本库形式化卡前缀 FRM- 无关联。

定位

Helbling、Bryutkin、Martino、Chau、Dehmamy 与 Strobelt(arXiv 2026)提出 Flow Reasoning Models(FRM)。论文针对的问题是结构化推理:要做出并修订相互依赖的决策,最终得到一个全局一致的解。论文指出既有架构在此吃力:自回归模型按固定顺序依次提交 token,无法回头修订早先的决定;掩码扩散模型虽可并行预测多个 token,但同一步内更新的 token 在当前状态条件下相互独立,不能条件于彼此已实现的值,因此激进的并行更新容易产生不一致,强约束问题需要很多保守更新、纠错还需 remasking 之类的额外机制。

FRM 的做法是:把离散结构化输出上的连续流模型(continuous flow over discrete structured outputs)自条件(self-conditioning)于自身过往输出 ,从而把一次性去噪(one-shot denoising)变成迭代式解细化。这让模型能并行地做出并修订决策,在解内部协调相互依赖的选择。论文报告一个朴素的连续流应用在 Sudoku-Extreme 只解出约 13%,仅加自条件可升到约 33%,但仍留下大量未解——原因是常规自条件在递归深度增大时因曝光偏差(exposure bias) 而不可靠:训练用的是一步预测产生的条件状态,推断时喂回的却是递归生成的状态,两者的状态分布不匹配。论文据此提出 Fixed-Point Forcing(FPF):用模型自身推断动力学生成的状态来训练,同时保留标准 flow-matching 目标。

方法(机制要点)

  • 条件生成设定:把推理写成在数据对 \((c,y)\) 上的条件生成;\(c\) 是问题规格(如数独给好的线索、迷宫布局),\(y=(y_1,\dots,y_L)\) 是词表 \(\mathcal{V}\) 上离散的解。只对解加噪与生成\(c\) 作为独立条件输入在训练与推断中保持固定。\(y\) 编成 one-hot 端点 \(x_1\),预测按位置 argmax 解码。
  • 离散流与速度:这里的 “离散”指被建模的数据域(输出 \(y\) 是有限词表上的 token 序列),不是时间或状态:流时间 \(t\in[0,1]\) 连续,噪声 \(\varepsilon\sim\mathcal{N}(0,I)\) 为连续高斯,插值状态 \(x_t=(1-t)\varepsilon+t x_1\) 落在 \(\mathbb{R}^{L\times|\mathcal V|}\) 亦连续,整条路径上只有端点 \(x_1\) 是离散的(one-hot,取值于 \(\{0,1\}^{L\times|\mathcal V|}\))。论文取的是“连续路径编码离散数据”这一支(引 analog bits),而非把流定义在单纯形上的 discrete flow matching / Dirichlet flow matching 那一支。具体用线性插值 \(x_t=(1-t)\varepsilon+t x_1\)\(t\in[0,1]\))连接噪声与端点;采用分类“干净预测”参数化——去噪器 \(D_\theta^t(x_t\mid c)\) 预测每个位置干净 token 的分类分布,由干净端点预测导出概率流速度 \(v_\theta^t(x_t\mid c)=(D_\theta^t(x_t\mid c)-x_t)/(1-t)\),同一个输出既是可直接解码的候选解、又是推进流状态的量;以逐 token 交叉熵训练。这一标准离散流模型是论文的 FLM 基线
  • 自条件即递归推理\(D_\theta^t(x_t\mid c,s)\)\(s\) 携带上一次的干净解预测,\(s=\varnothing\) 表示零值空携带。常规训练两趟:空携带趟产生分离(detached) 的预测,监督趟接收它或空携带,梯度不穿过它。推断时反复把最新干净预测经 \(s\) 喂回:\(s_t^{(0)}=\varnothing\)\(s_t^{(k+1)}=D_\theta^t(x_t\mid c,s_t^{(k)})\)。这引入了与连续流时间 \(t\) 不同的离散推理深度 \(k\);每次更新都有直接监督,故可分离训练、无需沿时间反传。采样器可在推进流状态 \(x_t\) 与在当前流时间多做几次递归更新之间交替。
  • 动力系统视角:固定 \((x_t,c,t)\),重复施加 \(D_\theta^t\) 是对自条件状态做不动点迭代。对问题 \(c\) 与目标解 \(y^\star\),期望行为是 \(s_t^{(k)}\to s_t^\star\)\(D_\theta^t(x_t\mid c,s_t^\star)=s_t^\star\)、且 \(s_t^\star\) 解出 \(y^\star\)有用的解应当是吸引子(不完美的邻近状态在更多推理深度下朝它移动),而解出错误解的稳定状态是伪吸引子。常规自条件在困难问题上反而收敛到“自信地错误”的不动点。
  • FPF:把常规自条件的“一趟携带”换成由模型自身多步推断动力学(rollout)产生的分离携带——训练时从 \(t_{\text{start}}\sim U(0,t)\) 起构造 rollout、取其预测作为 carry(stopgrad),再在目标 \((x_t,t)\) 上用该 carry 训练去噪器;概率路径与端点损失不变。这样每次递归更新都在早期更新会产生的那类状态上受训,直接针对训练/推断状态分布不匹配。

实验结果(摘要)

  • 求解率(精确解率):Sudoku-Extreme 99.5%、Zebra 100.0%、Maze-Unique 99.9%。
  • 精度-算力:在 Sudoku-Extreme 上峰值精度高于所评估的掩码扩散与专用推理基线,且算力高效——以 44× 更少的推断 FLOPs 匹配次优方法的 98.7% 峰值求解率。
  • 动力诊断:FPF 下递归细化把预测推向真值,正确解收敛而不正确状态保持动力学活跃,收敛对正确性有强预测力(支撑吸引子图景)。
  • 数据集:Sudoku-Extreme(\(9\times9\) 困难数独,1,000 题子集)、Zebra(关系推理,约 150 万训练/10 万测试,3–6 间房属性)、Maze-Unique(\(30\times30\) 唯一解路径查找,1,000/1,000)。

与本库的关系

按用户指令(U0)以 P1 入库(Tier-0,仅来源卡)。论文主题属生成式建模属于生成式建模中“在离散数据上定义连续流”/递归推理方向,与库内自动驾驶规划谱系(G2DP 及其引导谱系)无引用边。术语注意:本文自造的缩写 FRM(Flow Reasoning Models)与本库形式化卡前缀 FRM- 无关联,阅读时勿混。

承重关系

  • provenance:v3 tarball sha256 b670af3b…4a59ba1c,缓存 cache/sources/2606.29150/(v1/v2/v3 均存在,本卡锁 v3)。