7.1 连续时间网络:液体神经网络 LNN 与 CfC

1.换个起点:从离散到连续

3.5 节我们讲循环神经网络时,隐藏状态是一步一步更新的:ht=f(ht1,xt)h_t=f(h_{t-1},x_t),每来一个输入就更新一次。这种"离散时间"的视角很自然,但它有个别扭的地方——时间被强行切成了等间隔的小块,可现实世界的数据并不总是这么整齐。心电图信号采样不均匀、自动驾驶传感器按事件触发、对话里有的词停顿很久有的词连着蹦,这些场景下,"等间隔离散步"这个假设就显得生硬。

这一章我们换一个起点:把隐藏状态看作随时间连续演化的动力学系统,用一个微分方程(ODE)来描述它。沿着这条思路发展出来的一类网络,叫连续时间神经网络。其中最有代表性、也最出圈的一支,是 MIT CSAIL 的 Ramin Hasani、Daniela Rus 团队提出的液体神经网络(Liquid Neural Networks,LNN)。它在无人机控制、自动驾驶上表现出奇的好,而且内部的动力学可以被人"看懂",可解释性很强。

先说一句避免混淆:连续时间这一脉里有几个容易混的名字——LTC(Liquid Time-Constant,液体时间常数网络)是奠基工作,CfC(Closed-form Continuous-time)是它的闭式加速版,LNN 是大众和商业上对这一家族的统称,而 Liquid AI 公司把它们的产品线叫 Liquid Foundation Models(LFM)。这几个词后面会反复出现,你只要记住它们都指向同一套连续时间思路就行。

2.核心方程:LTC 的"液体"时间常数

LNN 的核心想法,是把神经元的演化写成一个带"可变时间常数"的 ODE。在 3.5 节那种固定步长的 RNN 里,每一"步"的时间跨度是固定的;而在连续时间模型里,我们关心的是隐藏状态 x(t)x(t) 随真实时间 tt 怎么变化。LTC 给出的方程长这样:

dx(t)dt=[1τ+f(x(t),I(t),t,θ)]x(t)+f(x(t),I(t),t,θ)A\frac{d\mathbf{x}(t)}{dt}=-\left[\frac{1}{\tau}+f(\mathbf{x}(t),\mathbf{I}(t),t,\theta)\right]\mathbf{x}(t)+f(\mathbf{x}(t),\mathbf{I}(t),t,\theta)\,A

符号挨个说。x(t)\mathbf{x}(t)tt 时刻的隐藏状态向量,I(t)\mathbf{I}(t)tt 时刻的输入,f(,θ)f(\cdot,\theta) 是一个神经网络(参数 θ\theta 要学),τ\tau 是一个基础时间常数,AA 是一个有界的偏置项。

这个方程看着吓人,其实它的物理画面特别直白。先看等号左边 dxdt\frac{d\mathbf{x}}{dt},就是状态随时间的变化率。右边两块,第一块 []x-[\cdots]\mathbf{x} 是个"衰减"项(拉状态往零走),第二块 fAf\cdot A 是个"驱动"项(把状态往 AA 推)。状态就在衰减和驱动之间找平衡。

关键在那个"液体"上。 普通的连续时间 RNN(比如早期的 CT-RNN)时间常数是固定的,而 LTC 让时间常数本身成了输入和状态的函数 τsys=τ1+τf(x,I,t,θ)\tau_{\text{sys}}=\frac{\tau}{1+\tau\,f(\mathbf{x},\mathbf{I},t,\theta)}——它随每个瞬间、每个输入动态变化,像液体一样没有固定形状,所以才叫"液体"。这个机制让网络能根据当前看到的内容自适应地调节"记忆多久、遗忘多快",这是它处理长序列和不规则采样时特别稳的根本原因。

3.CfC:用闭式把求解提速几个数量级

LTC 方程虽然漂亮,但有个工程上的大麻烦:它是个 ODE,要数值求解(用 Runge-Kutta 之类的求解器),训练时每一步都要反复调用求解器,慢得让人想放弃。Hasani 团队后来提出了 CfC(Closed-form Continuous-time Neural Models),用一个闭式近似把求解器干掉了,速度提升一到五个数量级,这才让 LNN 真正能训练到规模。

CfC 的做法是:先承认 LTC 的 ODE 解在每一小段时间内有个近似解析形式,然后直接把它写成 sigmoid 的组合。CfC 的更新公式长这样:

x(t)=σ ⁣(f(x,I;θf)t)g(x,I;θg)+[1σ(f(x,I;θf)t)]h(x,I;θh)\mathbf{x}(t)=\sigma\!\bigl(-f(\mathbf{x},\mathbf{I};\theta_f)\,t\bigr)\odot g(\mathbf{x},\mathbf{I};\theta_g)+\bigl[1-\sigma(-f(\mathbf{x},\mathbf{I};\theta_f)\,t)\bigr]\odot h(\mathbf{x},\mathbf{I};\theta_h)

这里 σ\sigma 是 sigmoid,f,g,hf,g,h 是三个小网络(参数 θf,θg,θh\theta_f,\theta_g,\theta_h),\odot 是逐元素乘。这个式子的直觉是:σ(ft)\sigma(-f\cdot t) 是一个随时间衰减的门,它在"上一步状态 gg 的贡献"和"当前输入 hh 的贡献"之间做插值。时间一长,门偏向 hh,状态被新输入刷新;时间短,门偏向 gg,状态保持惯性。

你仔细看会发现,CfC 这个形式长得和 GRU、LSTM 的门控更新(3.6 节)有几分神似——都是一个门在旧状态和新输入之间插值。差别在于 CfC 的门是从连续时间 ODE 严格推出来的,那个 ft-f\cdot t 里的 tt 是真实时间间隔,所以它能自然处理任意时间间隔的输入,而 LSTM/GRU 的门是离散的、默认等间隔。CfC 让 LNN 既有 ODE 的理论根基和灵活性,又有门控 RNN 的训练速度。

4.为什么 LNN 值得关注:三个实在的长处

光有漂亮的数学还不够,LNN 真正打动人的是它在实际任务上的表现。我给你三个最有说服力的理由。

第一,处理不规则采样和超长序列特别稳。 因为时间常数是"液体"的、模型本身是连续时间的,输入什么时候来、隔多久来,它都能自然应对,不像离散 RNN 那样假设等间隔。在医疗时序数据(病人不同时间点的体征)、事件相机(只在像素变化时触发)这些场景上,LNN 比传统 RNN 鲁棒得多。

第二,模型可以很小、很可解释。 最经典的一个案例:MIT 团队用一个只有 19 个神经元的 LNN 做自动驾驶的车道保持,在真实路况上稳稳开住,而且他们能把这 19 个神经元每一个"在关注道路的什么特征"都可视化出来——哪个神经元在看车道线、哪个在盯地平线,一目了然。这种"小而透明"的特性,在需要可解释性的安全关键场景(医疗、自动驾驶、航空)里格外值钱。

第三,对分布偏移和噪声鲁棒。 LNN 在训练分布之外的数据上表现退化得比 Transformer、LSTM 都慢,面对加噪、遮挡也更稳。这一点在无人机、机器人控制上被反复验证。

5.它在 2026 年的真实位置

讲完了优点,我也得给你一个诚实的现状判断,免得你高估了它。

到 2026 年中,纯 LNN/LTC/CfC 还没有成为云端大语言模型的骨干。 它的主战场是边缘设备、控制系统、时序信号这些领域——在那些地方,它的小巧、稳、可解释、能处理不规则输入这些特长正好发挥。MIT 团队创办的 Liquid AI 公司把它做成了一系列 Liquid Foundation Models(LFM),主打"1GB 以下的边缘大模型",在 CPU、手机、嵌入式设备上跑得又快又省,2025 年底发布的 LFM2 报告里覆盖了 350M 到 24B 的多种规格。

但如果你问"能不能拿纯 LNN 替掉 GPT 级别的云端骨干",答案是目前还不行。2026 年真实的大模型前沿,是 Transformer 和线性注意力/状态空间模型的混合(这些我们在 7.2 节专门讲),连续时间网络更多是作为灵感和组件渗透进去,而不是独占整个骨干。这一点我希望你心里有数:LNN 是一条美丽且实用的支流,但还不是主干。

6.练习

Q1. LTC 方程里那个"液体时间常数"是什么意思,它和普通 RNN 的固定时间常数有什么本质区别?

液体时间常数 τsys=τ1+τf(x,I,t,θ)\tau_{\text{sys}}=\frac{\tau}{1+\tau f(\mathbf{x},\mathbf{I},t,\theta)} 本身是输入和状态的函数,会随每个瞬间动态变化;而普通 RNN 的时间常数是固定的。这让 LTC 能根据当前内容自适应调节记忆与遗忘的快慢。

Q2. CfC 为什么比 LTC 快得多?它牺牲了什么?

LTC 要用数值求解器(如 Runge-Kutta)一步步解 ODE,每步多次调用网络,极慢。CfC 用一个闭式 sigmoid 近似直接给出每段时间的解,省掉了求解器,提速一到五个数量级。代价是它是对原 ODE 的近似,理论上不如求解器精确,但实验表明精度损失可忽略。

Q3. 为什么说 LNN 能自然处理不规则采样的输入,而离散 RNN 不行?

LNN 是连续时间模型,更新公式里的 tt 是真实时间间隔,输入什么时候来、隔多久来都能代入;离散 RNN 假设等间隔步长,遇到不规则采样需要额外插值或重采样。

Q4.(大厂面试题) CfC 的更新公式 x=σ(ft)g+[1σ(ft)]h\mathbf{x}=\sigma(-ft)\odot g+[1-\sigma(-ft)]\odot h 和 LSTM/GRU 的门控更新有什么联系和区别?

形式上都是"一个门在旧状态 gg 和新输入 hh 之间做插值",门 σ(ft)\sigma(-ft) 类似 LSTM 的遗忘门/输入门。区别:(1) CfC 的门含真实时间间隔 tt,天然支持连续/不规则时间;LSTM 的门是离散的、不含时间量。(2) CfC 是从连续时间 ODE 严格推导出的闭式,有动力学根基;LSTM 的门是直接设计的数据驱动结构。

7.小结

这一章我们从"把时间从离散变成连续"这个起点出发,走过了 LTC 的液体时间常数方程、CfC 的闭式加速、LNN 的三大长处和它在 2026 年的真实定位。记住一句话:LNN 是一条美丽且实用的支流,小巧、稳、可解释、能处理不规则时间,但 2026 年的云端骨干还不是它。下一篇我们去看 2026 年真正占据主流的那条河——线性注意力与高效循环。

下一章见。

相关标签
深度学习前沿架构连续时间网络LNN