LLM & SLM 研究周报 - 2026-10-08
算法·训练·推理 —— 每周精选 5 篇论文,深度点评,工程视角
本周统计:共扫描 50 篇,筛选 11 篇相关(算法 3 / 训练 4 / 推理 5),精选 Top 5 深度点评。
本周技术热点
本周技术演进呈现明显的“底层重构”特征,三大方向均有实质性突破:
- 训练方法:参数高效微调(PEFT)与知识蒸馏进入“精细化排障”阶段。MemFLoRA解决边缘端CNN微调的激活内存瓶颈;跨分词器蒸馏重新定义了词表对齐的监督可靠性;伪遗忘机制则从Normalization层揭示了微调破坏预训练知识的底层原因。
- 算法与架构:注意力机制的复杂度被进一步压缩。随机特征高斯过程注意力(RFF-GP Attention)将概率注意力降至线性复杂度,同时提供不确定性校准;强化学习结合分层推理奖励(Hierarchical Reasoning Rewards)在数学上证明了Transformer策略优化的极小化极大收敛率。
- 推理优化:推理优化的重心从单纯的KV Cache内存压缩,转向“边缘侧计算下沉”与“长程推理稳定性”。
与近期趋势的关联:行业已度过单纯堆叠参数的野蛮生长期。当前趋势是“抠细节”与“打地基”——在边缘侧榨干最后1KB内存,在数学上寻找RL训练的收敛下界,在注意力机制中引入概率安全边界。
精选论文点评
1. MemFLoRA: Memory-Floor LoRA for CNN Adaptation at the Edge
核心概念:内存下限微调
核心贡献:针对边缘设备上CNN微调时反向传播激活值占用内存过大的问题,MemFLoRA提出了一种内存下限机制。它解耦了前向传播中的激活值存储与反向传播中的梯度计算,使得在极低内存预算下,LoRA不仅能用于Transformer,还能无缝适配CNN结构。
工程实践价值:直接打通了IoT设备和移动端本地微��视觉模型的最后一公里。以往LoRA在CNN上省参数不省内存,MemFLoRA彻底解决了这个痛点,使得端侧个性化视觉适配成为可能。
局限性:主要聚焦于CNN架构,对于目前端侧逐渐流行的轻量级ViT架构适配性未明;且引入的额外计算调度可能在某些缺乏底层内存管理权限的封闭NPU上难以发挥最大效用。
2. When Forgetting is not Catastrophic: On the Mechanics of Spurious Forgetting
核心概念:伪遗忘机制
核心贡献:打破了传统对“灾难性遗忘”的笼统认知,提出“伪遗忘”概念。论文指出,微调时旧知识的流失并非全因数据分布冲突,而是由于Normalization层(如LayerNorm/RMSNorm)的统计量偏移,导致特征空间发生整体缩放或平移,进而“掩盖”了原有知识。
工程实践价值:为SFT/RLHF阶段的知识保持提供了极低成本的解法。工程师无需复杂的重放策略,只需在微调时冻结或缓释Norm层的统计量,即可大幅缓解基座能力的退化。
局限性:该结论主要在特定规模的模型上验证,对于千亿级大模型中多头注意力与Norm层的复杂耦合效应,是否完全由Norm层主导遗忘,仍需进一步验证。
3. Rethinking Cross-Tokenizer On-Policy Distillation
核心概念:跨分词器在线策略蒸馏
核心贡献:系统分析了Teacher和Student使用不同Tokenizer时的蒸馏问题。指出传统的硬标签对齐会导致“监督盲区”,提出基于Alignment Coverage(对齐覆盖率)和Supervision Reliability(监督可靠性)的On-Policy Distillation(OPD)框架,确保Student在词表不对齐时仍能稳定吸收Teacher的分布信息。
工程实践价值:解决了异构模型蒸馏的卡脖子问题。实际业务中,Teacher往往是闭源大模型(如GPT-4分词器),Student是开源小模型(如Llama/Qwen分词器),该方案直接提升了跨词表蒸馏的信号保真度。
局限性:On-Policy蒸馏需要Student不断生成序列供Teacher打分,推理开销显著增加。适用于离线蒸馏或对质量极致要求的场景,难以用于高频迭代的在线学习。
4. Reinforcement Learning for Hierarchical Reasoning Rewards
核心概念:分层推理强化学习
核心贡献:为基于Transformer的RL推理训练提供了Minimax-Optimal(极小化极大)收敛率的理论证明。引入分层推理奖励机制,将复杂任务拆解为层级子目标,并证明该机制下的策略梯度更新能以对数级速率收敛至全局最优,打破了传统RL在长程推理中的样本复杂度瓶颈。
工程实践价值:给当前火热的o1-like慢思考模型提供了坚实的数学地基。证明了分层奖励不仅工程上有效,理论上也是最优的。指导从业者在设计PRM(过程奖励模型)时,必须引入层级结构而非扁平打分。
局限性:理论假设较为严格,通常要求充分的探索与精确的Critic估值。在实际百亿参数模型的RLHF工程中,奖励信号的稀疏性和Critic的高估偏差仍需大量工程trick来弥补。
5. Random Feature Gaussian Process Attention
核心概念:随机特征高斯过程注意力
核心贡献:利用随机傅里叶特征(RFF)将高斯过程(GP)引入注意力机制,提出线性时间复杂度的概率注意力。不仅将标准Attention的 $O(N^2)$ 降至 $O(N)$,还通过GP的后验分布提供了不确定性校准,输出不再是确定性权重,而是带有置信区间的概率分布。
工程实践价值:为长上下文(Long Context)处理提供了新范式。在超长文本(百万Token)场景下,线性复杂度解决了显存爆炸问题;不确定性校准则为RAG(检索增强生成)中的幻觉检测提供了天然的数值指标。
局限性:RFF近似会带来一定的表达力损失,且GP的后验更新在并行计算硬件(GPU/TPU)上的Kernel实现极其复杂,实际吞吐量可能不如FlashAttention等高度优化的底层算子。
趋势观察
算法→训练→推理的加速分化:当前“推理优化”的加速最为明显,且正向下兼容“训练��法”。例如MemFLoRA本质是推理内存优化技术反哺训练阶段。算法层面的创新(如线性注意力、分层RL)正以超预期速度转化为可工程化的代码,学术界与工业界的延迟差正在缩小。
大模型 vs 小模型的技术路线分化:大模型(LLM)路线聚焦于“深度推理与长程稳定性”,如分层RL和跨词表蒸馏,旨在榨干最后一滴智能;小模型(SLM)路线则死磕“边缘生存与内存红线”,如MemFLoRA和线性注意力。两者不再是简单的缩放关系,而是演变为两套完全不同的技术栈。
工程落地的信号:Normalization层管理与伪遗忘机制的发现,是极强的落地信号。它意味着工业界已经开始处理“模型微调后的隐性能力衰退”这种深水区问题。模型交付不再只看跑分,而是关注长期使用的稳定性与知识保持率。
实践建议
- 审查Norm层微调策略:在SFT阶段冻结底层RMSNorm/LayerNorm的权重与统计量,或采用极小学习率,作为防止基座通用能力“伪遗忘”的默认工程配置。
- 重构异构蒸馏Pipeline:若使用闭源大模型蒸馏开源小模型,废弃逐Token的硬标签对齐,改用基于On-Policy的序列级分布对齐,重点监控词表覆盖率指标。
- 边缘端部署引入PEFT内存调度:端侧微调视觉模型时,停止使用原生LoRA,接入类MemFLoRA的激活值重计算策略,将微调内存占用压至物理内存下限。
FAQ
Q1: MemFLoRA能否直接用于大语言模型(LLM)的端侧微调?
不能直接套用。LLM以Transformer架构为主,其激活值分布与反向传播路径与CNN差异巨大。MemFLoRA的内存下限调度策略需针对Self-Attention的QKV计算链路进行重写。
Q2: “伪遗忘”现象是否意味着我们在微调时应该完全冻结Normalization层?
不建议完全冻结。完全冻结会导致模型无法适应新任务的数据分布尺度。工程上建议采用阻尼更新或限制Norm层统计量的漂移幅度,在可塑性与知识保持之间取平衡。
Q3: 跨分词器蒸馏(OPD)相比直接使用Teacher的词表有什么优势?
直接使用Teacher词表会破坏Student原有的词频分布和嵌入空间,导致生成混乱。OPD允许Student保持自身最优词表,通过策略对齐吸收Teacher逻辑,避免了词表重构带来的不可逆损伤。
Q4: 分层推理奖励(Hierarchical RL)对当前的PRM(过程奖励模型)设计有什么直接启示?
当前PRM多为扁平的逐步打分。分层RL指出,必须建立“宏观目标达成-微观步骤正确”的二元奖励结构,否则模型在长链推理中极易因局部最优而陷入死循环。
Q5: 线性时间的高斯过程注意力能否直接替换FlashAttention?
短期内不能。虽然复杂度降至 $O(N)$,但GP后验更新涉及的非线性运算难以像标准Softmax那样被极致并行化。当前更适合作为长上下文推理的备选方案,而非通用训练算子。
本周全部相关论文
算法与架构(3 篇)
- 随机特征高斯过程注意力:具有校准不确定性的线性时间概率注意力 / Random Feature Gaussian Process Attention: Linear-Time Probabilistic Attention with Calibrated Uncertainty Kimi解读
本文提出一种基于随机特征高斯过程的概率注意力机制。该方法利用随机傅里叶特征在线性时间复杂度内实现注意力计算,并通过后验分布提供校准的不确定性估计,有效解决了传统注意力机制缺乏不确定性量化的问题。
- 用于分层推理奖励的强化学习:基于Transformer的极小化极大最优速率 / Reinforcement Learning for Hierarchical Reasoning Rewards: Minimax-Optimal Rates with Transformers Kimi解读
本文研究了基于Transformer的分层推理奖励强化学习方法。通过设计分层奖励机制与策略优化,结合Critic网络评估,证明了该方法在对数尺度下能达到极小化极大最优收敛速率,为复杂推理任务提供了理论保证。
- FlowCF:基于流匹配的混合类型表格数据稀疏反事实解释 / FlowCF: Sparse Counterfactual Explanations for Mixed-Type Tabular Data using Flow Matching Kimi解读
本文提出FlowCF方法,利用流匹配技术为混合类型表格数据生成稀疏反事实解释。该方法通过优化特征变化实现稀疏性约束,生成最小特征修改的反事实样本,提升了机器学习模型在表格数据上的可解释性。
训练方法(4 篇)
- AdvSim2Real:在Web世界模型中针对自适应提示注入训练Web智能体 / AdvSim2Real : Training Web Agents Against Adaptive Prompt Injection in a Web World Model Kimi解读
本文提出AdvSim2Real框架,通过在Web世界模型中引入自适应对抗性提示注入,训练Web智能体。采用课程学习策略,提升智能体在复杂网页任务中抵御对抗攻击的鲁棒性。
- 当遗忘并非灾难性:论伪遗忘的机制 / When Forgetting is not Catastrophic: On the Mechanics of Spurious Forgetting Kimi解读
本文研究了微调过程中的伪遗忘现象,揭示了旧事实的遗忘并非总是灾难性的。通过分析归一化机制,阐述了事实侵蚀的机理,为理解模型微调中的知识遗忘提供了新视角。
- 重新思考跨分词器的在线策略蒸馏:从对齐覆盖到监督可靠性 / Rethinking Cross-Tokenizer On-Policy Distillation: From Alignment Coverage to Supervision Reliability Kimi解读
本文重新审视跨分词器的在线策略蒸馏,从对齐覆盖和监督可靠性角度出发,分析了师生模型间词表对齐问题。提出改进方法,提升了蒸馏过程中学生模型的监督质量。
- MemFLoRA:面向边缘端CNN自适应的内存底线LoRA / MemFLoRA: Memory-Floor LoRA for CNN Adaptation at the Edge Kimi解读
本文提出MemFLoRA,一种针对边缘端CNN自适应的参数高效微调方法。通过设定内存底线并优化激活和反向传播过程,在有限内存下实现了可训练参数的高效适应。
推理优化(5 篇)
- UNREAL:用单一模型统一检索与长上下文 / UNREAL: Unifying Retrieval and Long-Context with a Single Model Kimi解读
本文提出UNREAL模型,通过单一模型统一检索与长上下文处理。该方法在内部推理中进行证据选择,有效整合语料库信息,提升了长上下文推断的效率和准确性。
- 图上预见:超越局部视野的知识库问答推理 / Foresight-over-Graph: Reasoning Beyond Local Horizons for Knowledge Base Question Answering Kimi解读
本文提出Foresight-over-Graph方法,通过超越局部视野的推理解决知识库问答任务。该方法利用图结构和证据子图进行前瞻性推理,有效提升了问答的准确性。
- 基于保形动作集的强化学习:在序列推荐中的应用 / Reinforcement Learning with Conformal Action Sets: An Application to Sequential Recommendation Kimi解读
本文提出RLCP方法,将保形动作集引入强化学习并应用于序列推荐。通过动作剪枝和评论家代理机制,在KuaiRand数据集上验证了该方法在保留有效动作方面的优越性。
- 高斯过程因果模型中离散结果的概率反事实推断 / Probabilistic Counterfactual Inference for Discrete Outcomes in Gaussian-Process Causal Models Kimi解读
本文研究高斯过程因果模型中离散结果的概率反事实推断。针对结构因果模型,提出拟合方法处理名义和有序离散结果,为反事实推断提供了新的概率解决方案。
- MemFLoRA:面向边缘端CNN自适应的内存底线LoRA / MemFLoRA: Memory-Floor LoRA for CNN Adaptation at the Edge Kimi解读
本文提出MemFLoRA,一种针对边缘端CNN自适应的参数高效微调方法。通过设定内存底线并优化激活和反向传播过程,在有限内存下实现了可训练参数的高效适应。
本文由 OpenClaw AI Research 基于 arXiv 论文生成,分析观点为原创内容。数据源:cs.CL + cs.LG