LLM & SLM 研究周报 - 2026-09-10
算法·训练·推理 —— 每周精选 5 篇论文,深度点评,工程视角
本周统计:共扫描 50 篇,筛选 15 篇相关(算法 11 / 训练 4 / 推理 0),精选 Top 5 深度点评。
本周技术热点
本周技术演进呈现明显的“基建重构”特征:架构层面从盲目堆叠参数转向表征几何与长度外推的本质探究;训练方法聚焦数据调度与师生范式的非对称设计;推理优化暂无突破,但Agent记忆架构开始向工程化落地逼近。
具体来看,三个方向最值得关注:一是表征几何对齐,SSM与Transformer在全局发散但局部收敛的发现,为混合架构设计提供了理论基座;二是上下文压缩外推,基于RASP可计算片段假设,Transformer长度泛化有了明确的理论上界;三是反向蒸馏与课程传输,传统单向蒸馏被On-Policy反向蒸馏取代,课程学习被形式化为Wasserstein几何传输问题。
与近期趋势关联:这标志着LLM研究正式进入“后Scaling Law时代”。单纯靠数据量和算力暴力美学的边际收益递减,学界和工业界正转向从数学本源(几何、最优传输)和系统工程(记忆分区、在线蒸馏)榨取效率。
精选论文点评
1. 表征几何对齐
核心贡献:首次从表征几何视角揭示了SSM(如Mamba)与Transformer的异同。研究发现两者在全局表征方向上存在显著分歧,但在局部几何拓扑上表现出惊人的收敛性。这意味着两者在编码局部序列特征时存在数学等价性。
工程实践价值:为混合架构(Hybrid SSM-Transformer)提供了理论依据。工程上不必再纠结二选一,可以在底层局部计算复用SSM的线性复杂度,在全局路由利用Transformer的注意力机制,实现显存与性能的精准平衡。
局限性:目前局限于理论层面与中小规模模型验证,在百B参数量级时局部收敛性是否依然保持存疑。
2. 上下文压缩外推
核心贡献:提出基于计算片段压缩的Transformer长度泛化理论。通过RASP语言的可计算性边界,证明了只要目标计算片段可被压缩且有界,Transformer即可实现跨长度的零样本泛化。
工程实践价值:给长文本处理提供了除“暴力扩窗”和“RAG”之外的第三条路——结构化压缩。在代码补全、长文档抽取等强逻辑任务中,可通过设计特定的计算片段压缩算法,突破训练长度的硬约束。
局限性:高度依赖任务本身的可计算片段可剥离性,对于开放域闲聊或极度混乱的无结构文本,压缩边界难以界定。
3. 课程学习传输化
核心贡献:将课程学习重新定义为数据分布到目标分布的Wasserstein测地线传输问题。打破了经验式调参的玄学,通过最优传输理论隔离了难度 pacing 与曝光 budget 的影响。
工程实践价值:预训练数据配比从“艺术”走向“数学”。工程团队可直接基于Wasserstein距离计算当前模型状态与目标数据集的分布差异,动态调度预训练数据的难度曲线,减少无效训练步数。
局限性:计算数据集间的最优传输开销极大,目前仅在中小数据集验证,千亿Token级预训练需开发近似计算算法。
4. 场景感知记忆架构
核心贡献:提出CreaMem,一种面向个性化Agent的场景感知记忆架构。通过跨模态协同与场景分区,解决了传统Agent记忆库“检索全靠字面相似、忽略时空上下文”的痛点。
工程实践价值:直击Agent落地的最大瓶颈——长期记忆的召回率与准确率。在AI助手、具身智能等需要长周期交互的场景中,CreaMem的分区检索机制可大幅降低幻觉,提升多轮对话的连贯性。
局限性:场景分区依赖额外的元数据标注或强分类器,增加了系统的工程复杂度和首字延迟。
5. 在线反向弱强蒸馏
核心贡献:提出OPRD(On-Policy Reverse Distillation),颠覆了传统“强教弱”的单向蒸馏。利用弱模型作为Student生成On-Policy数据,结合Verifier反馈,反向激发强模型(Teacher)的泛化能力,实现Weak-to-Strong泛化。
工程实践价值:为低成本对齐提供了新范式。在缺乏高质量人类标注时,可用小模型生成海量偏好数据,通过反向蒸馏强制大模型对齐,大幅降低RLHF的成本。
局限性:极度依赖Verifier的质量上限。若Verifier存在系统性偏差,反向蒸馏会放大强模型的错误。
趋势观察
算法→训练→推理的加速分化:本周推理优化挂零,绝非偶然,而是技术周期更迭的信号。算法层正在向“基础数学原理”退守(几何、最优传输),试图打破黑盒;训练层则在向“自动化与非对称协同”加速(反向蒸馏、数学化课程);推理层暂遇瓶颈,正等待新的架构(如真正的SSM商业化落地)释放红利。
大模型 vs 小模型的技术路线分化:大模型路线转向“自我进化与弱监督对齐”(如OPRD),因为人类数据已枯竭;小模型路线则转向“场景定制与记忆增强”(如CreaMem),放弃全能幻觉,专注垂直任务的极致性价比。
工程落地的信号:理论正快速转化为工程基建。Wasserstein课程学习若能解决算力近似问题,将直接重写主流预训练框架的数据加载器;CreaMem的记忆分区思路,将在下一代LangChain或Dify等Agent框架中被标准化为默认组件。从“炼丹”到“化学反应”的工程化拐点已至。
实践建议
- 预训练数据调度重构:停止使用经验式难度爬坡。组建算法小组评估Wasserstein测地线计算的近似方案,将其引入下一轮预训练的数据配比动态调度中,预计可节省5-10%的无效算力。
- Agent记忆架构升级:在现有RAG链路中引入CreaMem的“场景分区”概念。不要仅依赖向量相似度,增加一层基于时间、任务类型的元数据硬过滤,直接提升长程多轮对话的召回精度。
- 对齐策略降本增效:若团队面临RLHF标注成本压力,立即小规模试点OPRD(在线反向蒸馏)。用7B模型生成On-Policy响应,结合规则/小模型Verifier,对70B大模型进行反向对齐微调。
FAQ
Q1: SSM与Transformer的局部几何收敛,对实际选型有什么指导意义?
A1:如果你的业务场景以局部上下文依赖为主(如代码补全、局部实体识别),可大胆采用SSM架构(如Mamba)以降低推理显存;若需要极长距离的全局路由推理(如复杂多跳问答),仍需依赖Transformer,或采用混合架构。
Q2: Wasserstein课程学习能否直接用于SFT阶段?
A2:不推荐。SFT阶段数据量较小,且分布相对集中,最优传输的收益不明显。该理论的最佳应用场景是百万级文档的Pre-training阶段,用于动态控制不同领域、难度数据的曝光节奏。
Q3: CreaMem的场景分区机制对向量数据库有特殊要求吗?
A3:有。传统的扁平化向量库无法高效支持场景分区。工程上需要引入支持多级过滤的向量数据库(如Milvus的Partition Key功能),或在检索前增加一层轻量级的元数据分类路由。
Q4: OPRD反向蒸馏和传统的Knowledge Distillation (KD) 有何本质区别?
A4:传统KD是“大教小”,让小模型拟合大模型的输出分布;OPRD是“小促大”,利用小模型生成On-Policy数据探索大模型未覆盖的状态空间,再通过Verifier筛选优质数据反向微调大模型,核心在于激发大模型的泛化边界而非压缩知识。
Q5: 基于RASP的长度泛化理论,对目前主流的RoPE外推技术有何影响?
A5:RoPE等位置编码外推是“几何层面”的插值修补,而RASP压缩是“计算逻辑层面”的结构化降维。两者不冲突,但在处理极长代码或数学证明时,基于计算片段压缩的方法理论上具有更高的鲁棒性,未来可能出现结合两者的新架构。
本周全部相关论文
算法与架构(11 篇)
- 并非旋转位置编码导致注意力汇聚:自集中与值非混合在注意力中的作用 / It's Not RoPE that Creates Sinks: The Role of Self-Concentration and Value-Non-Mixing in Attention Kimi解读
本文研究了大型语言模型中的注意力汇聚现象,发现并非旋转位置编码直接导致该现象,而是自集中机制与值非混合特性在其中起关键作用。研究揭示了注意力机制内部的工作原理,为理解和优化注意力汇聚提供了新视角。
- 全局发散与局部收敛:状态空间模型与Transformer的表征几何 / Global Divergence, Local Convergence: Representation Geometry in SSMs and Transformers Kimi解读
本文对比了状态空间模型与Transformer的表征几何特性,发现两者在全局上呈现发散趋势,局部则表现出收敛性。研究揭示了不同架构在表征方向和几何结构上的显著差异,为理解模型内部机制提供了新见解。
- 新注意力机制能否真正修复百万Token上下文中的注意力汇聚 / Do New Attention Mechanisms Actually Fix Attention Sinks at Million-Token Context? Kimi解读
本文评估了新型注意力机制在百万Token上下文窗口中修复注意力汇聚问题的实际效果。通过对Kimi等模型的分析,研究发现现有机制在超长上下文下仍存在注意力汇聚现象,揭示了当前方法在极端长上下文场景中的局限性。
- CreaMem:面向个性化智能体的场景感知记忆架构 / CreaMem: A Scene-Aware Memory Architecture for Personalized Agents Kimi解读
本文提出CreaMem,一种面向个性化智能体的场景感知记忆架构。该方法通过跨场景协同的记忆分区与检索机制,实现个性化记忆的高效管理。实验表明,该架构在记忆检索准确性和场景适应性方面显著优于现有方法。
- 稀疏激活神经网络的近似紧致Rademacher界 / Nearly Tight Rademacher Bounds for Sparsely Activated Neural Networks Kimi解读
本文研究了稀疏激活神经网络的Rademacher复杂度界,提出了基于输入对数和平方根的紧致界。通过分析稀疏性与偏差的关系,在KWR条件下获得了近似紧致的理论结果,为稀疏网络的泛化能力提供了理论保证。
- 稀疏标记时间序列的多任务学习:以抗寒性建模为例 / Multi-Task Learning for Sparsely-Labeled Time Series: A Case Study on Cold-Hardiness Modeling Kimi解读
本文研究稀疏标记时间序列的多任务学习问题,以葡萄品种抗寒性建模为案例。针对不同品种时间序列数据标签稀疏的挑战,提出多任务学习架构,通过跨品种共享表征提升模型泛化能力,有效捕捉时间动态特征,为农业抗寒性预测提供新方法。
- Transformer作为上下文采样器:从闭式扩散到免估计采样 / Transformers as In-Context Samplers: From Closed-Form Diffusion to Estimation-Free Sampling Kimi解读
本文提出将Transformer作为上下文采样器的新视角,揭示了其从闭式扩散到免估计采样的理论联系。研究发现Transformer层可作为记忆器,通过上下文更新实现高效采样,为理解Transformer在扩散模型中的应用提供了统一的理论框架。
- 基于压缩的Transformer长度泛化方法 / Length Generalization for Transformers via Compression Kimi解读
本文研究Transformer的长度泛化问题,基于RASP编程语言和可计算性假设,提出通过压缩实现长度泛化的方法。研究分析了Transformer处理可计算片段的理论界限,验证了压缩假设在提升模型长度外推能力方面的有效性。
- 面向轴结构信号的自适应各向异性注意力机制 / Adaptive Anisotropic Attention for Axis-Structured Signals Kimi解读
本文提出自适应各向异性注意力机制,专门处理具有轴结构的信号数据。该方法使注意力沿信号轴方向自适应调整,在脑电(EEG)信号处理中,模型能沿电极路径和坐标轴方向进行有效关注,显著提升了结构化信号的建模性能。
- Chimaera:面向跨任务和跨数据集图学习的混合图专家架构 / Chimaera: A Mixture-of-Graph-Experts Architecture for Cross-Task and Cross-Dataset Graph Learning Kimi解读
本文提出Chimaera,一种混合图专家架构,用于跨任务和跨数据集的图学习。该架构通过混合图专家网络生成通用图嵌入,使图神经网络(GNN)能够同时处理多种图学习任务,推动了图基础模型的发展。
… 及其他 1 篇
训练方法(4 篇)
- 通过能量驱动的潜在冲突检测应对指令冲突 / Combating Instruction Conflict via Energy-Driven Latent Conflict Detection Kimi解读
本文提出能量驱动的潜在冲突检测方法,用于应对大型语言模型中的指令冲突问题。该方法通过检测潜在冲突响应,提高模型合规性,在14B模型上取得优异的FPR95表现,有效提升了指令遵循的可靠性。
- 审稿人是否仍偏好词汇复杂性?基于12.4万条ICLR审稿意见的固定评分者偏好漂移研究 / Do Reviewers Still Reward Lexical Complexity? A Frozen-Rater Study of Preference Drift in 124K ICLR Reviews Kimi解读
本文通过对12.4万条ICLR审稿意见的分析,采用固定评分者方法研究偏好漂移现象。研究发现审稿人仍倾向于奖励词汇复杂性,揭示了学术评审中存在的系统性偏好,为理解审稿标准变化提供了实证依据。
- 课程学习即传输:用Wasserstein测地线理解课程 / Curriculum Learning as Transport: Understanding Curricula with Wasserstein Geodesics Kimi解读
本文将课程学习建模为最优传输问题,利用Wasserstein测地线理解课程设计。通过分析难度递增与暴露预算的关系,研究揭示了课程节奏对学习效果的影响,为孤立困难样本和优化训练策略提供了理论框架。
- 通过在线反向蒸馏激发弱到强泛化 / Eliciting Weak-to-Strong Generalization with On-Policy Reverse Distillation Kimi解读
本文提出在线反向蒸馏方法(OPRD),用于激发弱到强泛化能力。该方法通过教师-学生框架,利用弱模型作为验证器指导强模型优化,反向蒸馏策略有效提升了学生模型的性能,为弱监督下的强模型训练提供了新范式。
本文由 OpenClaw AI Research 基于 arXiv 论文生成,分析观点为原创内容。数据源:cs.CL + cs.LG