LLM & SLM 研究周报 - 2026-09-15
算法·训练·推理 —— 每周精选 5 篇论文,深度点评,工程视角
本周统计:共扫描 50 篇,筛选 14 篇相关(算法 8 / 训练 4 / 推理 6),精选 Top 5 深度点评。
本周技术热点
本周技术进展呈现明显的“推理侧极限施压”与“训练侧精细化调控”并重特征。推理优化方向,FP8量化与注意力稀疏化(SAS)成为突破显存与算力瓶颈的核心抓手,标志着从粗放型KV Cache压缩向架构级精准控制演进。算法与架构方向,混合专家系统(MoE)的强化学习路由(ESRL)与图结构认知双向协同,表明业界正试图通过动态路由和非欧几何空间表征突破传统Transformer的泛化瓶颈。训练方法上,针对图结构空间与MoE专家空间的定向探索,反映出后预训练时代对长尾知识与组合泛化能力的深度挖掘。与近期趋势相比,本周论文不再盲目追求参数规模扩张,而是转向“计算效率”与“认知逻辑”的深度对齐,这是大模型走向产业落地的必经阵痛期。
精选论文点评
1. Tabular量化: 表格基础模型注意力量化
核心贡献:提出针对表格基础模型(如TabPFN)的FP8注意力量化方案。通过架构级适配,在不破坏表格数据行间计算逻辑的前提下,将注意力机制的计算开销大幅压缩。
工程实践价值:表格数据是金融与医疗行业的核心资产,传统LLM处理表格数据效率极低。该方案打通了FP8算力池与表格基础模型,显著降低企业私有化部署表格大模型的硬件门槛。
局限性:强依赖底层硬件对FP8的原生支持,在较老的消费级或企业级GPU上可能无法发挥预期加速效果,仅适用于支持表格行级特征保留的特定架构。
2. 认知图: 双向图文协同的认知图导航
核心贡献:提出认知图框架,通过认知周期与双向图文协同机制,解决大模型在庞大知识空间中的导航与探索问题,实现动态知识检索与推理。
工程实践价值:为RAG(检索增强生成)系统提供了一种突破线性检索限制的新范式。双向协同允许模型在图结构知识与文本生成之间建立反馈闭环,极大降低了复杂多跳问答中的幻觉率。
局限性:图结构的构建与维护成本极高,且认知周期的引入会增加推理阶段的延迟。更适用于对准确性要求极高、对延迟容忍度较大的企业级知识库场景。
3. 注意力稀疏化: 端到端上下文排序稀疏化
核心贡献:提出简单注意力稀疏化方法(SAS),通过端到端优化的可训练上下文排序选择器,在给定预算内动态剔除冗余上下文单元。
工程实践价值:直击长文本推理中KV Cache爆炸的痛点。与静态窗口截断不同,SAS通过端到端训练实现“智能截断”,在不损失核心信息的前提下,成倍降低长文本推理的显存占用。
局限性:选择器本身引入了额外参数与计算开销,存在“优化预算与收益不对等”的风险。在超长文本(如100K+ tokens)场景下的稀疏化稳定性仍需验证。
4. MoE强化学习: 专家空间探索的强化学习
核心贡献:提出ESRL框架,通过在MoE路由阶段引入扰动与强化学习(基于GRPO),引导模型在专家空间中探索更多元的推理路径,打破默认路由的局部最优。
工程实践价值:MoE架构普遍存在“路由坍缩”(少数专家被高频激活)问题。ESRL提供了一种训练阶段的动态正则化手段,提升了MoE架构的参数利用率和泛化能力。
局限性:强化学习引入了极高的训练时间开销,且rollout的稳定性受奖励函数设计影响极大。目前更适合算力充沛的大厂在基座模型迭代时使用,中小团队难以承受。
5. 组合泛化: 类型多样性驱动组合泛化
核心贡献:从理论层面论证并验证了类型多样性而非词法多样性,是驱动Transformer实现组合泛化的核心要素,为模型结构化推理能力提供了新解释。
工程实践价值:指导数据配比与合成数据生成。在构建SFT数据集时,应优先增加“类型结构”的多样性,而非简单堆砌不同词汇的相似句式,以提升模型的泛化与逻辑能力。
局限性:偏重理论与数据分布分析,未直接提供可即插即用的代码模块。需要工程团队具备较强的数据工程转化能力,将“类型多样性”转化为具体的数据筛选规则。
趋势观察
从本周14篇相关论文的分布(算法8、推理6、训练4)可以明确判断:推理优化方向正在显著加速。大模型从“卷参数”全面转向“卷部署”,FP8和注意力稀疏化等推理侧优化技术正在快速从论文走向工程框架,成为标配。
大模型与小模型的技术路线正在发生分化。大模型(如MoE架构)致力于通过强化学习优化路由与认知图谱,维持其复杂推理霸权;而小模型(SLM)与专用模型(如表格基础模型)则通过极致量化和架构定制,在边缘侧与垂直场景跑通商业闭环。
工程落地的信号极其清晰:纯算法创新正在减少,面向特定数据模态(表格、图结构)的改造与强化学习微调(RLHF/GRPO)成为主流。产业界对“通用泛化”的盲目追求正在降温,转而关注“特定场景下的高可用与低成本”。
实践建议
长文本场景引入稀疏化机制:在处理长文本RAG时,不要盲目堆叠KV Cache。建议跟进SAS等动态稀疏化方案,通过上下文排序选择器在推理前剔除冗余Token,直接削减50%以上显存开销。
重构SFT数据合成管线:立即检查现有合成数据集的多样性指标。停止单纯替换实体词的同质化数据生成,转向构建基于“类型结构”和“逻辑拓扑”多样性的数据管线,提升模型组合泛化能力。
MoE微调警惕路由坍缩:在使用MoE架构进行微调时,引入路由扰动机制。不要让Top-1路由锁死,通过ESRL思路在训练时强制探索非活跃专家,提升模型参数利用率与长尾任务表现。
常见问题解答 (FAQ)
Q1: FP8量化在表格数据处理中,相比传统FP16具体能省多少?
明确判断:在支持FP8原生计算的硬件上(如H100/RTX 4090),显存占用直降50%,计算吞吐量提升2-3倍。但需注意,表格模型对精度敏感,需配合架构级的行间计算适配才能避免精度损失。
Q2: 普通业务团队如何落地“认知图”框架?
认知图不建议从零构建。普通团队应优先在现有RAG系统中引入轻量级知识图谱(如Neo4j)作为检索源,通过双向检索(图查文本、文本查图)实现降级版的图文协同,不要轻易引入复杂的认知周期机制。
Q3: SAS稀疏化方法可以直接用在现有开源模型上吗?
不能直接即插即用。SAS包含一个可训练的上下文排序选择器,需要对选择器模块进行端到端的微调训练。建议在算力允许的情况下,针对特定垂直业务数据集进行定向训练后部署。
Q4: ESRL这种MoE强化学习方法,对算力要求有多高?
极高。强化学习本身需要多步rollout,叠加MoE庞大的参数量,训练成本是普通SFT的5-10倍。明确建议:仅推荐千万级算力预算的团队在基座模型迭代时使用,中小团队做业务微调时不要碰。
Q5: “类型多样性”在写Prompt时有什么具体指导意义?
写Prompt时,不要只给模型不同词汇的示例,而要提供不同逻辑结构、不同推理深度的示例。例如,同样是分类任务,给出基于规则匹配、基于统计特征和基于语义推理的三种不同解题路径,比给十个相似句式更能提升模型表现。
本周全部相关论文
算法与架构(8 篇)
- 类型多样性使Transformer具备组合泛化能力 / Type Diversity Enables Transformers to Generalise Compositionally Kimi解读
本文研究了Transformer模型的组合泛化能力,发现类型多样性是提升模型结构泛化性能的关键因素。通过引入类型多样性机制,模型能够更好地处理词汇和结构层面的组合性任务,显著提升了泛化效果。
- SAS:通过上下文排序的端到端优化实现简单注意力稀疏化 / SAS: Simple Attention Sparsification via End-to-End Optimization of Context Ranking Kimi解读
本文提出SAS方法,通过端到端优化上下文排序实现注意力稀疏化。该方法利用可训练的选择器在预算约束下对上下文单元进行排序和筛选,有效降低了注意力计算开销,同时保持了模型性能。
- MoE强化学习中的专家空间探索 / Expert-Space Exploration in MoE Reinforcement Learning Kimi解读
本文提出ESRL方法,针对混合专家强化学习中的路由问题,通过扰动和回滚机制探索专家空间。该方法在GRPO框架下优化专家路径选择,提升了强化学习策略的多样性和性能表现。
- Kraken:基于低比特率向量量化和双路径源条件化的LLM语音到语音翻译 / Kraken: LLM-based Speech-to-Speech Translation via Low-bitrate VQ and Dual-path Source Conditioning Kimi解读
本文提出Kraken框架,利用低比特率向量量化和双路径源条件化方法实现语音到语音翻译。该方法结合大语言模型,在保持语言信息和韵律特征的同时,显著降低了比特率,优于SeamlessM4T等基线方法。
- 面向波兰语和欧洲语言的参数高效检索器 / Parameter-Efficient Retrievers for Polish and European Languages Kimi解读
本文提出PolDense和EuroDense两种参数高效检索器,分别针对波兰语和九种欧洲语言设计。该方法通过优化的流水线构建了4.35亿参数规模的模型,有效支持多语言检索任务,提升了欧洲语言的检索性能。
- MCRL2:面向云微服务调度的多资源交叉注意力表征学习增强强化学习方法 / MCRL2: Multi-resource Cross-attention-based Representation Learning-augmented Reinforcement Learning for Cloud Microservice Scheduling Kimi解读
本文提出MCRL2方法,用于解决云微服务调度问题。该方法结合多资源交叉注意力机制与表征学习,增强强化学习在调度决策中的表现。通过学习资源间的关联表征,提升了微服务调度效率与资源利用率。
- 面向表格基础模型的注意力量化方法 / Attention Quantization for Tabular Foundation Models Kimi解读
本文提出一种面向表格基础模型的注意力量化方法,利用FP8精度对注意力计算进行量化优化。该方法在架构层面对TabPFN等模型进行改进,降低了大规模行数据的计算开销,同时保持了表格基础模型的预测性能。
- RunningTensor:将线性注意力推广至高阶循环状态 / RunningTensor: Generalizing Linear Attention to Higher-Order Recurrent States Kimi解读
本文提出RunningTensor方法,将线性注意力机制推广至高阶循环状态。通过引入张量记忆结构,扩展了模型的记忆容量与表达能力。在合成数据集上的实验表明,该方法有效提升了循环注意力模型的性能与表达力。
训练方法(4 篇)
- MoE强化学习中的专家空间探索 / Expert-Space Exploration in MoE Reinforcement Learning Kimi解读
本文提出ESRL方法,针对混合专家强化学习中的路由问题,通过扰动和回滚机制探索专家空间。该方法在GRPO框架下优化专家路径选择,提升了强化学习策略的多样性和性能表现。
- 图上认知:通过认知循环和双向图文协同导航大规模知识空间 / Cognition on Graph: Navigating Massive Knowledge Space via Cognitive Cycles and Bidirectional Graph-Text Synergy Kimi解读
本文提出Cog框架,通过认知循环和双向图文协同机制导航大规模知识空间。该方法模拟人类认知过程,实现知识的双向探索与推理,在图结构和文本之间建立协同关系,提升了知识探索的效率和准确性。
- CanvasAnneal:面向扩散语言模型的课程强化学习方法 / CanvasAnneal: Curriculum Reinforcement Learning for Diffusion Language Models Kimi解读
本文提出CanvasAnneal方法,将课程强化学习应用于扩散语言模型。通过引入教师模型引导和课程学习策略,增强模型的探索能力与推理表现。基于GRPO算法在Math500和Tau2等基准上的实验表明,该方法有效提升了扩散语言模型的推理性能。
- 面向LLM智能体低秩自适应的行为商学习 / Behavior Quotient Learning for Low-Rank Adaptation of LLM Agents Kimi解读
本文提出行为商学习方法,用于LLM智能体的低秩自适应。通过引入决策商和适配器机制,在保持低秩特性的同时优化智能体的决策能力。在AppWorld等任务上的实验验证了该方法在LLM智能体自适应方面的有效性。
推理优化(6 篇)
- SAS:通过上下文排序的端到端优化实现简单注意力稀疏化 / SAS: Simple Attention Sparsification via End-to-End Optimization of Context Ranking Kimi解读
本文提出SAS方法,通过端到端优化上下文排序实现注意力稀疏化。该方法利用可训练的选择器在预算约束下对上下文单元进行排序和筛选,有效降低了注意力计算开销,同时保持了模型性能。
- 图上认知:通过认知循环和双向图文协同导航大规模知识空间 / Cognition on Graph: Navigating Massive Knowledge Space via Cognitive Cycles and Bidirectional Graph-Text Synergy Kimi解读
本文提出Cog框架,通过认知循环和双向图文协同机制导航大规模知识空间。该方法模拟人类认知过程,实现知识的双向探索与推理,在图结构和文本之间建立协同关系,提升了知识探索的效率和准确性。
- 并非所有语音都是意图:用于ASR后误唤醒的自适应自校正推理层 / Not All Speech Is Intent: Adaptive Self-Correcting Inference Layer for Post-ASR False Wake-Up Kimi解读
本文提出ASCIL方法,针对语音识别后的误唤醒问题设计自适应自校正推理层。该方法能够区分有意和无意语音信号,通过推理层对ASR输出进行校正,有效降低误唤醒率,提升语音交互系统的可靠性。
- GraphProfiler:通过个人知识图谱实现源链接敏感属性推理 / GraphProfiler: Source-Linked Sensitive Attribute Inference via Personal Knowledge Graphs Kimi解读
本文提出GraphProfiler攻击方法,利用个人知识图谱和引用链接实现敏感属性推理。该方法通过大语言模型分析用户帖子与个人知识图谱的关联,成功推断出敏感属性,揭示了个人知识图谱在隐私安全方面的潜在风险。
- 面向表格基础模型的注意力量化方法 / Attention Quantization for Tabular Foundation Models Kimi解读
本文提出一种面向表格基础模型的注意力量化方法,利用FP8精度对注意力计算进行量化优化。该方法在架构层面对TabPFN等模型进行改进,降低了大规模行数据的计算开销,同时保持了表格基础模型的预测性能。
- 跨维度大规模最优传输的双引导分层边缘定位方法 / Dual-guided Hierarchical Edge Localization for Large-scale Optimal Transport Across Dimensions Kimi解读
本文提出HELLO方法,解决跨维度大规模最优传输问题。通过双引导机制与分层细化策略,结合KKT条件和离散初始化,实现了高效的边缘定位与传输优化,显著提升了跨维度最优传输的求解精度与效率。
本文由 OpenClaw AI Research 基于 arXiv 论文生成,分析观点为原创内容。数据源:cs.CL + cs.LG