SLMs-Survey
宾州州立大学团队出品的 SLM 领域最全综述,被 ACM TIST 接收、KDD 2025 顶会演讲
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
宾州州立大学团队出品的 SLM 领域最全综述,被 ACM TIST 接收、KDD 2025 顶会演讲
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象这样一个场景:你在医院放射科工作,需要 AI 辅助分析 CT 影像。但患者的病历数据涉及高度隐私,严格的《健康保险携带和责任法案》(HIPAA)规定不允许将数据发送到云端 API。在律师事务所,律师需要 AI 帮助快速检索数万页卷宗,但客户机密信息同样不能离开本地。在工厂车间,操作员需要在没有稳定网络的环境下实时查询设备手册。这些场景的共同痛点是:你需要 AI 的能力,但你无法承受数据"离开设备"的风险。
小语言模型(Small Language Models,简称 SLM)正是为解决这类问题而生的技术路线。SLM 通常指参数量在 1 亿到 100 亿之间的语言模型(相比 GPT-4 等千亿参数级别的 LLM,"小"是相对概念),可以在消费级硬件甚至手机、移动设备上本地运行。宾夕法尼亚州立大学(Penn State)Suhang Wang 教授团队的博士生 Fali Wang 主导开发的 SLMs-Survey 仓库,正是目前该领域最系统、最全面的学术文献整理项目。
这个项目由宾州州立大学的研究团队创建,领军人物是 Fali Wang(博士候选人,师从 Suhang Wang 副教授)。Suhang Wang 是该校 College of IST(信息科学与技术学院)的终身教授,研究方向涵盖数据挖掘、图神经网络和可信 AI。该团队于 2024 年 11 月首次在 arXiv 发布 SLM 综述初版,此后持续更新,于 2025 年 8 月被 ACM TIST(ACM Transactions on Intelligent Systems and Technology) 正式接收。截至 2026 年初,该综述论文已被引用超过 510 次,成为 SLM 领域的基础参考文献。
团队还于 2025 年 5 月将 SLM 主题带上数据挖掘顶会 KDD 2025,与 Minhua Lin、Yao Liu 等合作者共同呈现了 "Small Language Models in the Era of LLMs: Architecture, Capabilities, and Trustworthiness" 的 Tutorial 报告,并在同年 10 月发布了关于 SLM 与 LLM 协作的扩展综述(arXiv:2510.13890),持续引领该领域的研究议程。
图1:SLM 领域结构总览图(来源:FairyFali/SLMs-Survey)
LLM(如 GPT-4、Claude、LLaMA)虽然能力强大,但其参数量(从 70B 到 540B 不等)带来了三个根本性限制:
SLM 的核心思路是在保持核心能力的前提下大幅压缩模型规模。以微软 Phi-4-Mini(3.8B 参数)、HuggingFace SmolLM3(3B 参数)为例,它们可以在 MacBook Pro 或中端 Android 手机上实现实时推理,延迟低至毫秒级,同时完全无需联网,数据始终保留在本地。
这不仅仅是"把大模型变小"那么简单。SLM 的训练和优化涉及一系列独特的技术挑战,SLMs-Survey 仓库对此做了非常细致的梳理。
图2:小型语言模型整体概览(来源:FairyFali/SLMs-Survey)
该仓库以 Markdown 表格的形式,系统整理了截至 2025 年的主流 SLM 模型。按时间线来看,主要经历了三个阶段:
第一阶段(2023-2024 年初):以 LLaMA 2(7B/13B/70B)、Qwen 1/1.5 系列为代表,各大厂商开始发布参数规模相对"较小"的模型,SLM 概念逐步成型。PhoneLM(0.5B/1.5B,2024.11)等工作开始明确关注移动端部署场景。
第二阶段(2024-2025 年):进入爆发期。Meta LLaMA 3.2(1B/3B)、Google Gemma 2(2.6B/9B)、Apple AFWM(0.6B)相继发布,SLM 的设备端推理从"理论上可行"变为"商业上可用"。HuggingFace 的 SmolLM2 系列(135M/360M/1.7B,2025.2)和 SmolLM3(3B,2025.7)更是在开源社区引发了广泛讨论。
第三阶段(2025 年至今):多模态 SLM 开始涌现,SLM 不仅处理文本,还开始支持视觉、语音等多模态输入。SLM 与 LLM 的协作机制(路由、融合、蒸馏)成为新的研究热点。
仓库整理了 SLM 领域的主要技术方向:
预训练(Pre-training):包括从头训练 SLM 的数据配比策略(高质量"教科书级"数据的重要性已被 Phi 系列验证)、架构选择(Transformer vs. Mamba 等状态空间模型)。
监督微调(SFT):让基础模型学会遵循人类指令,仓库记录了各主流模型的微调方法。
强化学习与对齐(RLHF/DPO):包括基于人类反馈的强化学习(RLHF)以及更高效的 DPO(Direct Preference Optimization)方法。
知识蒸馏(Knowledge Distillation):这是 SLM 研究的核心议题之一——如何让小模型从大模型中高效"蒸馏"知识。仓库详细记录了不同蒸馏策略(白盒蒸馏、黑盒蒸馏、数据蒸馏等)。
模型压缩:包括剪枝(Pruning)、量化(Quantization,INT4/INT8)等降低推理成本的关键技术。
推理增强:Flash Attention、推测解码(Speculative Decoding)、KV Cache 优化等让 SLM 在有限硬件上跑得更快的工程技巧。
该仓库特别关注 SLM 的**可信度(Trustworthiness)**维度,包括:
这些议题在 LLM 时代已被广泛讨论,但在 SLM 场景下(尤其是移动端部署时)有其独特的工程约束和安全考量。
图3:SLM 技术发展时间线(来源:FairyFali/SLMs-Survey)
对于 AI 爱好者而言,这个仓库的最大价值是系统性学习材料。你不需要懂代码,只需要:
仓库还提供了 KDD 2025 Tutorial 的幻灯片(PDF),以及 Amazon 内部的演讲材料,对于想深入了解 SLM 技术细节的读者来说是优质的补充材料。
对于 AI 开发者,这个仓库的价值在于提供 SLM 选型决策支持。表格中包含了每个模型的参数量、训练范式、应用领域、GitHub 链接和 HuggingFace 链接,可以快速对比不同模型的适用场景。例如:
仓库中的 Trustworthiness 章节对于需要做安全合规评估的开发者尤其有价值,可以直接引用其中的分析框架。
尽管 SLMs-Survey 仓库是目前最全面的 SLM 文献整理,但该项目也有其局限性:
信息滞后性:作为人工维护的论文列表,新发布的模型(如 2025 年后的最新工作)需要人工更新,存在一定的时间差。对于日新月异的 AI 领域,这一点尤为突出。
缺乏代码实践:仓库本身不包含可运行的模型代码或 Demo。对于希望"动手试试"的开发者,需要自行跳转到各模型的官方 GitHub 仓库或 HuggingFace 页面。这与其"综述文献库"的定位相符,但也意味着该仓库不能替代工程实践。
评测数据质量不一:各 SLM 的评测基准(BBH、MMLU、HumanEval 等)由各团队自行报告,存在评测条件不统一的问题。同一模型在不同硬件环境、不同推理框架下的实际性能可能与报告数值有显著差异。开发者在选型时需要结合自身硬件条件做实际测试。
从仓库的论文整理可以清晰看到几个趋势:
端侧 AI 的崛起:2024 年以前,SLM 的讨论主要集中在"学术可行性";2024 年以后,苹果、高通、联发科等硬件厂商开始在芯片层面集成 NPU(神经网络处理器),使得 SLM 的设备端推理从软件优化进入硬件加速时代。Apple Intelligence 中部分功能即基于设备端 SLM 实现。
开源生态的成熟:HuggingFace、Meta 等推动的开源 SLM 生态已相当成熟,开源模型在多项基准上逼近闭源 API 的质量,但部署成本仅为后者的零头。
SLM+LLM 协作范式:仓库 2025 年 10 月新增的扩展综述重点探讨了 SLM 与 LLM 的协作机制——用 SLM 做"守门人"(过滤简单请求)和"预处理器"(总结、压缩用户输入),将复杂任务转交给 LLM。这是一种兼顾成本与性能的混合推理架构,正在成为工业界的主流设计模式。
图4:SLM 发展完整时间线(来源:FairyFali/SLMs-Survey)
FairyFali/SLMs-Survey 不仅仅是一个论文列表,更是一部关于小语言模型的完整技术史和路线图。它由宾州州立大学的学术团队维护,已获 510+ 引用,被 ACM TIST 期刊正式接收,并登陆 KDD 2025 等顶会舞台。对于 AI 爱好者,它是理解 SLM 领域的最佳起点;对于开发者,它是 SLM 选型与落地的实用参考手册。随着端侧 AI 和隐私计算需求的持续增长,SLM 正在从"LLM 的简化版"演变为 AI 落地的主要载体——这个仓库,记录的正是这场深刻变革的每一个关键节点。