applied-ml
汇集 Airbnb、Netflix、Google 等科技公司 ML 生产实践经验的精选知识库
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
汇集 Airbnb、Netflix、Google 等科技公司 ML 生产实践经验的精选知识库
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象一下:你深夜调试一个推荐系统模型,翻遍论文却找不到 Netflix 实际生产环境的参数怎么调的,直到你点开了一个 GitHub 仓库,发现 Airbnb、Uber、Google、亚马逊的工程师们正毫无保留地分享他们踩过的坑、做过的实验、拿到的真实结果。这,就是 applied-ml。

图1:项目维护者 Eugene Yan,亚马逊首席应用科学家
机器学习领域从来不缺论文,但缺的是真实生产环境的经验。学术论文告诉你模型精度提升了 3%,却不会告诉你这条精度提升花了多少工程代价、在线服务延迟增加了多少、团队为此加班了多久。applied-ml 正是为了填补这个鸿沟而诞生的。
项目作者 Eugene Yan 是亚马逊推荐系统团队的前沿实践者,长期活跃于 ML 工程一线。他在 GitHub 上创建 applied-ml 的初衷很简单:与其自己踩坑,不如让全球 ML 工程师共享踩坑经验。从 2019 年开始维护至今,仓库已收录来自 Airbnb、Uber、Google、Netflix、LinkedIn、Stripe 等数十家科技公司的 300+ 篇生产级 ML 文章与论文。
applied-ml 本质上是一个结构化的机器学习生产实践知识库。它将内容按 ML 应用场景分类整理,而非按技术类型——这是它与普通论文合集最大的区别。
仓库包含 31 个主题分类,覆盖 ML 全生命周期:
每一篇收录的内容都附有公司来源和年份标注,便于溯源和时效性判断。
打个比方:如果普通 ML 论文集是餐厅的食材手册,那 applied-ml 就是厨师经验谈——告诉你这块肉要用猛火爆炒还是小火慢炖,背后是无数次失败换来的教训。
具体来说,它有三个显著特点:
1. 工业场景驱动,而非学术理论驱动。 收录内容以实际业务问题为出发点(如何提升 CTR、如何降低延迟、如何处理冷启动),而非以模型创新为出发点。
2. 失败经验同样重要。 仓库专门设有 Fails 板块,收录各大公司分享的失败案例——比如某推荐系统上线后用户留存反而下降的分析,这种坦诚的经验在学术界几乎看不到。
3. 持续更新,紧跟行业动态。 仓库由作者持续维护,每年都会补充新文章、新案例,追踪 LLM 应用、语义搜索等新趋势。
作为 AI 爱好者,你可以按场景找灵感:想做商品推荐?直接翻 Recommendation 章节,Netflix 和 YouTube 的实践经验足够你读上一周。
作为 AI 开发者,这个仓库更像一份行业对标清单。当你设计一个特征存储方案时,可以先看 Uber 的特征平台实践;当你头疼在线离线一致性时,Airbnb 的数据质量监控方案值得细读。
使用方式极其简单:直接浏览器打开 GitHub 页面,按目录检索即可。无需安装、无需配置、纯静态页面加载。
根据社区反馈和 star 增长,以下内容最受欢迎:
需要注意的是:
applied-ml 的走红反映了 ML 行业的一个深刻转变:从发论文到分享踩坑的社区文化正在形成。它证明了工业界愿意公开自己的实战经验,而开源社区也在用脚投票认可这种分享的价值。
对于中国 AI 从业者而言,这个仓库的价值尤为突出。国内大厂的生产实践公开度相对较低,applied-ml 提供了一个窥探国际一线 ML 团队工作方式的窗口——无论是学习思路、还是对标自身系统设计,都极具参考价值。
如果你觉得这份资源有价值,不妨给仓库点个 star,或者直接提交 PR 补充你认为值得收录的内容。毕竟,最好的知识库是靠整个社区一起维护的。
数据来源:GitHub 仓库 README、作者主页 eugeneyan.com & applyingml.com,2024-2025 年最新动态 Star 数:29,433(截至分析时) 维护状态:活跃(最近 commit 于 2025 年内)