LLMFeeder
一键将任意网页转换为干净 Markdown,让 AI 轻松读懂网页内容
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
一键将任意网页转换为干净 Markdown,让 AI 轻松读懂网页内容
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象这样一个场景:你正在研究一篇复杂的 AI 论文,PDF 加载困难,只能在 ArXiv 网页上阅读。论文很长,你想把核心章节喂给 Claude 或 GPT-4 做深度分析。传统做法是手动复制粘贴、排版、去广告——繁琐又耗时。LLMFeeder 就是来解决这个痛点的:一键将任意网页转换为干净的 Markdown,复制到剪贴板,直接粘贴给 AI。
LLMFeeder 的作者 Jatin Kumar Malik 在 2025 年 5 月创建了这个项目。他的动机很直接:日常使用 ChatGPT 和 Claude 时,大量有价值的内容分散在各个网站——技术博客、文档站点、新闻报道——而 AI 需要干净的文本格式才能更好地理解和分析。网页自带的广告、侧边栏、导航栏、追踪脚本都是噪音,直接复制粘贴会让 AI 的上下文塞满无关内容。
为此,他决定做一款浏览器扩展,利用 Mozilla 开发的 Readability 算法提取网页主体内容,再用 Turndown.js 将 HTML 转换为标准 Markdown。整个工具完全运行在本地浏览器中,不上传任何数据到服务器——这既是技术选择,也是隐私承诺。
LLMFeeder 的架构是经典的浏览器扩展三件套:内容脚本(Content Script) 负责实际的内容提取和转换;弹出窗口(Popup) 负责用户交互界面;后台脚本(Background Script) 负责键盘快捷键的注册与分发。
核心技术依赖两把利器:
Readability.js(89KB)是 Mozilla 为 Firefox Reader View 开发的开源库,核心算法通过分析 DOM 树的语义结构(article 标签、段落密度、文字长度)来判断网页的「主体内容」,过滤掉导航、页脚、广告区块。这是业界最成熟的内容提取方案,误判率极低。
Turndown.js(26KB)负责将提取后的 HTML 转换为 Markdown。它的转换规则高度可配置:表格、代码块、图片、列表都可以精确还原。LLMFeeder 在此基础上做了大量定制——比如智能生成图片 alt 文本、优化代码块的 fence 标记格式、支持链接的包含/排除开关。
项目使用 Manifest V3 规范开发,同时兼容 Chrome 和 Firefox。构建系统提供了 build.sh 脚本和 Makefile,支持分别构建 Chrome 和 Firefox 两个版本,并自动生成 zip 发布包。版本管理通过 GitHub Actions 实现 CI/CD,每次 PR 都会触发构建验证。
v2.0 版本的 UI 全面重构后,LLMFeeder 已从一个简单的「复制按钮」演变为完整的生产力工具集:
多标签批量处理是 v2.1 的重磅功能。用户可以用 Ctrl/Cmd+Shift 选中多个标签页,然后一键「Copy All」将所有页面合并为一份 Markdown,或「Download Merged」保存为单个 .md 文件,甚至「Download as ZIP」打包下载。这个功能对需要批量研究多个资料的用户非常实用。
Token 计数器内置了对 GPT-4 和 Claude 两种主流 tokenizer 的估算逻辑,并预设了从 4K 到 32K 的上下文限制选项。用户可以实时看到当前 Markdown 预计消耗的 Token 数量,在复制前判断是否会超出 AI 的上下文窗口。这个功能解决了「复制完才发现超长」的尴尬。
右键上下文菜单允许用户在任何网页上右键选择「Convert to Markdown」,无需打开扩展弹窗,体验更流畅。Include Links 开关则让用户选择是否在 Markdown 中保留链接文本——关闭后可以显著减少 Token 消耗,适合只需要正文内容的场景。
这是 LLMFeeder 最大的优势之一。它完全不需要服务器、不需要命令行、不需要安装任何依赖。普通用户只需:
对于开发者,从源码构建同样简单:克隆仓库后运行 ./scripts/build.sh chrome 或 make chrome,即可在 dist/ 目录下生成可加载的 .zip 包。本地调试时,Chrome 开启开发者模式后选择「Load unpacked」加载 extension/ 目录即可热重载。
LLMFeeder 并非万能。首先,Readability 算法对高度动态渲染的 SPA(单页应用)和需要登录才能查看的内容(如付费新闻)效果不佳——这类页面在 JavaScript 渲染完成前就提取,只能拿到骨架屏。其次,Token 计数器的估算精度有限,不同 AI 服务使用的实际 tokenizer 有差异(OpenAI 的 tiktoken、Anthropic 的 cl100k_base),仅作参考。
另外,作为纯客户端工具,LLMFeeder 无法解决「需要登录的内容提取」这一根本限制——这是所有客户端网页抓取工具的共同瓶颈。
在 RAG(检索增强生成)浪潮中,「高质量内容获取」是数据管道的关键环节。LLMFeeder 切入了一个细分但高频的需求:快速将网页内容注入 AI 上下文。它的 Star 增长速度(从 2025 年 5 月至今突破 420+)印证了这一需求的真实存在。
从更宏观的角度看,LLMFeeder 代表了一种「AI 原生工具」的开发思路:不追求大模型本身,而是围绕 AI 使用场景做极致的效率优化。这类工具往往体积小、场景垂直、增长快,是开源生态中不可忽视的力量。
总结:LLMFeeder 是一款定位精准的浏览器扩展,用极低的上手成本解决了 AI 时代的高频痛点。它不是大模型,但它是让大模型发挥更大价值的「基础设施」之一。如果你经常需要把网页内容喂给 AI,这可能是你效率最高的工具。