BiliSum
将B站/YouTube/本地视频自动转化为可检索、可追问的知识笔记和思维导图
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
将B站/YouTube/本地视频自动转化为可检索、可追问的知识笔记和思维导图
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
小张是一名 AI 技术博主,每周要消化大量 B 站教程视频和 YouTube 技术分享。问题是:视频太多看不过来,看过的视频内容过几天就忘得差不多。他尝试过 Notion 笔记,但手动整理太慢;尝试过 YouTube 的自动字幕,但信息密度太低。看视频这件事,正在成为他学习效率最大的瓶颈。
BiliSum 正是为这类场景设计的工具:把 B 站、YouTube 和本地视频自动转化为结构化知识笔记——不只是压缩文字,而是识别论点、案例和结论,生成可检索、可追问、可导出的知识卡片。团队的使用方式也很自然:先批量跑完视频摘要,再把笔记导入 Obsidian 或者直接在 BiliSum 的知识库里追问。
BiliSum 由个人开发者维护(GitHub 366 stars),采用 MIT 协议,是当前 GitHub 上 B 站视频 AI 摘要工具中 star 数最高的开源项目之一。核心技术栈围绕 Python monorepo 组织(uv workspace 管理),分为 packages/core(视频处理核心逻辑)、packages/infra(知识库 RAG)、apps/service(FastAPI 后端)、apps/web(React 前端)和 apps/desktop(Electron 桌面端)五个子包。
整体定位是 本地优先(local-first) 的个人知识管理工具,强调数据完全落本地,不依赖云端存储。
BiliSum 的视频处理流程分为四个阶段,每个阶段都有多种实现路径可选:
阶段一:视频获取与转写
阶段二:摘要生成
阶段三:结构化输出
阶段四:知识库 RAG
BiliSum 近期新增了 Windows/macOS 桌面端,采用 Electron + React + TypeScript + Vite 构建。自绘窗口栏、统一 UI 风格、应用内自动更新。桌面端与后端服务之间通过本地 HTTP 通信,后端 API 路径为 VIDEO_SUM_HOST:VIDEO_SUM_PORT,默认 127.0.0.1:3838。
Docker 部署则通过 PyInstaller onedir 打包,将 Python 后端和 Node.js 构建产物集成到单个镜像中,默认暴露 3838 端口,数据卷挂载 /data 目录(SQLite 数据库、缓存、任务文件)。
FunASR 本地中文 ASR:对于中文视频学习场景,阿里 FunASR 的出现大幅降低了本地部署门槛。不需要 GPU 也能跑出比 Whisper 更好的中文识别效果,而且支持 VAD(语音活动检测)和说话人识别,对于多人讨论类视频尤为实用。
VLM 理解型图文笔记:传统的图文笔记方案是"截几张图 + 文字描述",BiliSum 的 VLM 方案让视觉模型真正理解画面内容,以知识点为主线组织图文顺序。这个设计思路对做教程类内容的技术写作者很有价值。
B 站风控处理:B 站有反爬机制,工具内置扫码登录(Cookie 自动保存)和手动 cookies.txt 导入两套方案,保障了持续可用的视频获取能力。
Monorepo 依赖管理复杂度:项目使用 uv workspace 管理 monorepo,Python 包和 Node.js 包混在一起,本地开发环境搭建(uv sync + npm install)需要同时熟悉 Python uv 和 npm 两套工具链,对新手不够友好。
非完全 Docker 化:只提供了 Dockerfile 而非 docker-compose,外部依赖(SQLite 数据、缓存目录)需要手动管理挂载,没有配套的数据库迁移工具,升级版本时数据迁移需要手动处理。
知识库 RAG 能力有限:知识库问答基于简单的 Embedding 向量检索,对于复杂的多跳推理类问题处理能力有限,缺乏类似 BM25 的关键词召回机制作为补充。
BiliSum 是目前最完整的开源视频 AI 摘要工具之一,尤其针对 B 站生态做了深度优化(扫码登录、多 P 视频、全集总结)。对于需要大量消化视频内容的学习者和创作者,它将"看视频"从被动消费变成主动知识管理。FunASR 本地中文 ASR 的整合是一个差异化亮点,大幅降低了中文用户的部署门槛。
当前版本 1.19.1,已进入稳定迭代期。适合有 Python + Docker 基础的个人用户和小型团队使用。