FunClip
本地视频智能剪辑工具,ASR语音识别+LLM智能裁剪,一键定位访谈金句
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
本地视频智能剪辑工具,ASR语音识别+LLM智能裁剪,一键定位访谈金句
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
你有没有过这种经历——刷到一个长达两小时的访谈视频,里面有一段话特别精彩,但要把这段话说清楚,必须手动倒回去、一帧一帧地找起止点,眼睛盯得酸疼,还容易出错?
这种金句定位的痛苦,催生了 FunClip——一款由阿里巴巴通义实验室开源的本地视频智能剪辑工具。它用 AI 代替人眼定位,把找时间点这件事变成了一键自动化。
FunClip 的诞生背景,与 ASR(自动语音识别)技术的成熟直接相关。
2023 年起,以 Paraformer 为代表的工业级中文 ASR 模型识别准确率大幅提升。FunClip 集成阿里巴巴 FunASR 团队开源的 Paraformer-Large 模型,这是目前开源中文 ASR 效果最优的模型之一,在 ModelScope 上下载量超过 1300 万次。项目最初名为 FunASR-APP,后来更名为 FunClip,由 ModelScope 团队维护,至今已获得超过 5700 个 GitHub Stars。
如果把传统视频剪辑比作用手工尺子量长度,那 FunClip 就是一台激光测距仪。传统方式需要人工反复播放、记忆时间码;FunClip 则通过 ASR 把语音转成文字,用文字驱动剪辑——你说要第3分20秒到第3分45秒那段,它直接给你截出来,还能自动带上字幕。
FunClip 提供了完整的视频剪辑工作流:
第一步:自动语音识别。 将视频中的音频提取后,送入 Paraformer-Large ASR 模型,输出带有时间戳的文字转录结果(支持中文和英文视频)。识别结果可导出为 SRT 字幕文件。
第二步:热词定制(SeACo-Paraformer)。 用户可以在识别前注入热词(如人名、公司名、专业术语),提升对这些专有名词的识别准确率。这是 FunClip 区别于通用 ASR 工具的差异化能力。
第三步:说话人识别(CAM++)。 通过 CAM++ 说话人识别模型,自动区分视频中的不同说话人ID。用户可以指定只要第2号说话人的内容,直接裁剪出该说话人的所有段落——这对于多人访谈视频剪辑极为有用。
第四步:多段自由剪辑。 用户在识别结果中自由选中多个文本片段,一键生成对应视频片段,支持自动拼接,并返回完整视频字幕文件和目标片段字幕文件。
第五步:LLM 智能裁剪(v2.0+)。 集成通义千问(Qwen)、GPT 等大语言模型,用户可以输入自然语言指令,FunClip 会结合 SRT 字幕和 LLM 的理解能力,自动推荐剪辑点并执行裁剪。

图1:FunClip Gradio Web 界面,支持语音识别结果可视化选择剪辑

图2:完整操作流程——上传视频 → 自动识别 → 选择段落 → 一键裁剪
FunClip 的代码架构清晰,分为三个主要层次:
前端(UI 层): 基于 Gradio 构建交互界面,launch.py 是启动入口,提供视频上传、模型选择、参数配置、剪辑操作等可视化组件。无需编写代码,通过浏览器即可完成全部操作。
核心逻辑层(funclip/):
videoclipper.py:核心剪辑引擎,封装 VideoClipper 类,调用 FunASR 模型进行语音识别,管理音频预处理(librosa 重采样、PCM 格式转换)和视频裁剪(MoviePy)流程。introduction.py:项目介绍和配置。llm/:LLM 智能裁剪模块,包含与通义千问、DashScope API、OpenAI GPT、g4f(免费 GPT)等多平台的集成。工具层(funclip/utils/): 字幕生成工具(generate_srt):将 ASR 时间戳结果转换为标准 SRT 字幕格式。参数解析工具支持命令行调用方式(python funclip/launch.py -l zh 启动中文版,-l en 启动英文版)。
依赖栈: FunASR >= 1.1.2(ASR 模型调用)、MoviePy == 1.0.3(视频裁剪)、Gradio(Web UI)、ModelScope(模型下载)、torch >= 1.13 + torchaudio(深度学习推理)、openai / g4f / dashscope(LLM 调用)。
Gradio 图形界面是最友好的入口:安装 Python 依赖后,运行 python funclip/launch.py,自动在本地启动 Web 服务,打开浏览器即可使用。ModelScope 和 HuggingFace 上也有在线 Demo,可直接体验。
命令行模式适合有批量处理需求的用户,可集成到自动化脚本中。
硬件门槛较高:FunClip 依赖 GPU 进行 ASR 推理。官方推荐 NVIDIA GPU(显存 4GB+),纯 CPU 环境下运行速度较慢。磁盘占用约 10GB(含模型权重)。

图3:LLM 智能裁剪界面,支持 Qwen/GPT 等大模型指令驱动视频剪辑

图4:FunClip v2.0 支持英文视频识别与剪辑
GPU 依赖限制普及性。 没有 NVIDIA 显卡的用户体验受限,纯 CPU 推理时间可能达到 GPU 的 10 倍以上。项目暂无 Dockerfile,无法通过容器化方式快速部署。
LLM 裁剪效果依赖 API 质量。 LLM 智能裁剪需要用户自备 DashScope/OpenAI API Key,且 LLM 对视频内容的理解完全基于 SRT 字幕文本,对于没有字幕依赖视觉理解的内容(如画面文字、场景切换),LLM 无法感知。
英文 ASR 效果弱于中文。 英文识别使用 Paraformer 英文模型,而非 Whisper,在部分专业术语和口音场景下准确率不如 Whisper。
FunClip 的价值不止于工具本身,它代表了 AI 能力下沉到具体创作场景的趋势。
2022-2023 年,ASR 技术在开源社区快速成熟(Whisper、Paraformer、SenseVoice 等),但这些模型通常以 API 或通用框架形式存在,普通创作者难以直接使用。FunClip 通过将 ASR 与视频剪辑流程深度绑定,降低了 AI 视频处理的门槛。
从增长曲线看,FunClip 自 2024 年初更名以来持续迭代(v1.1 → v2.0 → LLM 集成),Star 数量从 0 增长到 5700+,是同期增长最快的开源视频工具之一。
这类工具的崛起,也在推动一个更广泛的方向:字幕生成、视频剪辑、说话人分离等能力的一体化。未来,一个人做一期访谈节目可能不再是夸张的说法。