Seed1.5-VL
字节跳动 Seed 团队开源的多模态 Cookbook,提供 38 项 SOTA 能力的端到端示例,
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
字节跳动 Seed 团队开源的多模态 Cookbook,提供 38 项 SOTA 能力的端到端示例,
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。

图1:Seed1.5-VL 项目横幅
想象你打开手机摄像头,对准一张精心设计的视觉谜题——图形层层嵌套、符号暗藏玄机。普通的视觉AI可能只能识别出"这里有个图形",而 Seed1.5-VL 看到的是整个推理链条:符号A代表数字1,叠放意味着加法,最终答案是"1+1=2"。这就是 Seed1.5-VL 区别于普通多模态模型的核心能力——不只是看,而是理解与推理。
2025年5月12日,字节跳动 Seed 团队正式开源了 Seed1.5-VL。这是一个专为通用多模态理解与推理而生的视觉-语言基础模型,在60项公开基准测试中斩获38项 SOTA,迅速成为开源多模态领域的标杆项目之一。虽然该项目以 Cookbook(使用手册)形式开源,不含模型权重,但提供了完整的 API 调用示例、最佳实践和六大场景的端到端 Cookbook,帮助开发者快速接入豆包云端模型。
ByteDance Seed 团队成立于2023年,是字节跳动旗下专注于 AI 基础模型研究的团队。Seed 一词取自"Seed-AI"之意,寓意从种子培育参天大树。该团队已陆续开源了 Seed1、Seed1.5 等多个语言模型版本,Seed1.5-VL 则是其在多模态方向的最新力作。
传统的纯语言模型只能处理文字,在面对"这张图里发生了什么"或"视频中的人物在做什么动作"这类问题时束手无策。视觉-语言模型(VLM)打破了这一瓶颈,让AI同时具备"眼睛"和"大脑"。Seed1.5-VL 在此基础上更进一步,强调推理能力——不仅能描述图像内容,还能进行复杂的视觉逻辑推理。
Seed1.5-VL 的 Cookbook 覆盖了六个核心应用场景,每个场景都配有 Jupyter Notebook 示例和实测样本:
通过 GradioDemo/ 目录下的 app.py,Seed1.5-VL 提供了开箱即用的 Gradio 交互界面。开发者只需配置好 Volcano Engine(火山引擎)的 API Key,即可通过网页与模型对话,上传图片或视频进行多模态理解。界面支持中英文切换,提供常规模式和深度思考模式两种对话风格:
<think>...</think> 标签),再给出最终答案,适合需要复杂推理的问题。Gradio 界面核心通过 SeedVLInfer 类封装,调用 Volcano Engine 云端 API,默认模型 ID 为 doubao-1.5-thinking-vision-pro-250428。

图2:Seed1.5-VL 视觉问答示例(来源:项目样例)
LongCoT/ 目录下的 Cookbook 专门演示了如何开启和关闭**长思维链(Long Chain-of-Thought)**功能。这是该模型的核心差异化能力——面对需要多步推理的视觉谜题(如 Rebus 图形谜题)时,模型会先生成结构化的推理路径,再逐步推导出最终答案。
代码中通过 ConversationModeI18N.D(Deep Thinking)和 ConversationModeI18N.G(General)两种模式控制输出格式。推理过程会通过 Gradio 界面分两段展示:第一段是带有 "🤔 Thinking" 标题的推理步骤,第二段是最终答案。
Grounding/ 目录下的 Cookbook 展示了模型的**视觉定位(Visual Grounding)**能力——给定一张图像和一个文本描述(如"图片中正在打电话的人"),模型能准确框选出目标区域。
关键实现中,action_parser.py 提供了坐标解析逻辑:模型输出格式为 <point>x y</point> 的标签,通过 AST 解析将坐标转换为标准 (x,y) 坐标对,再映射到原图尺寸得到精确的定位框。
3D-Understanding/ 目录展示了模型对三维空间的理解能力,涵盖点云场景理解、深度估计和空间关系推理。这一能力对于机器人导航、增强现实等应用场景具有重要价值。
Video/ 目录下的 Cookbook 专门处理视频内容的多模态理解。模型支持视频帧采样(默认1 FPS,最少16帧,最多81920帧),采样策略支持时间戳感知模式,可根据视频时长动态调整采样密度。核心逻辑在 infer.py 的 SeedVLInfer 类中实现,使用 decord 库进行视频解码。
GUI/ 目录展示了将 Seed1.5-VL 用作 GUI 控制智能体的能力——模型能理解屏幕截图中的 UI 元素,并生成精确的点击/输入动作指令。这一能力直接指向 AI Phone 和 AI Desktop 的终极愿景:让 AI 真正操控计算机界面,而非仅仅"看懂"界面。
从项目文档可知,Seed1.5-VL 采用 MoE(Mixture-of-Experts)架构,视觉编码器参数约 532M,激活参数约 20B。这意味着模型在推理时并非全量激活所有参数,而是根据输入动态选择专家网络,在保持强大能力的同时控制了计算成本。
模型使用 Navit 风格的动态分辨率策略(get_resized_hw_for_Navit 函数):
这允许模型处理从超长横幅到超窄竖图的各种极端比例图像。
视频理解采用分层采样策略,在时间和空间维度上自适应调整:
max_pixels_choices 列表逐级降采样确保显存可控action_parser.py 实现了从 LLM 输出到结构化动作的解析管线:
ast 模块将模型输出的函数调用字符串解析为抽象语法树,提取函数名和参数。<point> 标签,将模型输出的归一化坐标映射回原图坐标。<point>x y</point> 格式的坐标输出和 (x,y) 格式的最终答案输出。零 GPU 要求是 Seed1.5-VL Cookbook 最大的优势。由于所有 Cookbook 均通过 Volcano Engine(火山引擎)API 调用云端模型,开发者无需下载数十GB的模型权重,也无需配置昂贵的 GPU 机器。一台普通电脑 + Python 3.9+ 即可开始使用。
部署步骤简化为:
pip install gradio decord torch 等依赖Cookbook 形式的开源也带来了明显的局限:
| 维度 | 评分 | 说明 |
|---|---|---|
| 代码组织 | ★★★★★ | Cookbook 结构清晰,六大场景完全隔离,每个场景有独立的 README、代码和样本 |
| 类型安全 | ★★★★☆ | 使用 Python typing,action_parser 中有完善的类型标注 |
| 文档完整性 | ★★★★★ | README 覆盖全面,每个 Cookbook 目录有独立文档 |
| API 封装 | ★★★★☆ | SeedVLInfer 类封装良好,参数配置灵活 |
| 错误处理 | ★★★☆☆ | action_parser 有 try-except,但整体错误处理较基础 |
| 测试覆盖 | ★★★☆☆ | 依赖 HuggingFace Spaces 在线体验,单元测试较少 |
Seed1.5-VL 开源仅数月即获得1581 Star、65 Fork,在开源多模态模型中增长势头强劲。其成功可归因于以下几点:
最适合使用 Seed1.5-VL Cookbook 的场景:
需要注意的:
建议开发者从 GradioDemo/ 的在线/离线演示入手,依次体验图像问答 → 视觉定位 → 视频理解 → GUI Agent 的能力递进路径。
本报告基于 GitHub 仓库 v1.0(2025-05-12)编写,数据截止日期:2026-06-13。