Vision-Agents
Stream 开源的多模态实时 AI Agent 框架,支持视频观看、语音对话和实时响应,插件化架构兼容任意模型和视频提供商
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
Stream 开源的多模态实时 AI Agent 框架,支持视频观看、语音对话和实时响应,插件化架构兼容任意模型和视频提供商
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象这样一个场景:你正在打高尔夫球,旁边的 AI 教练不仅能实时识别你的挥杆姿势,还能结合你的历史数据给出改进建议——这不是科幻,而是 GetStream Vision-Agents 已经在高尔夫教学领域落地的真实案例。2025 年 8 月,知名实时通信基础设施服务商 Stream 正式开源了 Vision-Agents 项目,为开发者提供了一个构建多模态 AI Agent 的开放框架,让「观看、理解、回应视频内容」的智能应用变得触手可及。

图1:Vision-Agents 高尔夫教学演示(来源:GitHub仓库 assets/demo_gifs/golf.gif)
Stream 并不是 AI 领域的新人。这家公司自 2015 年成立以来,深耕实时音视频基础设施,服务了超过 100 万开发者,客户包括 NASA、eBay、Spotify 等知名企业。当大语言模型和视频 AI 技术在 2023-2024 年迎来爆发时,Stream 选择将自己在实时通信领域的核心优势(低延迟、抗抖动、边缘网络)与 AI Agent 能力结合,于 2025 年推出了 Vision-Agents。作为一个由商业公司主导维护的开源项目,Vision-Agents 的定位很清晰:不做封闭生态,用开放的架构让开发者自由选择模型提供商和视频边缘网络。
从表面上看,Vision-Agents 是一个 Python 包,但它的架构更像一个经过精心设计的「积木系统」。整个仓库采用 uv workspaces 管理的 monorepo 结构,核心代码位于 agents-core/vision_agents/ 目录,其中 core/ 子目录包含了 Agent 运行的全部核心模块:agents(Agent 定义)、llm(大模型接口)、stt(语音转文本)、tts(文本转语音)、vad(语音活动检测)、edge(边缘网络)、rag(检索增强生成)等功能一应俱全。与之配合的是 plugins/ 目录下的 40+ 插件包,覆盖了大模型(Anthropic Claude、OpenAI GPT、Google Gemini、Xai Grok、Mistral、Qwen)、语音服务(ElevenLabs、Deepgram、Cartesia)、视觉 AI(Roboflow、Ultralytics YOLO、HuggingFace、Moondream)、TTS(Kokoro)、WebRTC 基础设施(GetStream)以及向量数据库(Qdrant、TurboPuffer)等多个领域。这种设计思路本质上是一种「瑞士军刀」模式:框架提供标准化的接口和生命周期管理,各个功能域由对应的插件实现,开发者需要什么功能就引入对应插件,不需要的功能不会产生额外开销。
在具体功能上,Vision-Agents 的核心设计围绕一个简洁的 Agent 抽象展开。开发者通过 Python 代码定义一个 Agent 实例,指定其使用的 LLM(如 Gemini Realtime)、视频边缘网络(如 GetStream Edge)、指令集(如从外部 markdown 文件读取),即可快速构建一个能「看」视频、「听」语音并「思考」后给出反馈的智能体。README 中展示的高尔夫教练案例尤其典型:Agent 接收 YOLO 模型的实时目标检测结果,结合 Gemini 的多模态理解能力,在 500ms 内完成入会连接、30ms 内维持音视频延迟——这些数字背后依赖的是 Stream 自有的边缘网络基础设施。
值得注意的是,Vision-Agents 在多模态交互上做了相当细致的分层设计。它同时支持语音(STT/TTS)和视频帧处理,提供了 turn_detection(对话轮次检测)、avatars(虚拟形象)、mcp(Model Context Protocol)等模块。这种全链路覆盖的设计,使得开发者无需拼凑多个独立库就能构建端到端的音视频 AI 应用。此外,项目还内置了 observability(可观测性)和 profiling(性能分析)模块,帮助开发者在生产环境中监控 Agent 行为和性能瓶颈。
examples/ 目录包含了从入门到生产级别的 11 个完整示例,涵盖简单 Agent(01_simple_agent_example)、高尔夫教练(02_golf_coach_example)、电话+RAG(03_phone_and_rag_example)、足球解说(04_football_commentator_example)、安全摄像头(05_security_camera_example)、Prometheus 监控集成(06_prometheus_metrics_example)、K8s 部署(07_k8s_deploy_example)、Agent Server(08_agent_server_example)、销售助手(09_sales_assistant_example)、本地交通(10_local_transport_example)和内容审核(11_moderation_example)。其中 Agent Server 示例表明该框架不仅能用于端侧应用,还支持部署为服务端 API 服务。
从部署角度看,Vision-Agents 保持了纯 Python SDK 的轻量化风格,没有提供 Docker 镜像,但通过 uv 包管理器实现了极简安装:uv add vision-agents 即可完成核心包安装,需要特定功能时通过 extras 安装对应插件(如 uv add "vision-agents[openai, elevenlabs, deepgram]")。项目代码质量较高,使用 hatchling 作为构建系统,pytest 作为测试框架(mock 是红线),mypy 静态类型检查,以及 ruff 进行 lint/format,整体 CI/CD 流程完善。Python 版本支持 3.10 到 3.14,这意味着它能够兼容大多数现代 Python 环境。
不过需要指出的是,Vision-Agents 并不是一个「零门槛」的工具。它要求开发者具备一定的 Python 面向对象编程能力,理解 Agent 模式的基本概念,并且在使用实时视频功能时,需要自行准备 Stream 或其他兼容 WebRTC 提供商的 API 凭证。对于没有实时通信基础设施使用经验的开发者来说,理解 Edge 网络、会话建立和音视频同步的概念可能需要一定的学习曲线。项目文档(visionagents.ai)提供了快速入门指南,但对于复杂场景(如自定义 Agent 行为、调试 Agent 决策过程)的深度文档仍有提升空间。
在技术选择上,Vision-Agents 采用了「开放接口 + 商业基础设施」的双轨策略。框架本身是 Apache 2.0 开源的,插件接口是开放的,但最优的视频边缘网络体验依赖 Stream 的付费服务。这种模式在开源社区中并不罕见(如 HashiCorp Terraform 的商业模式),关键在于能否持续为开源社区提供有差异化的核心价值。截至 2026 年 5 月,该项目在 GitHub 上拥有 7800+ stars、658 forks、13 个 open issues,维护状态活跃,每月有更新节奏,这对于一个商业公司主导的开源项目来说是相当健康的指标。
从行业趋势来看,Vision-Agents 代表了 2025-2026 年 AI 应用开发领域的一个重要方向——多模态实时 AI Agent 的平台化和工具化。随着 GPT-4o、Gemini Live、Claude Opus 等原生多模态模型的成熟,「让 AI 实时感知视频内容」正在从研究走向产品化。Vision-Agents 的价值在于,它为这一趋势提供了一个经过工程验证的参考实现,开发者可以在其基础上快速实验和迭代,而无需从零构建实时通信、模型编排和插件系统的复杂基础设施。

图2:GetStream 团队标识(来源:GitHub organization avatar)