layra
全球首个视觉原生AI自动化引擎,融合视觉RAG与多步骤Agent工作流编排
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
全球首个视觉原生AI自动化引擎,融合视觉RAG与多步骤Agent工作流编排
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象一个场景:你在构建企业知识库系统,导入了一份 50 页的财务报表 PDF。传统 RAG 系统会将 PDF 转为纯文本,丢失所有表格结构、图表注释和段落层级。查询"第三季度净利润"时,AI 只能在一堆碎片文字中艰难检索,答案可能张冠李戴。
这正是 LAYRA 试图解决的核心问题——让 AI 像人类一样阅读文档,看懂布局、理解图表。
图1:LAYRA 简约的首页界面
LAYRA 由 GitHub 用户 liweiphys 主导开发(头像为微信公众号标识,推测为中文 AI 社区活跃开发者),定位为全球首个"视觉原生"(Visual-Native)AI 自动化引擎。项目采用 Apache-2.0 开源许可证,当前已积累 902 stars、98 forks,代码库保持活跃维护(最近更新:2026-06-15)。
项目技术方向明确:
传统 RAG 的局限在于"以文读图"——将视觉内容强制转为文字后再检索。LAYRA 另辟蹊径,采用 ColQwen 2.5(基于 Qwen2-VL 的多模态检索模型)将文档页面直接转为语义向量,完整保留布局结构、图形元素和空间关系。
LAYRA 的视觉 RAG 管道为:
poppler-utils(pdftoppm)转为高清图片这种方案对财务报告、技术文档、合同等视觉信息密集型文件有显著优势——表格结构不会被拆散,图表的上下文关系不会丢失。
图2:知识库集中管理界面,支持多格式文档上传与视觉索引
LAYRA 的野心远不止 RAG 检索,其工作流引擎才是终极武器——用自然语言编排任意复杂度的 AI 自动化流程。
工作流的节点类型包括:
开发者可以通过可视化拖拽构建工作流,也可以在每个节点设置断点调试,检查中间变量、修改状态后继续执行。这对于 Agent 系统的开发调试尤为重要——传统 LLM Agent 的"黑箱"问题在这里被部分解决。
图3:可视化工作流构建器,支持节点级断点调试
LAYRA 采用前后端分离的微服务架构,各组件独立部署在 Docker 容器中,通过 Docker Compose 一键启动:
| 服务 | 技术栈 | 职责 |
|---|---|---|
| frontend | Next.js 15 + TypeScript + TailwindCSS 4.0 | 用户 Web 界面 |
| backend | FastAPI + Python 3.10 + Gunicorn | REST API + 业务逻辑 |
| model-server | ColBERT/ColQwen2.5 推理服务 | 向量化模型服务 |
| sandbox | 独立 Docker 容器 | Python 代码安全执行环境 |
| unoserver | LibreOffice 渲染服务 | 文档格式转换 |
| Milvus | 向量数据库 | 高维向量存储与检索 |
| MySQL | 关系数据库 | 结构化业务数据 |
| MongoDB | 文档数据库 | 非结构化数据存储 |
| Redis | 缓存 + 消息队列 | 缓存与异步任务 |
| Kafka | 消息流平台 | 事件驱动架构 |
| MinIO | 对象存储 | 文件资产存储 |
后端采用 FastAPI 全异步架构,集成 Redis、MySQL、MongoDB、Kafka、MinIO,对高并发场景进行了优化。代码结构清晰分层:
backend/app/
├── rag/ # 视觉 RAG 核心:文档转换、Embedding、LLM 服务
├── workflow/ # 工作流引擎:图执行、沙箱、MCP 集成
├── framework/ # Agent 框架抽象层
├── models/ # 数据模型:ChatFlow、Workflow、KnowledgeBase
├── api/endpoints/# REST API 路由
└── core/ # 核心配置、安全、日志
图4:对话界面,AI 答案直接引用原始文档页面截图,保留完整布局
LAYRA 提供了两套部署路径,覆盖不同硬件条件的用户:
git clone https://github.com/liweiphys/layra.git
cd layra
docker compose up -d --build
首次启动自动下载约 15GB 模型权重(需要耐心等待)。
git clone https://github.com/liweiphys/layra.git
cd layra
docker compose -f docker-compose-no-local-embedding.yml up -d --build
申请 Jina API Key 后填入 .env,即可零 GPU 部署。
部署前置条件:
图5:MCP 工具集成示例,工作流中调用外部 API
即使选择了 Jina API 模式,后端 FastAPI 服务、Milvus、MySQL 等组件的运行仍需要相当资源。纯 CPU 环境下用户体验可能不佳。
项目 README 中包含微信群、微信公众号等中文社区联系方式,且 logo.png 在某些网络环境下不可访问,可能对纯英文用户造成一定障碍。
8 个以上 Docker 服务的架构对运维能力有一定要求,相比轻量级 RAG 工具(如 txtai、Quivr),LAYRA 的学习曲线更陡峭。但这也是企业级系统的必然代价。
LAYRA 的出现代表了一个重要趋势:视觉优先(Vision-First)的 AI 应用正在从研究走向生产。ColPali/ColQwen 这类多模态检索范式在 2024 年底至 2025 年初开始成熟,LAYRA 是将这一技术落地的较早尝试之一。
同时,"可视化 Agent 调试 + 人机协同 + 多步骤工作流"的组合,呼应了 AI Agent 从"单步调用"向"可控多步骤执行"演进的行业共识。在金融、医疗、法律等对准确性要求极高的领域,这种工作流编排能力有直接的应用价值。
项目增长数据(902 stars)虽然不算爆炸式增长,但在企业级 Agent + RAG 赛道中,已属稳健。随着多模态模型能力持续提升和成本下降,类似 LAYRA 的视觉原生解决方案有望迎来更快速的增长。
图6:可视化查询界面,支持图片+文本混合检索