sie
统一推理引擎:一条 API 调用 85+ embedding/Reranker/NER 模型,Doc
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
统一推理引擎:一条 API 调用 85+ embedding/Reranker/NER 模型,Doc
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
图1:Superlinked SIE 官方 Logo
在 RAG(检索增强生成)和语义搜索场景中,开发者通常需要部署多套模型服务:embedding 模型负责向量化、Reranker 负责重排序、NER 模型负责实体抽取。每套模型都意味着独立的服务、版本管理、接口适配——这套补丁方案在原型阶段勉强能跑,但一旦进入生产环境,就成了运维噩梦。
Superlinked Inference Engine(SIE)的出现,就是为了终结这种碎片化。项目由 Superlinked 团队开发并开源,定位是企业级推理服务器与生产集群,将 embedding、Reranking、Entity Extraction 三种能力整合进一个统一 API,支持 85+ 预配置模型。团队在 MTEB(Massive Text Embedding Benchmark)上做了完整的质量验证,所有模型在 CI 中自动化测试,确保每一次模型热切换不引入质量退化。
SIE 的 API 设计极度克制,核心只有三个函数,却覆盖了向量检索的完整链路:
1. encode - Embedding 向量化
将文本、图片转化为稠密向量(dense embedding)或稀疏向量(sparse embedding)。内置 85+ 预配置模型,涵盖 BGE、ColBERT、多向量(multi-vector)等多种架构。首次调用时模型从 HuggingFace 自动下载到本地缓存,后续调用毫秒级响应。支持的模型包括 all-MiniLM-L6-v2(轻量)、bge-m3(多语言)、stella-m3(高性能)等。
2. score - Reranking 重排序
基于 Cross-Encoder 对候选文档进行相关性打分。相比于向量检索的两阶段方案(先召回再重排),SIE 可以直接用 ms-marco-MiniLM 等模型对候选集做精细化排序,返回 logit 分数和相对排名。在电商搜索、法律检索等高精度场景中效果显著。
3. extract - Zero-shot 实体抽取
无需任何训练数据,直接指定标签列表进行命名实体识别(NER)。基于 GLiNER 等多标签实体识别模型,支持 person、org、LOC 等通用实体类型。输入文本,输出带时间戳和类型的实体列表。
SIE 采用 Rust + Python 混合架构:
依赖管理使用 uv(Python)和 pnpm(TypeScript),CUDA 12 专用的 PyTorch 通过独立 index 构建,确保 GPU 算力最优。
SIE 提供与 LangChain、LlamaIndex、Haystack、DSPy、CrewAI、Chroma、Qdrant、Weaviate 的官方集成包,每个集成都有独立的 Python/TypeScript SDK。企业现有的向量数据库(Chroma、Qdrant、Weaviate)无需替换,只需将推理后端切换到 SIE,即可获得 85+ 模型的质量保障。
此外还提供 OpenAI 兼容的 /v1/embeddings 端点,现有基于 OpenAI API 构建的应用可以零改动迁移到 SIE,实现成本削减。
对于大多数用户,部署 SIE 只需一条 Docker 命令:
# CPU 版本
docker run -p 8080:8080 -v sie-hf-cache:/app/.cache/huggingface \
ghcr.io/superlinked/sie-server:latest-cpu-default
# GPU 版本
docker run --gpus all -p 8080:8080 -v sie-hf-cache:/app/.cache/huggingface \
ghcr.io/superlinked/sie-server:latest-cuda12-default
确认服务就绪后调用 /readyz 端点,然后通过 Python 或 TypeScript SDK 接入。生产环境推荐通过 Helm Chart 部署到 Kubernetes,获得自动扩缩容和多副本高可用能力。
所有 SIE 包当前仍处于 0.x 预发布阶段(SemVer 规范下 API 不保证稳定),虽然团队提供了详细的兼容性策略文档,但生产环境关键业务使用前需评估版本锁定策略。Docker Compose 独立文件缺失,Docker 方式适合快速体验,生产集群必须走 Helm/Kubernetes 路径。
SIE 代表了向量推理基础设施从自建微服务向专用推理引擎演进的趋势。随着 embedding 模型和 Reranker 数量爆炸式增长,单一 API 调用多种模型能力正在成为 RAG 管道的新标准。SIE 的出现让中小团队也能在生产环境使用经过 MTEB 质量验证的模型集群,而无需自行维护多个模型服务。85+ 模型的开箱即用质量保证,在开源推理引擎中是稀缺能力。