groq-python
Groq LPU 推理引擎 Python SDK,极低延迟调用 Llama/Mixtral/Gemma 模型
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
Groq LPU 推理引擎 Python SDK,极低延迟调用 Llama/Mixtral/Gemma 模型
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。

图1:Groq 官方 GitHub 组织头像
groq-python 是 Groq 公司发布的官方 Python 开发工具包(SDK),用来让 Python 程序员方便地调用 Groq 云端推理 API,在代码中接入 Llama、Mixtral、Gemma 等大语言模型。与直接在 Hugging Face 上跑本地推理不同,groq-python 的所有计算都发生在 Groq 的服务器端——你的电脑只负责发送请求和接收结果。因此它不需要 GPU,一行 pip install 加几行代码,就能让应用具备 LLM 能力。
Groq 是一家专注于 AI 推理硬件的硅谷初创公司,成立于 2016 年。它的核心竞争力是一种名为 LPU(Language Processing Unit)的专用推理芯片。与训练芯片(如 NVIDIA H100)不同,LPU 专为推理场景优化,主打超低延迟和高吞吐。在 2024-2025 年的多项公开基准测试中,Groq 的推理速度比同等规模模型的 AWS GPU 实例快 5-10 倍。
groq-python 就是 Groq 将这套推理能力开放给开发者的官方客户端库。代码生成质量与 OpenAI API 完全兼容(因为 Groq 实现了 OpenAI 的 /v1/chat/completions 接口),但延迟更低、费用更透明。
groq-python 的设计思路非常清晰:用最小的心智负担,暴露完整的 Groq API 能力。主要功能模块如下:
1. Chat Completions(聊天补全)
这是 SDK 的核心功能。通过 client.chat.completions.create() 调用,用户可以发送多轮对话消息,接收 AI 生成的回答。支持标准消息角色(system、user、assistant)和函数调用(Function Calling),完全兼容 OpenAI Chat Completions API 格式。
2. Embeddings(向量嵌入)
通过 client.embeddings.create() 将文本转换为高维向量,用于语义搜索、文本相似度计算、RAG(检索增强生成)等场景。
3. Audio(音频处理) 包含三个子功能:语音合成(Speech)、语音转写(Transcriptions)和翻译(Translations)。开发者可以用几行代码实现文字转语音或音频文件的内容提取。
4. Streaming(流式输出)
所有 API 均支持流式模式,通过 stream=True 参数启用。AI 生成的内容以 token 为单位实时返回,适合聊天机器人和实时交互界面,可显著改善用户感知延迟。
5. Batch(批量处理) 支持批量提交任务,适合需要对大量输入做统一推理的场景,比如批量文本分类或文档摘要。
6. Models(模型管理) 提供模型列表查询和详情接口,开发者可以动态获取当前可用的模型列表和配额信息。
groq-python 的代码结构体现了现代 Python SDK 设计的最佳实践:
Stainless 框架驱动 整个 SDK 是由 Stainless(一家专门做 API SDK 生成的公司)根据 OpenAPI 规范自动生成的。这意味着代码高度规范化,手动维护的部分极少,新增 API 端点可以快速同步到 SDK 中。生成模式也保证了客户端与服务端 API 的严格对齐。
同步 + 异步双客户端
_client.py 暴露了 Groq(同步)和 AsyncGroq(异步)两个主类。底层均基于 httpx 作为 HTTP 客户端。异步客户端默认使用 httpx,但支持通过 pip install groq[aiohttp] 切换到 aiohttp 以获得更高并发性能。
资源模块化设计
resources/ 目录下每个 API 资源(chat、audio、embeddings、files、batches、models)都有独立的文件,通过 _resource.py 中的 SyncAPIResource 和 AsyncAPIResource 基类统一封装。请求参数和响应结构全部由 Pydantic 模型(types/ 目录)定义,提供完整的 IDE 自动补全和类型检查。
工具函数层
_utils/ 模块提供了大量实用工具函数:is_given() 判断参数是否显式传入、is_dict() / is_list() 做类型守卫、lru_cache 做缓存、maybe_transform() 做字段转换。_compat.py 处理了 Pydantic v1/v2 兼容性问题,确保库在 Python 3.10 到 3.14 上均能运行。
错误处理体系
_exceptions.py 定义了 GroqError 和 APIStatusError 两种异常类型。前者是通用错误包装,后者携带 HTTP 状态码,便于调用方精准处理不同类型的 API 异常。
groq-python 是纯 Python SDK,对运行环境要求极低:
pip install groq,无需编译使用前需要在 Groq Console 注册账号并获取 API Key,填入环境变量 GROQ_API_KEY 或代码中直接传入。代码示例仅需 5 行即可完成一次完整的聊天补全调用。
1. 云端依赖 groq-python 本质上是一个 API 客户端,所有推理都发生在 Groq 服务器上。这意味着应用对网络质量有强依赖,离线环境下完全不可用。此外,每次 API 调用都会产生费用(按 token 计费),大规模高频调用时成本需要评估。
2. 模型由 Groq 控制 与开源模型(如 llama.cpp 本地推理)不同,用户无法自由修改模型权重或微调。Groq 提供的模型列表相对有限,且新模型的上线和下线由 Groq 决定,用户被动接受。
3. 生态锁定 虽然 Groq 兼容 OpenAI API 格式,但使用 groq-python 本身还是在 Groq 生态内。如果未来想迁移到其他推理平台,需要修改 API Key 和部分调用方式,并非完全无缝切换。
groq-python 代表了一种新兴的 AI 应用开发范式:将推理基础设施外包给专业厂商。传统上,企业要跑大模型必须自己运维 GPU 服务器,成本高、门槛高。groq-python 加上 Groq 的 LPU 推理服务,让中小型开发团队也能以极低成本获得极速 LLM 推理能力。
从趋势上看,推理即服务(Inference-as-a-Service)赛道正在快速扩张,Groq、Replicate、Anyscale 等厂商都在争夺这一市场。groq-python 作为 Groq 官方 SDK,是接入这一生态的最直接入口。随着 Groq 持续扩展模型阵容(如支持更多 Gemma、Mistral 变体),SDK 的价值会进一步提升。
对于 Python 开发者而言,groq-python 的价值在于:无需学习任何新概念,用熟悉的 OpenAI 风格 API,享受低至毫秒级的推理延迟。