hume-python-sdk
Hume AI情感智能API的Python封装,EVI共情语音接口 + Octave TTS,支持实时情绪检测与响应
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
Hume AI情感智能API的Python封装,EVI共情语音接口 + Octave TTS,支持实时情绪检测与响应
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象这样一个场景:一位用户在使用智能客服时语气急促、声音颤抖——传统的语音AI只会识别文字内容,而 Hume AI 能够捕捉到隐藏在语调、节奏和音色中的情绪信号,并以匹配的共情语气回应。这不是科幻,而是已经可以通过 Hume AI Python SDK 实现的现实。

图1:Hume AI 品牌标识
Hume AI 由心理学家和机器学习研究者创立,其核心理念源于哲学巨匠大卫·休谟(David Hume)的一个洞见:「服务于人类偏好的算法应当由情绪来引导」。公司汇集了达尔文、保罗·艾克曼等科学家数十年关于情绪表达的研究成果,并利用现代深度学习方法将情绪维度扩展至 30 余种。
hume-python-sdk 正是将这一情感智能研究成果工程化、产品化的关键载体。2022年发布至今已迭代至 v0.14.x,累计 72 个版本发布,246 次提交,100% MIT 许可证开源,是目前接入 Hume AI 情感智能 API 最标准、最完整的 Python 方案。
Hume Python SDK 封装了两大核心 API 产品:
(1)Empathic Voice Interface(EVI)——共情语音接口
EVI 是业界首个具备情绪智能的实时语音对话 API。它不只做语音识别(ASR)和语音合成(TTS),还能:
EVI 基于 WebSocket 实现真正的实时双向通信,最大会话时长 30 分钟,最大单条消息 16MB,支持配置化系统提示、自定义 LLM(Claude/GPT/Gemini 等)和工具调用。
(2)Octave TTS——LLM驱动的语音合成
Octave 是首个基于 LLM 智能构建的文本转语音系统。与传统 TTS 的核心区别在于:Octave 能够「理解」文本的语义和情感,从而在朗读时做出恰当的表达选择——叙述秘密时自动压低声音、表达胜利时自然上扬、平静陈述事实时保持稳重。
Octave 2 版本将延迟降低至约 100ms,并支持 11 种语言(英日韩西法葡意德俄印阿),提供语音设计(通过自然语言描述创建声音)和语音克隆(15秒样本即可)两大功能。
SDK 采用 Fern API 框架 生成(.fern/ 配置目录为证),这是目前最规范的 API 代码生成方案,意味着模型定义与 API 规范严格同步,类型安全系数极高。整体架构分层清晰:
| 层次 | 核心模块 | 技术选型 | 说明 |
|---|---|---|---|
| 传输层 | http_client.py | httpx | 同步/异步 HTTP 客户端,支持自定义传输层和代理 |
| WebSocket层 | websocket.py | websockets库 | EVI 实时通信核心,支持 socket_client.py 封装 |
| 数据模型层 | types/ | Pydantic v2 | 150+ 类型定义,所有请求/响应结构化 |
| API 路由层 | empathic_voice/, tts/ | Fern 生成 | 每个 API 端点对应独立 raw_client.py |
| 错误处理层 | api_error.py | 自定义异常体系 | 所有错误均为 ApiError 子类,便于捕获 |
| 分页层 | pagination.py | SyncPager/AsyncPager | 支持生成器式遍历和手动翻页 |
典型使用示例:
from hume.client import HumeClient
client = HumeClient(api_key="YOUR_API_KEY")
configs = client.empathic_voice.configs.list_configs()
from hume.client import AsyncHumeClient
import asyncio
async def main():
client = AsyncHumeClient(api_key="YOUR_API_KEY")
await client.empathic_voice.configs.list_configs()
asyncio.run(main())
值得注意的是,EVI 的 WebSocket 消息协议极为精细:定义了 publish_event.py(发送端事件,如 audio_input 音频输入、user_message 用户消息)和 assistant_message.py(接收端事件,如 assistant_prosody 韵律数据、emotion_scores 情绪分),两者通过类型化的 Pydantic 模型严格约束,确保协议层面的稳定性。
Hume Python SDK 兼容 Python 3.9~3.13,支持三种包管理工具:
pip install hume
poetry add hume
uv add hume
EVI 实时语音对话场景(需要麦克风)还需安装可选依赖 sounddevice:
pip install "hume[sounddevice]"
SDK 的 HumeClient(同步)和 AsyncHumeClient(异步)双入口设计,覆盖从脚本到生产服务的全场景。配置方面支持请求级 max_retries(自动指数退避重试)和超时控制(默认 60 秒,可按端点自定义)。
| 场景 | EVI 的独特价值 |
|---|---|
| 智能客服 | 实时感知用户情绪,对愤怒用户优先安抚,对困惑用户提供额外解释 |
| AI 陪伴机器人 | 长时间语音交互中持续保持情绪对齐,语调自然如真人 |
| 医疗健康 | 配合 HIPAA 合规,可用于心理健康初筛和随访机器人 |
| 无障碍应用 | 为视障用户提供情绪感知的语音交互,提升体验温度 |
| 教育平台 | 语音答题场景中感知学生答题时的自信程度,动态调整题目难度 |
| 内容配音 | Octave TTS 生成播客、视频配音,支持情感驱动的朗读风格 |
Hume AI 的出现填补了 AI「情绪盲区」这一长期空白。当业界普遍在 LLM 文本能力上内卷时,Hume 选择从情感维度切入,证明了情绪智能在用户体验中的不可替代价值。Niantic(Pokémon GO 母公司)已在其 AR 眼镜 Spatial 中集成 EVI,证明这一技术在消费级硬件上的可行性。
随着 EVI 4-mini 支持 11 种语言、Octave 2 延迟降至 100ms 级别,情感智能 API 的工程成熟度已接近可大规模商用的临界点。Hume Python SDK 作为这一能力最规范的 Python 入口,将成为 AI 应用开发者接入情感智能的首选工具链。