aitools_client
Unity驱动的本地AI多模态创作工作站,通过自然语言对话集成ComfyUI图生图、视频生成和多个LLM后端
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
Unity驱动的本地AI多模态创作工作站,通过自然语言对话集成ComfyUI图生图、视频生成和多个LLM后端
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象这样一个场景:你在写一个关于赛博朋克的故事,想象中的人物需要一张真实感十足的脸、一张赛博朋克风格的城市海报来配合叙事——传统流程下,你需要分别打开 Midjourney、Stable Diffusion、CapCut 等多个工具,来回切换、反复复制粘贴提示词。而 Seth's AI Tools 做的事情,就是把这一切都收进了一个本地 Windows 应用里:用自然语言对话驱动 AI 帮你生成图片、短视频、音乐甚至交互式小游戏,同时支持多个 ComfyUI 服务器并行工作。
这不是 Web 应用,而是一个实打实的 Windows 原生 .exe(Unity + C# 编写),完全本地运行,不收集任何用户数据,不偷偷上报统计——隐私优先。

这个项目诞生于 2022 年,作者是独立游戏开发者 Seth Robinson(GitHub @SethRobinson)。从 2022 年 9 月 13 日首次提交到今天,项目已经迭代超过三年。作者的动机非常朴素:他需要一个个人 AI 试验台,能同时跑图生图、视频生成、AI 对话等多种任务,而市面上的工具都太分散、不够可控。
项目的核心设计哲学很有意思:不是做一个 AI 模型,而是做一个 AI 的调度台。它自己不训练模型,也不托管模型,而是充当用户与多个后端服务(ComfyUI 工作流、Ollama 本地大模型、各商业 API)之间的中间层。打个比方:Seth's AI Tools 更像是 AI 世界的「多功能瑞士军刀」,而非要替代任何一个专用工具。
值得关注的是,项目的开发节奏极为稳定——就在 2026 年 8 月 30 日还发布了 V3.06 版本,新增了 MiniMax H3 视频生成能力的完整支持,距今不足一周。
这是项目的主入口,界面类似于 ChatGPT,但内置了大量「对话触发技能」:用户告诉 AI「帮我生成一张赛博朋克海报」,AI 会自动调用合适的 ComfyUI 工作流、执行生成、返回结果。过程中 AI 还能联网搜索(Brave Search API)、抓取参考图片和视频片段、阅读网页内容作为研究素材——全部在对话气泡中展示,无需切换工具。
AI Chat 还支持音频生成:生成背景音乐、音效甚至配音。生成的音频片段以气泡形式嵌入对话中,还可以与视频轨道混合配乐。
支持多个 ComfyUI 工作流,覆盖:
内置图像处理工具:裁剪、缩放、遮罩绘制,支持在同一画布上平移缩放数千张图片。
这是 V3.06 版本的重点方向:
这是最有创意的功能之一。AI Guide 可以自动生成「激励海报」和「插画故事」;Adventure 模式则可以生成实时互动冒险(类似 AI Dungeon)、选择题风格的问答游戏,以及可导出自包含 HTML 版本的冒险故事——意味着生成的故事可以独立分享,无需运行原 App。
项目的代码结构非常有特点,分为两大核心层:
整个前端是标准的 Unity 项目,UI 基于 Unity 的原生 GUI 系统(ugui)构建。主要模块包括:
Assets/aichat/:AI Chat 功能实现,包含 Skills 技能系统Assets/Adventure/:互动冒险模式Assets/AIGuide/:AI Guide 激励/故事生成Assets/Packages/:Unity UPM 依赖清单,包含 XR 交互工具包、多人中心、Shader Graph 等值得注意的技术选型:项目使用了 com.unity.xr.interaction.toolkit(XR 交互工具包),虽然当前版本中 CrazyCam XR 功能已禁用,但架构上保留了沉浸式交互的扩展空间。
cli/ 目录是一套完整的命令行工具包,核心文件:
aitools_cli.py:主 CLI 入口,支持 Linux + Windowscomfy_api.py:与 ComfyUI API 通信(POST /prompt、WebSocket 进度跟踪)workflow.py:工作流加载、API 格式转换、占位符替换servers.py:多服务器管理(自动跳过不可达服务器,按队列优先级选择)images.py / vid2alpha.py:图片和视频后处理CLI 通过 config.txt 配置 ComfyUI 服务器列表(支持多个服务器 + Bearer Token 认证),是开发者和自动化管线的理想入口。
支持的大模型后端:
| 类型 | 具体支持 |
|---|---|
| 本地 LLM | Ollama(本地)、TabbyAPI |
| 商业 API | OpenAI GPT 系列、Anthropic Claude 系列(包括最新 Claude 3.7/3.5 Fable 5)、Google Gemini、xAI Grok |
| 图像生成 | ComfyUI( Flux、SDXL、Ideogram 4、Qwen 等)、Automatic1111 API |
| 视频生成 | MiniMax H3、LTX-Video、Wan2.2 |
| 音频 | MiniMax H3(语音 + 音效 + 音乐)、ElevenLabs(配音) |
好消息是:作者提供了直接可用的 Windows 预编译版本(V3.06,约 150MB),下载解压即用,无需安装 Unity 和编译代码。如果你的目标只是用 AI Chat 生成内容、调用已有 ComfyUI 服务器,这个路径 10 分钟内可以搞定。
坏消息是:如果需要从源码编译,则必须:
--listen 并安装特定 custom node)CLI 模式相对友好:pip install -r cli/requirements.txt,配置好 config.txt 中的服务器地址即可工作,Linux 也能运行。
核心限制:项目没有 Docker 支持,必须在 Windows 原生环境运行;依赖 GPU(推荐 NVIDIA);对国内用户而言,ComfyUI 服务器配置和 Brave Search API 的获取也有一定门槛。
项目作者本人也坦诚列出了一些问题:
从 GitHub 数据看,项目长期保持着稳定的活跃更新(V3.06 距今不足一周),topics 涵盖 anthropic、automatic1111、comfyui、llm、ollama、openai、tabbyapi 等关键词,说明与整个开源 AI 生态的集成深度相当不错。
这个项目代表了一种**「AI 工具集成层」的思路——不做新模型,而是把最好的开源 AI 能力用一个本地 App 串联起来。在 2026 年各路 AI 应用都在卷 Web 端体验的时候,这种本地优先、隐私优先**的桌面工具路线,依然有一批忠实用户。
如果你有独立 GPU、对 AI 创作有多种需求、且重视数据隐私,Seth's AI Tools 绝对值得一试。如果只是想快速体验,最简单的方式是直接下载预编译 exe。
报告生成时间:2026-08-31 | 项目作者:Seth Robinson | Stars:186 | 语言:C#(Unity)