intelligent-audit-system
企业级可审计 AI Agent 平台:将证据检索、工具执行、评测验收与人工复核整合为可追溯工作流,适
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
企业级可审计 AI Agent 平台:将证据检索、工具执行、评测验收与人工复核整合为可追溯工作流,适
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
图1:审脉 AuditPilot 全景图
企业审计是一项高度专业化、流程严谨的工作——审计师需要收集证据、对照控制标准、评估风险、生成发现、提出整改建议,最终形成可交付的审计报告。传统的审计工具往往是一个文档协作平台,AI 能力仅停留在"智能搜索"层面。
审脉 AuditPilot(GitHub 1164 ★,Python)另辟蹊径:它将整个审计交付流程重新设计为一套可治理的 AI Agent 工作流。核心理念是"AI 帮助理解、总结和解释,但证据完整性、质量门禁、权限控制和交付状态始终可追溯"——换句话说,Agent 不是黑盒裁判,而是有边界的工具人。
从 start.py 的启动流程和 config.py 的配置体系可以看出,AuditPilot 采用了分层架构:
第 1 层:混合意图路由(Intent Router)。用户输入审计任务后,系统首先进行意图分类,决定走哪条子工作流(审计规划 / 证据检索 / 风险评估 / 整改跟踪)。这一层不依赖 LLM,用规则引擎做快速分流。
第 2-4 层:Memory 三件套。Working Memory 保留当前会话上下文;Episodic Memory 存储历史审计任务轨迹;Profile Memory 维护被审计单位的背景信息。三者共同构成多轮审计的上下文基础。
第 5 层:Agent 运行时内核(services/agent_runtime.py)。有界的 Plan/Execute/Reflect 循环:Planner 按任务自适应规划,Executor 调用 Skills/MCP 工具执行动作,Reflector 校验交付物完整性并触发人工复核出口,Recovery 模块负责失败重试和断点续跑。
第 6 层:Agentic RAG(rag/agentic_rag.py)。采用 TF-IDF + 关键词多路召回 + 融合重排,而非单纯依赖语义向量。这是一种务实的设计——审计场景有大量规范化术语,纯向量检索容易漂移。语义向量为可选增强,关闭时不影响核心功能。
第 7 层:Skills / MCP 风格工具。工具以 Schema 声明式注册,执行前进行 RBAC 校验和租户隔离。内置熔断器和 TTL 缓存,防止单个工具故障拖垮整个工作流。
第 8 层:评测 Harness(services/evaluation_orchestrator.py)。对任务结果、执行轨迹、工具调用、证据依据、安全权限、上下文和鲁棒性进行 9 层分层评测。关键断言失败直接阻断发布。
第 9 层:Evidence Graph(knowledge_graph/)。用 Neo4j 构建证据图谱,连接任务、步骤、工具运行和产物,检测来源覆盖率和断裂依赖关系。
图2:审计工作台 — 审计立项、控制矩阵、抽样计划、发现整改全流程管理
后端基于 FastAPI + Uvicorn,模板引擎用 Jinja2,提供了完整的 Web UI。核心依赖:
fastapi + uvicorn:Web 服务层langchain_core + langchain_openai:Agent 编排scikit-learn + numpy:TF-IDF 向量化networkx:Evidence Graph 图计算pymysql + sqlalchemy:MySQL 持久化(可选)neo4j:图谱存储(可选)这套技术栈的选型非常务实——没有引入重量级的 LangChain Agents 框架,而是用 LangChain 做工具调用抽象,核心 Agent 逻辑自研,实现了灵活性和可控性的平衡。
图3:Agent 运行时 — 有界 Plan/Execute/Reflect 循环的实时可视化
最值得称道的工程决策:支持无模型密钥的降级运行模式。未配置 DEEPSEEK_API_KEY 时,系统进入确定性回退模式,审计工作流、RAG、评测和界面仍可完整体验。
Dockerfile 采用多阶段构建(python:3.11-slim),非 root 用户运行,内置健康检查。docker-compose 一键部署:
docker-compose up -d
# 访问 http://localhost:8000
可选增强:MySQL 标准库、Neo4j 图谱、本地语义向量(需安装 requirements-embeddings.txt 并设置 RAG_ENABLE_EMBEDDINGS=1)。
图4:多 Agent 协作 — 规划、证据、控制、风险与整改 Agent 的协同工作流
大多数 Agent 项目的"评测"停留在输出质量人工打分。AuditPilot 实现了自动化分层评测,7 个维度:
关键断言失败直接触发 Release Gate,阻断发布。失败只沉淀为经验候选,通过回归评测和人工批准后才允许复用,防止"学会了坏习惯"。
图5:分层评测结果 — 任务、轨迹、工具、证据、安全、上下文、鲁棒性七维评分
本地部署时 SECURITY_MODE=local;共享或网络部署必须切 SECURITY_MODE=enforced。所有敏感配置在 config.env 中管理。
图6:移动端概览 — 响应式设计,移动端可浏览工作台和评测结果
局限:当前未使用主流 Agent 框架(LangChain Agents / AutoGen),工具生态受限;Agent 协作机制为项目自研,成熟度有待生产环境验证;Neo4j 和 MySQL 为可选依赖,图谱能力依赖额外运维。
1164 个 GitHub Stars,14 个 topic 标签——AuditPilot 的定位不是又一个"AI 聊天助手",而是瞄准企业审计这个强合规要求的垂直场景。它的价值在于证明了:在强监管领域,Agent 的"可控性"比"智能性"更重要。9 层评测门禁 + 人工复核出口的设计,比单纯追求输出质量更有工程意义。随着 AI Agent 在企业级场景落地加速,这类"可治理 Agent 工作台"的需求会持续增长。
图7:审脉 AuditPilot Logo