CognitiveKernel-Pro
腾讯AI Lab开源的深度研究Agent框架,SFT训练即可超越RL模型,GAIA基准超越Claud
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
腾讯AI Lab开源的深度研究Agent框架,SFT训练即可超越RL模型,GAIA基准超越Claud
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象一下,你正在撰写一篇学术论文,需要在浩如烟海的网页中定位一个具体的技术细节,同时还要从 PDF 文档中提取数据并交叉验证。如果这一过程可以由 AI 自动完成,那将是怎样的体验?腾讯 AI Lab 推出的 Cognitive Kernel-Pro(简称 CK-Pro)正是为此而生——它是一个完全开源的多模块深度研究 Agent 框架,旨在让普通开发者也能拥有接近专业研究助手的能力。
在开源 Agent 领域,大多数高性能系统要么闭源,要么依赖昂贵的付费 API(如 OpenAI、Anthropic 的商业服务)。CK-Pro 的出现打破了这一格局:它仅依赖免费工具(除 Google Search API 外可选 DuckDuckGo 替代),在 GAIA 基准测试中取得了开源 Agent 最高分,甚至超越了 Claude-3.7 Sonnet 等商业模型的表现。
CK-Pro 的设计精髓在于模块化解耦。整个系统由三个核心 Agent 组成,各司其职、协同工作:
主控 Agent(CKAgent) 是系统的"大脑",负责接收用户任务、制定执行计划,并根据任务类型调度子 Agent。它支持最多 16 步推理,允许设置 70 分钟的超时限制。更有趣的是,主控 Agent 集成了**多轮并行执行(step_mrun)**机制——当遇到关键决策点时,可以同时运行多个候选方案,通过投票聚合(aggregation)选出最优结果,类似于"多智能体ensemble"的思路。
Web Agent(WebAgent) 是负责"上网冲浪"的子模块。基于 Playwright 浏览器自动化技术,它能够执行网页导航、点击、输入、截图等操作。WebAgent 内置了多模态理解能力,支持对网页截图进行视觉分析,从而理解复杂的页面布局。在架构上,WebAgent 采用了类似 Hugging Face SmolAgents 的设计思想,但做了大幅简化,代码更加轻量可控。
File Agent(FileAgent) 是处理本地文档的专家,支持 PDF、Word、Excel、PPT 等多种格式的解析。它能够理解文档结构、提取关键信息,并将结果反馈给主控 Agent 用于后续推理。这解决了"深度研究"场景中最常见的痛点——需要同时处理网页和本地文献。
三个 Agent 之间通过标准化的消息格式通信,每次交互的输入输出都被完整记录在 AgentSession 结构中,支持事后回放和分析。
CK-Pro 另一个令人惊喜的亮点是完全可复现的 SFT(监督微调)训练流程。传统观点认为,要训练出高性能 Agent,必须使用 RL(强化学习)方法——这不仅计算成本高昂,训练过程也难以稳定复现。CK-Pro 的研究团队证明,通过精心设计的轨迹采样(trajectory sampling)和拒绝采样(rejection sampling)策略,仅用 SFT 就能超越 WebDancer、WebSailor 等 RL 模型的表现。
训练数据来自两个关键环节:
最终,他们将这一流程应用于 Qwen3-8B 模型,得到了 Qwen3-8B-CK-Pro checkpoint,在 GAIA-text 任务上实现了 36.2%(SFT)→ 47.6%(RL)的性能提升。更进一步,他们还提出了 subgoal-GRPO 算法,将 RL 训练效果推向 52.8%。
从代码质量看,CK-Pro 体现了腾讯 AI Lab 务实的工程风格:
openai(兼容 vLLM/Azure/OpenAI API)、transformers(tokenizer)、duckduckgo_search(免费搜索)、selenium/helium(浏览器)、pdfminer/mammoth(文档解析)等成熟库,没有引入过多实验性依赖。KwargsInitializable 基类实现"字典式配置注入",子模块只需声明需要的参数名,即可从顶层配置字典中自动读取,简化了多层级配置的复杂度。TemplatedString 支持用函数或 f-string 定义 prompt 模板,代码可读性极高。代码结构清晰,主要模块如下:
| 模块 | 文件 | 职责 |
|---|---|---|
| agents | agent.py, model.py, tool.py, session.py | 通用 Agent 基础设施 |
| ck_web | agent.py, utils.py, prompts.py | Web 浏览器 Agent |
| ck_file | agent.py, mdconvert.py, utils.py | 文件处理 Agent |
| ck_main | agent.py, main.py, prompts.py | 主控 Agent + CLI 入口 |
| ck_web/_web | server.js, Dockerfile | Playwright 浏览器服务 |
根据 arXiv 论文披露的实验数据,CK-Pro 在 GAIA 基准上的表现令人印象深刻:
| 模型 | GAIA-text Pass@1 | GAIA-text Pass@3 |
|---|---|---|
| CK-Pro-8B (SFT) | 36.2% | — |
| CK-Pro-8B (SFT+RL) | 47.6% | — |
| CK-Pro-8B (subgoal-GRPO) | 52.8% | 58% |
| WebDancer 7B (RL) | 31.0% | 34.0% |
| WebSailor 7B (RL) | 37.0% | 37.9% |
| Claude-3.7 Sonnet | 35.2% | 37.0% |
CK-Pro-8B 以 52.8% 的 Pass@1 超越了所有开源和免费工具 Agent,甚至超过了 Claude-3.7 Sonnet,这一结果在开源社区引发了广泛关注。此外,项目团队还将相关研究扩展至 ACL 2026,发表了 WebAggregator、Inference-Time Scaling 等后续工作。
CK-Pro 并非完美,以下几点值得关注:
部署复杂度高:需要分别启动 Playwright Node.js 服务、配置 LLM 后端(vLLM 或商业 API)、安装 Python 依赖,手动串联多个组件。没有 Docker Compose 一键部署,对于非专业用户门槛较高。
执行安全风险:Agent 直接执行 LLM 生成的代码,若被恶意输入诱导,可能执行危险操作。虽然 README 有安全建议,但系统层面缺乏 sandbox 强制隔离。
商业 API 依赖:虽然主推免费工具,但 GPT-4.1 等商业模型在轨迹采样阶段仍是"黄金标准"。若只用开源模型,效果会显著下降。
多步推理成本:每次任务可能需要数十次 LLM 调用(主 Agent + 子 Agent),推理成本不容忽视。step_mrun 多轮并行机制虽提升了效果,但进一步放大了调用量。
多模态依赖:File Agent 和 WebAgent 的部分能力依赖多模态模型(如 GPT-4V/Claude Vision),纯文本模型在这些环节表现受限。
CK-Pro 的发布标志着开源深度研究 Agent 进入了一个新阶段。在此之前,高性能 Agent 系统的训练和部署几乎是闭源厂商的专利;CK-Pro 通过以下三个维度推动了技术民主化:
此外,CK-Pro 的多层 Agent 架构和轨迹数据格式为行业提供了宝贵的基准——越来越多的研究(如 ACL 2026 的多篇论文)开始基于 CK-Pro 框架进行扩展,形成了良性生态。
# 环境准备
pip install boto3 openai duckduckgo_search rich numpy pandas pdfminer-six python-pptx mammoth markdownify
pip install selenium helium smolagents
# 启动 Web 浏览器服务
sh ck_pro/ck_web/_web/run_local.sh
# 配置 LLM 后端
export LLM_URL=http://your-vllm:8080/v1/chat/completions
export SEARCH_BACKEND=DuckDuckGo
# 运行简单测试
export PYTHONPATH=/your/path/to/CogKernel-Pro
python3 -u -m ck_pro.ck_main.main --input simple_test.jsonl --output output.jsonl
总结:Cognitive Kernel-Pro 是腾讯 AI Lab 在开源 Agent 领域的一次重磅出击。它不仅是一个可直接使用的深度研究工具,更是一套完整的方法论——从轨迹采样、SFT 训练到 Agent 架构设计,为整个社区提供了可复现的标杆。唯一需要注意的是其部署复杂度较高,建议有一定工程经验的开发者尝试。随着 HuggingFace 模型和数据集的持续更新,CK-Pro 有望成为开源 Agent 生态的核心基座。