PanelGPT
用AI专家圆桌辩论激活LLM推理潜能,GSM8K准确率提升至89.9%
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
用AI专家圆桌辩论激活LLM推理潜能,GSM8K准确率提升至89.9%
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
你可能见过这样的场景:学术会议上,专家们围坐一圈,围绕一个复杂问题唇枪舌剑——有人质疑、有人补充、有人反驳。这种圆桌讨论(Panel Discussion) 的形式,往往能让问题越辩越明,最终比任何一个人单独思考得出的结论更加全面。
PanelGPT 的核心创意,就是把这种人类智慧引入大语言模型(LLM)的推理过程。
在 GPT-3.5 时代,大语言模型在复杂推理任务上的表现并不稳定。以数学推理为例,标准的 Zero-Shot 提示(直接问"答案是什么")准确率仅约 78.9%。后来研究者发现,加上 "Let's think step by step:" 这句 Chain-of-Thought(CoT)引导语,准确率能提升到 85.4%。
但 CoT 的问题在于:它只是让模型"按步骤思考",缺少多角度验证和自我纠错机制。一旦模型在某个推理步骤上走了岔路,后面的推导就会一错到底。
这正是 PanelGPT 的切入点。
PanelGPT 的方法说起来优雅而简单:让三个(或多个)AI"专家"组成圆桌,围绕同一个问题展开讨论。
它使用的核心提示词模板是:
"3 experts are discussing the question with a panel discussion, trying to solve it step by step, and make sure the result is correct and avoid penalty."
这段提示词里有三个精妙设计:
PanelGPT 在 GSM8K(Grade School Math 8K)数据集上进行了完整评测,使用 GPT-3.5-turbo API,评测 1000 道小学数学题的费用不足 2 美元。结果如下:
| 方法 | 准确率 | 提示词 |
|---|---|---|
| 无提示 | 78.9% | 标准问法 |
| Zero-Shot CoT | 85.4% | "Let's think step by step:" |
| Tree-of-Thought | 84.2% | 复杂多专家引导 |
| PanelGPT | 89.9% | 圆桌讨论 + avoid penalty |
89.9% 的准确率不仅远超基线,还在评测中击败了当时主流的多种提示工程方法。值得注意的是,消融实验(Ablation Study)逐一验证了各组件的贡献度,证明"Panel Discussion"框架和"avoid penalty"措辞都是缺一不可的。
项目仓库非常精简,仅包含以下核心文件:
README.md:完整的方法论说明与实验数据prompt_evaluation.py:评测脚本,核心逻辑约 150 行figs/Jack-Ma_Elon-Musk.jpeg:引用 2019 WAIC 上马云与马斯克的圆桌照片作为图示评测脚本 prompt_evaluation.py 的工作流程:
openai.ChatCompletion.create() 并行向 GPT-3.5-turbo 发送带 PanelGPT 提示的请求核心依赖:torch、openai、numpy、concurrent.futures(标准库)。
项目作者是剑桥大学计算机系的 Hao Sun(Email: hs789@cam.ac.uk),项目发布于 2023 年 7 月。
PanelGPT 并非完美解决方案,以下几点值得冷静看待:
1. 成本翻倍:PanelGPT 每道题需要 2 次 GPT 调用(主判断 + 验证),比标准 Zero-Shot CoT 的 1 次调用成本高出约 100%。
2. 仅验证了 GPT-3.5-turbo:论文在 GPT-4 或 Claude 等其他模型上的表现未经测试,效果未必可迁移。
3. 评测数据集单一:仅在 GSM8K 数学推理上验证,对代码生成、事实问答等场景的泛化能力未知。
4. 概念可迁移但实现需定制:圆桌讨论的"思想"可以移植到其他 Agent 框架中,但需要针对具体任务调整专家数量和讨论轮次。
PanelGPT 代表了 2023 年提示工程(Prompt Engineering)领域的从单agent到多agent协作的重要转向。Self-Consistency(多答案投票)、Tree-of-Thought(树状探索)、PanelGPT(圆桌辩论)……这些工作共同揭示了一个趋势:
让大模型"社会化"——通过多实例协作、相互校验来提升推理质量——是超越单纯扩大模型规模的可行路径。
尽管 PanelGPT 只是一个单文件研究项目,但它提出的"avoid penalty"措辞技巧已被广泛借鉴,影响了后续大量提示工程实践。项目的 GitHub Issues 和 Stars 增长轨迹,也反映出学术界对这一方向的高度关注。
项目链接:https://github.com/holarissun/PanelGPT
核心技术:Zero-Shot Prompting / Chain-of-Thought / Multi-Agent Reasoning
评测基准:GSM8K 数学推理
作者:Hao Sun(剑桥大学)