nyt-connections
940道纽约时报字谜扩展题,系统评估LLM语义联想与歧义消解能力
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
940道纽约时报字谜扩展题,系统评估LLM语义联想与歧义消解能力
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象一下:你面前有 16 个词语——苹果、梨、香蕉、橙子、葡萄柚、奇异果、芒果、西瓜、医生、律师、老师、工程师、画家、音乐家、作家、摄影师。你要找出四组每组四个词语,它们分别有一个共同的主题,比如「水果」「职业」。但问题是:有些词语故意设计成同时属于多个类别,迷惑性极强,只有真正理解语义细微差别才能正确分类。
这正是《纽约时报》(New York Times)旗下一款名为 Connections 的填字游戏的核心玩法。2024 年 10 月,一位名叫 lechmazur 的独立研究者注意到了这款游戏对大语言模型(LLM)推理能力的惊人挑战潜力——它不像数学题有标准答案,不像代码题有编译反馈,它的评判标准完全依赖语义理解和联想能力,而这恰恰是当前大多数 LLM 评测基准所忽视的维度。于是他开源了 nyt-connections 项目,用 940 道扩展版 Connections 谜题,对全球主流大模型进行了一场系统性的「语义推理」大考。
在 LLM 评测领域,主流基准长期被数学推理(MATH、GSM8K)、代码生成(HumanEval、MBPP)和知识问答(MMLU)所主导。这些基准固然重要,但它们都有一个共同特点:答案具有较强的客观性——一道数学题对就是对,错就是错;一道编程题的输出可以被自动判定。然而,语义理解与联想能力,恰恰是这些基准无法覆盖的盲区。
大模型在日常对话、创意写作、多轮推理中展现出的「举一反三」「触类旁通」能力,源自其对词语语义微妙差别的把握程度。Connections 谜题正好将这种能力具象化:你必须同时理解词语的字面含义、文化内涵、隐喻用法,以及在特定语境下哪种解读更合理。以一道经典谜题为例:词语「BARK」「DOG」「PINE」「TREE」中,正确答案是将「BARK」与「TREE/PINE」配对(树皮),而非与「DOG」配对(狗叫)——因为谜题要求的是字面物理属性,而非常见联想。
lechmazur 的扩展版本在原有 436 道谜题基础上,增加到 940 道,并在每道谜题中加入了最多四个干扰词(trick words),确保没有任何词语可以「想当然」地归入某个类别。这种设计使得评测难度显著提升——标准版排行榜中,o1 模型能达到 90.7% 的准确率,而在扩展版中,即使是表现最好的 Gemini 3.1 Pro Preview,也只有 98.4%。排行榜的剧烈分层,清晰地揭示了不同模型在「反常识语义联想」上的真实差距。
nyt-connections 的评测流程设计得非常巧妙,同时也暴露了其作为评测工具的本质局限。
评测流程分为三个阶段:
第一阶段是题目输入。项目提供了 prompts/ 目录下的多版本提示词模板。以 prompt_conn.txt 为例,它向模型发送的指令非常明确:
"From the words listed below, create four distinct groups of four words each, where each group shares a single unifying concept or has some common thread... Each line should have four comma-separated words. No group names, no explanations, no filler text."
这种严格的输出格式约束——只输出四个词语行,不允许任何解释——是为了让评分脚本能够自动化解析模型输出。p1.txt、p2.txt、p3.txt 则提供了不同措辞版本的提示,测试模型在不同 prompt 表述下的鲁棒性。
第二阶段是模型执行。用户需要将 LLM 的输出放入指定路径(/mnt/r/connections/results2/)的结果文件中。这一步是纯手动操作——项目本身不包含任何 LLM API 调用代码,不提供一键评测脚本。这意味着如果要对比多个模型,用户需要逐一调用各模型的 API,将输出保存为文件,再运行评分。
第三阶段是自动化评分。functions/eval.py 是整个项目的核心评分引擎。它的评分逻辑值得深入分析:
def do_two_lists_have_same_elements(list1, list2):
list1 = [x.lower() for x in list1]
list2 = [x.lower() for x in list2]
if len(list1) != len(list2):
return False
return set(list1) == set(list2)
评分采用集合等价判断:无论模型输出中词语的顺序如何,只要四个词语与标准答案完全匹配,即得 0.25 分(4 组 × 0.25 = 满分 1.0)。为了容忍模型输出的各种格式噪音,代码进行了大量预处理:去除 "1. 2. 3. 4." 序号标记、过滤 <eos> 终止符、去除 // 和 - 后的注释文字、用逗号数量选择最可能的分组部分(处理冒号分隔的情况)、去除括号内文字。

图1:扩展版排行榜,各主流大模型在940道谜题上的评测得分。

图2:各模型家族随发布时间的得分进步趋势,反映推理能力迭代速度。
排行榜数据揭示了几个重要趋势:
推理模型(Thinking/Reasoning)与非推理模型之间存在巨大鸿沟。 排行榜顶端几乎被各家的推理增强模型垄断:Gemini 3.1 Pro Preview(98.4%)、GPT-5.5 xhigh reasoning(97.5%)、Claude Fable 5 high reasoning(95.1%)分列前三。而在非推理模式下,Claude Opus 4.6 no reasoning 仅得 56.8%,Claude Sonnet 4.5 no reasoning 更是低至 47.4%——差距超过 40 个百分点。这说明 Connections 谜题的难度确实触发了 LLM 的推理链机制,让模型在「思考」后才作答能显著提升正确率。
同一模型家族内部,不同推理档位之间的得分差异也值得关注。 以 GPT-5.5 为例:xhigh reasoning 97.5%、high reasoning 96.9%、medium reasoning 95.0%、no reasoning 37.5%。从 high 到 medium 仅差 1.9 个百分点,但从 medium 到 no reasoning 骤降 57.5 个百分点。这暗示推理能力的启用/关闭之间存在一个「阈值」,低于这个阈值模型基本靠随机猜测,高于这个阈值则稳步提升。
中国大模型的表现也值得关注。 Kimi K2.6(91.4%)和 Qwen 3.7 Max(89.8%)位居前列,GLM-5.1(84.4%)也有不错的表现。但在非推理档位,这些模型的得分同样大幅下滑——Qwen3.5-27B 仅得 60.8%,说明语义推理能力的提升仍是中国模型需要持续发力的方向。

图3:各模型评测得分与估算单题成本的关系,用于评估性价比。

图4:各模型在具体谜题上的相关性热力图,揭示哪些模型容易犯相同的错误。
nyt-connections 能在 LLM 评测社区获得关注,源于几个关键设计决策:
动态难度设计。扩展版通过在每道谜题中加入干扰词,防止模型「背答案」。干扰词的选择标准极为严格——新增词语必须无法归入原谜题的任何类别。例如原谜题 categories 是「水果」和「职业」时,干扰词不能是水果也不能是职业,必须是其他语义领域的词汇。这种精细设计确保了测试的区分度。
最新谜题隔离测试。项目特意从 940 道谜题中隔离出最新的 100 道,单独统计排行榜。lechmazur 在 README 中解释了这个设计的原因:LLM 的训练数据可能包含历史 Connections 谜题及其解答,因此用最新题目测试可以更准确地衡量模型的真实泛化推理能力。最新 100 题的排行榜与完整 940 题的排行榜名次高度相似,说明头部模型的推理能力确实具有一定的泛化性。
全模型覆盖。项目追踪了 92 个模型家族的评测结果,从 GPT-5.6 到 Mistral Medium 3.1,从 Claude Opus 到 Baidu Ernie 5.1,是目前覆盖最广的 LLM 语义推理评测之一。这使得研究者可以横向对比不同技术路线的语义理解能力差异。
任何评测基准都有其适用范围和内在局限,nyt-connections 也不例外。
第一,评测范围有边界。 Connections 谜题的解题路径高度依赖英语语言文化背景知识——比如「SODA」和「POP」在美国不同地区的叫法差异,或者英语中常见的双关语和文字游戏。对于非英语母语的 LLM,或者针对特定领域(如中文、日文)的评测场景,这套基准的适用性会大打折扣。
第二,评测结果受 prompt 影响极大。 项目提供了多个版本的提示词模板,不同措辞可能导致同一模型产生显著不同的输出。这说明模型的语义推理能力与 prompt 工程高度耦合——一个「不擅长」这个游戏的模型,可能只是还没找到正确的提问方式,而非真的缺乏语义理解能力。
第三,评分机制本身有盲区。 当前评分只考核「是否找到正确答案」,不评估「解题思路是否合理」。一个模型可能通过排除法而非真正的语义理解得出正确答案,另一个模型可能真正理解了每个词语的所有语义层次但因为一个词语的多义性而选错。在这两者之间,当前评分机制无法做出区分。
第四,缺乏可复现性。 项目没有提供 LLM API 调用的集成代码,用户必须自行准备各模型的输出结果。这使得不同用户在复现评测结果时可能遇到差异——模型 API 的随机性(temperature、top_p 等参数)、不同调用时间点的模型版本更新,都会影响最终得分。
对于开发者而言,nyt-connections 的使用门槛并不高,但需要一些手动操作:
# 克隆仓库
git clone https://github.com/lechmazur/nyt-connections.git
cd nyt-connections
# 查看目录结构
ls -la
# README.md # 完整说明和排行榜
# functions/eval.py # 评分引擎
# prompts/ # 提示词模板
# images/ # 可视化图表
# 准备模型输出
# 将 LLM 的输出保存为 results2/ 目录下的文本文件
# 格式:每5行一组(第一行:题目编号;第2-5行:模型的四组词语)
# 运行评分
python3 functions/eval.py <your_result_file.txt>
环境依赖极简:仅需 Python 3.8+,无需 GPU,无需 Docker,无网络依赖。磁盘占用不到 50MB,内存需求低于 512MB。这使得它成为目前门槛最低的 LLM 语义推理评测工具之一。
不过需要提醒的是:项目本身不包含 LLM API 调用代码。如果你想批量评测多个模型,需要自行编写调用脚本,或者借助其他 LLM 评测框架(如 lm-evaluation-harness)来集成。
nyt-connections 的出现,填补了 LLM 评测生态中的一个空白。
长期以来,LLM 评测社区面临一个矛盾:一方面,数学和代码评测基准(Math、HumanEval 等)已经接近饱和,头部模型在这些基准上的得分趋于 100%,难以继续作为区分模型能力的标尺;另一方面,语义理解、常识推理、多义消解等「软能力」缺乏高质量的量化评测手段。Connections 谜题以其天然的语义歧义性和文化依赖性,恰好提供了一种介于「有标准答案」和「纯主观评价」之间的评测场景。
排行榜的数据也揭示了一个更深的趋势:推理能力正在成为大模型的「第二战场」。 扩展版排行榜中,推理档位之间的巨大得分差异,驱动着各厂商持续在 CoT(Chain-of-Thought)推理、Self-Verification(自我验证)等方向上投入研发。从 Gemini 3.1 到 GPT-5.6,从 Claude Opus 到 Kimi K2,各家的推理增强方案正在以极快的速度迭代——排行榜的排名变化频率本身就是一个佐证。
对于 AI 研究者和开发者而言,nyt-connections 提供了一个低成本的语义推理能力诊断工具。你可以用它快速定位自己部署的模型在语义歧义场景下的薄弱环节,也可以用它对比不同模型版本的改进幅度。它不是万能的,但在「语义联想」这个细分维度上,它是目前最系统的评测方案之一。
项目信息:lechmazur/nyt-connections | ⭐ 228 | Python | 无容器化 | 无 Web UI
核心价值:940道扩展版纽约时报Connections谜题,系统评估LLM在语义联想与歧义消解方面的推理能力,是目前最全面的模型语义理解评测基准之一。