reddit-ai-trends
AI Reddit 趋势追踪:自动扫描中英文 AI 社区热门帖子,DeepSeek R1 分析生成每日报告
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
AI Reddit 趋势追踪:自动扫描中英文 AI 社区热门帖子,DeepSeek R1 分析生成每日报告
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
你有没有过这样的经历?刷到一条新闻说「某公司发布了颠覆性的 AI 模型」,激动地点进去,却发现消息已经过时了两周?或者在 Reddit 上看到一篇讨论帖,但帖子里的链接、视频、评论散落各处,根本没法拼凑出完整的图景?
reddit-ai-trends 就是来解决这个问题的。它是一个自动化工具,每天早 6 点(美国中部时间)自动抓取 Reddit 上 AI 相关社区的热门帖子,用 DeepSeek R1 分析每一条帖子的内容——包括正文、图片、甚至 YouTube 视频的字幕——然后生成一份结构化的趋势报告。报告里不仅有当天的热点排行榜,还有本周最热门的帖子汇总、月度技术演进对比,堪称 Reddit 上的 AI 情报站。

图1:项目作者 liyedanpdx 的 GitHub 头像
Reddit 是全球最大的技术社区之一,尤其是 AI 领域,r/LocalLLaMA、r/MachineLearning、r/singularity 等社区聚集了大量的一线研究者和开发者。相比于媒体报道,Reddit 上的讨论往往更及时、更深入、更接近技术真相——但代价是信息极度碎片化。
这个项目的作者 liyedanpdx 是一位独立开发者,关注 AI 领域但苦于没有时间去逛多个社区。他在 2024 年初创建了这个项目,最初只是简单地爬取帖子标题做排名,后来逐渐加入了 LLM 分析、图片理解、多模态内容处理等功能。2025 年 10 月的大更新中,项目引入了 YouTube 视频字幕提取、Web 页面内容抓取(通过 Firecrawl)等能力,完成了从「简单聚合」到「深度情报分析」的进化。
项目采用 Clean Architecture 模式组织 Reddit 数据采集模块,代码结构清晰分层:
services/reddit_collection/collector.py:数据采集器,支持按优先级抓取不同社区的帖子(LocalLLaMA、MachineLearning、singularity 等高优先级社区抓取 Top 30,其他中优先级社区抓取 Top 10)services/llm_processing/report_processor.py:LLM 报告处理器,调用 DeepSeek R1 生成结构化报告services/image_analyzer.py:图片分析模块,支持 Qwen-VL、Gemini 等多视觉模型backfill/backfill_reports.py:历史数据回填工具,可指定日期范围批量生成历史报告这是项目最有技术含量的部分。当一个帖子包含图片时,工具会自动调用视觉模型(默认 Qwen-VL,通过 OpenRouter 免费端点)分析图片内容;当帖子链接到 YouTube 视频时,自动提取视频字幕并用 DeepSeek 总结关键信息;当帖子包含外部链接时,调用 Firecrawl API 抓取网页全文再进行摘要。
所有这些多模态分析结果都会缓存在 MongoDB 中,避免重复调用 API 节省费用。这是 2025 年 10 月更新的核心改进点。
项目支持英文和中文两种报告语言,报告按 reports/YYYY/MM/DD/ 目录结构存储,包含当日热点、每周热门、月度趋势等多个维度。最新报告每日自动更新到 README 文件中,方便直接访问。
工具不绑定任何单一 API 提供商,支持 Groq 和 OpenRouter 两种渠道。OpenRouter 模式下默认使用 DeepSeek R1(免费端点),也支持 Gemini、Qwen 等数十种模型,可根据需求自由切换。
整个项目用 Python 实现,主要依赖:
架构上属于典型的脚本型工具(report_generation.py 是入口,支持 --schedule 定时模式和一次性 --date 指定日期模式),没有复杂的 Web 框架,部署门槛低,但也不提供实时 Web 界面。
MongoDB 在项目中扮演重要角色——不仅是缓存层,还存储历史帖子数据,支持长期趋势分析。docker-compose.yml 配置了 network_mode: host,容器直接使用宿主机网络来连接外部 MongoDB 实例(默认 localhost:27017)。
项目提供了 Dockerfile(基于 python:3.9-slim)和 docker-compose.yml,克隆后配置 .env 文件即可运行。但实际部署有以下几个需要注意的点:
network_mode: host,意味着容器直接暴露在宿主机网络中,不适合多容器协作场景整体部署难度评级为「简单」,有 Docker 经验的用户 10-15 分钟可完成配置。
项目不是完美的,存在一些值得注意的问题:
这个项目代表了一个趋势——用 LLM 来做信息聚合和趋势分析。随着 DeepSeek R1、Qwen 等推理/多模态模型的能力提升,「让 AI 帮你读 Reddit」已经从极客玩具变成了实用的情报工具。
项目目前 843 Stars、81 Forks,增长曲线稳健(growth_trend_score: 44.51),说明确实有人在持续使用。它不需要 GPU,不需要复杂的 MLOps 流程,一个人用一台普通服务器就能跑——这正是 AI 情报工具应该有的样子。