Reddit Comments
Reddit 评论是帖子讨论中的公开回复,包含正文、作者身份、来源帖子与父评论关系、社区信息、时间以及可见的投票和回复数。将这些字段结合起来,可以分析公开响应、映射已返回的回复关系、归档带来源的评论并进行分时点比较。
主要特性
- 采集指定讨论中的评论接受受支持的 Reddit 帖子 URL 或 redd.it 短链,并返回该讨论所提供的公开评论记录。
- 评论内容与作者身份将每条可用的评论 ID、公开 URL、正文和作者标识分别整理为标准化记录。
- 来源帖子与回复关系返回 post_id、post_url、parent_comment_id、community_name 和 input_url,用于关联评论的来源及已返回评论之间的关系。
- 可见响应快照将 upvotes_count、replies_count、created_at 和 collected_at 一同保留,以区分发布时间与观察时间。
参数
| 参数 | 必填 | 描述 |
|---|---|---|
urls | 必填 | 必填的公开 Reddit 帖子 URL 列表;可使用受支持 Reddit 域名下的 /r/{subreddit}/comments/{post_id} 路径或 redd.it 短链。 |
如何使用
提交公开 Reddit 帖子 URL,跟踪异步任务,并使用 cursor 分页读取标准化评论记录。
- 准备一个或多个受支持的公开 Reddit 帖子 URL 或 redd.it 短链。
- 将链接作为 urls 提交到 /v1/reddit/comments,并保存返回的 task_id。
- 轮询 /v1/tasks/{task_id},直到任务成功或返回失败。
- 读取 data.results.items;当 has_more 为 true 时,使用返回的 next_cursor 继续请求。
curl -X POST "https://api.socq.ai/v1/reddit/comments" \
-H "Authorization: Bearer $SOCQ_API_KEY" \
-H "Content-Type: application/json" \
-d '{"urls":["https://www.reddit.com/r/example/comments/post_id/example_post/"]}'
# 轮询 GET /v1/tasks/{task_id}
# 读取 data.results.items;has_more 为 true 时继续使用 next_cursor最佳使用场景
- 审阅讨论中的具体响应: 结合评论正文和可用的作者字段,识别选定讨论中的观点、问题与重复出现的反应。
- 映射已返回的回复关系: 通过评论 ID 和 parent_comment_id 连接结果中实际存在的回复,而不假设已经采集完整讨论树。
- 归档带来源的评论: 保留评论 URL、post_id、post_url、community_name 和时间,让每条回复都带有可追溯的讨论上下文。
- 比较分时点响应: 使用 upvotes_count 和 replies_count 比较已返回评论,并通过 collected_at 标记每次观察。
使用建议
- 批量提交前先解析 redd.it 短链并按来源帖子去重,避免用不同形式的 URL 重复提交同一讨论。
- 不要传入 results_limit;这个 endpoint 会拒绝该参数,并保存每个受支持帖子 URL 返回的评论。
- 只使用 parent_comment_id 关联结果中实际存在的记录,因为该字段不保证结果包含完整讨论深度。
- 当公开来源省略相应数据时,允许正文、作者字段、parent_comment_id、community_name、时间和指标为 null。
- 持续使用 next_cursor 请求结果,直到 has_more 为 false,避免在 API 结果分页边界遗漏已完成任务中的评论。
相关 API
需要其他类型的 Reddit 公开数据时,可以使用以下 API。
- Reddit Posts API — 从受支持的 Reddit URL 采集公开帖子正文、作者、社区信息、媒体、时间和可见互动指标。
- Reddit Subreddit Posts API — 通过 subreddit URL 按 new、top 或 hot 排序发现公开帖子,设置每个社区的结果上限,并返回标准化社区与互动信息。
- Reddit Search API — 通过文本 query 和发布时间窗口搜索公开 Reddit 帖子,返回标准化内容、作者、社区信息、时间、媒体和可见互动指标。