Twitter Tweet Scraper
一条公开 X 帖子把正文和发布时间与作者、媒体、话题标签、提及、可见互动及会话关系连接起来。为已知链接保存这组信息,可以补全帖子目录、审核集合和分时点表现记录。
主要特性
- 精确解析 status 链接解析一个或多个公开 x.com 或 twitter.com 链接,路径中必须包含数字 status ID。
- 帖子与作者上下文返回规范帖子 ID 与地址、完整正文、语言、发布时间,以及作者的公开身份和主页地址。
- 互动、媒体与实体将点赞、回复、转帖、引用、浏览、收藏、媒体引用、话题标签和提及保存在帖子旁。
- 会话与来源上下文保留回复、会话、引用、转帖、来源和提交链接标识,使指定帖子始终可追溯。
参数
| 参数 | 必填 | 描述 |
|---|---|---|
urls | 必填 | 必填的公开 x.com 或 twitter.com status 链接列表。每个链接的 /status/ 路径都必须包含数字帖子 ID。 |
如何使用
先校验帖子链接,再通过一个异步查询任务解析准确的 status 记录。
- 确认每个公开 x.com 或 twitter.com 链接都包含 /status/{数字ID}。
- 向 /v1/x/posts POST 校验后的 urls 数组,并保存返回的 task_id。
- 轮询 /v1/tasks/{task_id},直到查询成功或失败。
- 任务完成后取得 data.results.items,并沿 next_cursor 读取到 has_more 变为 false。
curl -X POST "https://api.socq.ai/v1/x/posts" \
-H "Authorization: Bearer $SOCQ_API_KEY" \
-H "Content-Type: application/json" \
-d '{"urls":["https://x.com/OpenAI/status/1950240351547248941"]}'
# 轮询 GET /v1/tasks/{task_id}
# 读取 data.results.items,并在 has_more 为 true 时继续使用 next_cursor最佳使用场景
- 补全帖子链接目录: 为已有 X 链接补充可搜索正文、作者身份、媒体引用、实体、发布时间和稳定帖子 ID。
- 记录活动帖子: 为确认过的活动链接保存准确正文、作者、媒体、关系上下文和采集时互动。
- 比较指定帖子快照: 按设定时间重复解析同一批帖子 ID,并通过 collected_at 比较点赞、回复、转帖、引用、浏览和收藏。
使用建议
- 提交前拒绝没有数字 /status/ ID 的链接,避免把主页或搜索链接放入查询批次。
- 从 x.com 与 twitter.com 链接中提取帖子 ID,并按 ID 而不是完整 URL 字符串去重。
- 比较互动时始终配合 collected_at,因为公开计数会在查询后继续变化。
- 存储不同类型帖子时,允许媒体数组和回复、引用、转帖标识为空。
相关 API
需要其他类型的 X 公开数据时,可以使用以下 API。
- Twitter Profile Scraper API — 按 username 获取公开账号身份、简介、头像、封面、账号状态和可见受众统计。
- Twitter User Tweets Scraper API — 按 username 采集近期公开帖子、作者、媒体、标签、提及和互动指标,并排除回复。
- Twitter Search API — 按搜索表达式查找公开帖子,并支持 latest 或 top 排序和结果数量上限。