一位名为 hashfunction 的开发人员在开源 AI 存储库 Hugging Face 上发布了约 56 亿个公共 TikTok 视频的元数据,可供免费下载。该数据集在 datasocial 帐户下发布,运行时间为 2014 年 7 月至 2026 年 10 月。

这是元数据,而不是镜头。每行都包含标题、主题标签、声音 ID、屏幕文本、TikTok Shop 产品和卖家 ID,并计算观看次数、点赞、评论、分享、保存和下载次数。整个过程是 460 GB 的 Parquet 文件,每月一个。

有些字段是 TikTok 自己的标签:视频是否被标记为人工智能生成,以及 TikTok 是否将其从 For You 页面中删除。对于来自存档的较旧视频,AI 标志通常为空。

该数据集没有门控,因此任何人都可以提取它。 Hugging Face 的计数器显示迄今为止下载量为 1,181 次。也可以在 https://datasocial.ai/ 上在线获取

为什么有人应该关心?因为人工智能开发者想要这种数据,而 TikTok 却让他们很难获得。数十亿条帖子的标题、主题标签、声音 ID 和参与度是模型的原材料,这些模型可以预测哪些内容会在 TikTok 商店上疯传,哪些内容会畅销,哪些单词和短语会点击,哪些不会点击,也可以作为学习人们如何在短视频中写作的语言模型的原材料。

TikTok 获取数据的官方途径要窄得多。其研究工具向美国、欧洲经济区、英国、加拿大和瑞士等地区的学术机构以及欧盟的一些非营利机构的合格研究人员开放,并需要申请和批准。

该平台不允许广泛的数据抓取。 TikTok 美国服务条款第 3.4 条禁止使用自动化软件从平台提取数据,除非 TikTok 书面批准。

DataSocial 的文章描述了通过生成的作为 Android 手机传递的设备身份、逆向工程请求签名和欺骗性 TLS 握手来访问 TikTok 的私有移动 API。据称,该系统在三周内收集了 32.3 亿个创作者个人资料、59.4 亿个视频和 28 亿条评论。据报道称,没有涉及任何登录或帐户。

免费层兼作店面。许可证是CC BY-NC 4.0,卡上写着它可以免费用于研究和个人使用。商业用途、创作者资料和每日更新均路由至 datasocial.ai,并且抓取工具的源代码单独出售。

刮抢大战已经上法庭。 Reddit 于 2025 年 10 月起诉 Perplexity 和三个数据抓取公司,指控其实施了一项“工业规模”计划,旨在收集其内容用于人工智能培训。据 Law360 报道,今年 7 月,一名联邦法官基本上拒绝驳回此案。

幸存的索赔包括 DMCA 指控 SerpApi 规避了 Google 的反机器人保护。 TikTok 不是一方,该案涉及抓取谷歌搜索结果,而不是私人移动 API。

至于数据本身,行包括标题、使用的音乐和不同的复选框。没有创建者句柄列,但它显示了大量数据和信息,包括标题、主题标签、视频中提到的人物等。也就是说,用户 ID 实际上可以在 Datasocial 中获得。

数据宝库已经有同伴了。 Hugging Face 上也有 45 亿个视频集的副本,也被描述为从 TikTok 的移动 API 收集的。

该数据可免费用于非商业用途。收集它的代码售价为 1,699 美元。