Một nhà phát triển đăng miễn phí siêu dữ liệu 5,6 tỷ video TikTok, thu thập qua API riêng trái điều khoản nền tảng, đồng thời bán công cụ thu thập giá 1.699 USD.
Một nhà phát triển dùng biệt danh hashfunction vừa đăng siêu dữ liệu (metadata) của khoảng 5,6 tỷ video TikTok công khai lên kho lưu trữ trí tuệ nhân tạo (AI) mã nguồn mở Hugging Face, cho phép tải xuống miễn phí. Dữ liệu được thu thập tự động thông qua giao diện lập trình ứng dụng không công khai của TikTok, theo cách mà điều khoản sử dụng của nền tảng này không cho phép.
Dữ liệu miễn phí, dịch vụ thương mại và vùng xám pháp lý
Bộ dữ liệu được đăng dưới tài khoản datasocial, bao phủ giai đoạn từ tháng 7/2014 đến tháng 10/2026, dung lượng khoảng 460 GB, lưu dưới dạng tệp Parquet, mỗi tháng một tệp. Đây là siêu dữ liệu chứ không phải nội dung video. Mỗi dòng gồm chú thích, hashtag, mã âm thanh, văn bản trên màn hình, mã sản phẩm và mã người bán trên TikTok Shop, cùng các chỉ số lượt xem, thích, bình luận, chia sẻ, lưu và tải xuống.
Một số trường dùng chính nhãn của TikTok, như đánh dấu nội dung do AI tạo ra hoặc việc video bị loại khỏi trang Dành cho bạn. Bộ dữ liệu không hạn chế quyền truy cập và Hugging Face ghi nhận 1.181 lượt tải xuống.
Giá trị của dữ liệu nằm ở nhu cầu từ các nhà phát triển AI. Chú thích, hashtag, mã âm thanh và chỉ số tương tác từ hàng tỷ bài đăng có thể làm đầu vào cho mô hình dự đoán nội dung lan truyền, sản phẩm bán chạy trên TikTok Shop, hay cách diễn đạt thu hút người dùng, cũng như cho mô hình ngôn ngữ học cách giao tiếp trong môi trường video ngắn.
Trong khi đó, kênh chính thức của TikTok hạn chế hơn nhiều: Bộ Công cụ Nghiên cứu chỉ dành cho nhà nghiên cứu đủ điều kiện tại cơ sở học thuật ở Mỹ, Khu vực Kinh tế châu Âu (EEA), Anh, Canada, Thụy Sĩ và một số tổ chức phi lợi nhuận tại EU, kèm thủ tục nộp đơn và phê duyệt. Mục 3.4 điều khoản dịch vụ của TikTok tại Mỹ cũng cấm dùng phần mềm tự động để trích xuất dữ liệu nếu không có văn bản chấp thuận.
Theo DataSocial, hệ thống tạo ra các danh tính thiết bị giả lập điện thoại Android, dùng chữ ký yêu cầu được thiết kế ngược và giả lập quy trình bắt tay TLS, không cần đăng nhập. Trong ba tuần, hệ thống thu thập 3,23 tỷ hồ sơ nhà sáng tạo, 5,94 tỷ video và 2,8 tỷ bình luận.
Gói miễn phí đồng thời là kênh dẫn khách. Dữ liệu theo giấy phép CC BY-NC 4.0, miễn phí cho nghiên cứu và cá nhân; sử dụng thương mại, hồ sơ nhà sáng tạo và cập nhật hằng ngày chuyển sang dịch vụ tại datasocial.ai, còn mã nguồn công cụ thu thập được bán riêng với giá 1.699 USD. Bộ dữ liệu không có cột tên tài khoản, nhưng user ID thực tế vẫn truy cập được qua DataSocial. Trên Hugging Face cũng có bản sao của bộ dữ liệu 4,5 tỷ video, được mô tả là thu thập từ API di động của TikTok.
Về pháp lý, tháng 10/2025 Reddit kiện Perplexity cùng ba công ty thu thập dữ liệu, cáo buộc thu thập ở “quy mô công nghiệp” phục vụ huấn luyện AI. Theo Law360, tháng 7 một thẩm phán liên bang phần lớn bác bỏ yêu cầu đình chỉ vụ kiện, trong đó các khiếu kiện theo Đạo luật Bản quyền Thiên niên kỷ Kỹ thuật số (DMCA) vẫn được xem xét. TikTok không phải bên liên quan, và vụ việc gắn với dữ liệu từ Google Search chứ không phải API di động.


































































