Криптовалюты

На Hugging Face выложили метаданные 5,6 млрд публичных видео TikTok

Разработчик hashfunction опубликовал бесплатный набор данных размером 460 ГБ. TikTok запрещает автоматический сбор данных без письменного разрешения

Один основной источник · Как мы проверяем новости

На Hugging Face выложили метаданные 5,6 млрд публичных видео TikTok
Иллюстрация к материалу RedBTC News

Что произошло

Разработчик под псевдонимом hashfunction опубликовал под аккаунтом datasocial на Hugging Face метаданные примерно 5,6 млрд публичных видео TikTok. Набор можно скачать бесплатно.

В нём нет самих видеозаписей. Каждая запись содержит данные о публикации, включая подпись, хэштеги, идентификатор звука, текст на экране, сведения о TikTok Shop и показатели вовлечённости.

Что вошло в набор

Объём набора составляет 460 ГБ: он представлен файлами Parquet, отдельными для каждого месяца. В данных также есть отметки TikTok о том, был ли ролик помечен как созданный с помощью AI и исключён ли он из ленты For You.

Для старых видео отметка об AI часто отсутствует, поскольку они взяты из архива.

Почему это важно

Подобные данные могут использоваться разработчиками AI для моделей, которые прогнозируют вирусность публикаций и продажи в TikTok Shop, анализируют эффективные слова и фразы, а также учатся на стиле общения пользователей в коротких видео.

Официальный доступ TikTok к таким данным ограничен. Research Tools предназначены для соответствующих требованиям исследователей из академических учреждений в США, ЕЭЗ, Великобритании, Канаде и Швейцарии, а также для некоторых некоммерческих организаций в ЕС; для доступа нужны заявка и одобрение.

Правовые ограничения и способ сбора

TikTok запрещает широкий автоматизированный сбор данных. Раздел 3.4 американских условий использования платформы запрещает извлекать данные с помощью автоматизированного программного обеспечения без письменного разрешения TikTok.

В описании DataSocial говорится, что доступ к закрытому мобильному API TikTok обеспечивался с помощью сгенерированных идентификаторов устройств, имитировавших Android-смартфоны, восстановленных подписей запросов и поддельного TLS-рукопожатия. По этому описанию, за три недели система собрала 3,23 млрд профилей авторов, 5,94 млрд видео и 2,8 млрд комментариев без использования входа в аккаунт.

Сбор данных уже становится предметом судебных споров. В октябре 2025 года Reddit подал иск против Perplexity и трёх компаний, связанных со сбором данных, заявив о масштабной схеме использования его контента для обучения AI. В июле федеральный суд в основном отказался прекращать дело. TikTok в этом споре не участвует.

Advertisement

Источники

Один основной источник. Как мы проверяем новости

  1. decrypt.co