ИИ-сканер нашёл 802 пиратских канала в Telegram, половину уже снесли
Фото: Иллюстрация vpnlab.io
Исследователи из Университета штата Луизиана и Техасского университета в Арлингтоне собрали сканер, который находит пиратские видеоканалы в Telegram, пока те ещё новые, и выложили код в открытый доступ. За два месяца инструмент проверил 249 133 свежесозданных канала и пометил 802 из них как пиратские, причём большинству было меньше пяти дней. Вместе со связанными каналами и ботами в Telegram и правообладателям ушло 1101 сообщение. Через две недели 524 из них перестали открываться.
Как устроен сканер
Интересна не модель, а конвейер вокруг неё. Кандидатов находят так: у поисковика спрашивают страницы на t.me, где упоминается название фильма или сериала, а сами названия берут из публичной кинобазы, это примерно 248 тысяч фильмов и 141 тысяча сериалов. От каждого найденного канала обход идёт по ссылкам на другие каналы, на два шага в глубину. Всё, что собирается, публично: это каналы, которые может открыть любой без приглашения.
Классификацией занимается языковая модель, поднятая локально, а не облачный сервис. В исследовательской части работала модель на 27 миллиардов параметров, она определяла, является ли пост пиратским, с точностью 99,2 процента; в боевом инструменте стоит дистиллированная модель примерно на миллиард параметров с точностью 98 процентов на вопросе «да или нет». Важнее процентов именно размер. Такая модель запускается на обычном ноутбуке, а значит, весь механизм поиска, классификации и подачи жалоб больше не требует компании за спиной.
Что показала перепись экосистемы
Параллельно с боевым сканером команда описала саму экосистему, с декабря 2023 по январь 2026: 1057 каналов, около 209 тысяч постов, 19 033 уникальных названия, из них 14 632 фильма и 4401 сериал. Посты на 983 каналах набрали 4,85 миллиарда просмотров. В работе есть и оценка ущерба в 17,49 миллиарда долларов, но к этой цифре нужна пометка: она построена на допущении, что реальным просмотром считается один процент от показов, то есть это расчётная модель, а не измерение, в отличие от количества каналов.
Структура говорит больше, чем суммы. Каналы обслуживают боты, разделённые по функциям: выдача файлов, поиск, продвижение и приём загрузок от пользователей. Деньги идут через кредиты за скачивание, платные версии в лучшем качестве и встроенные платёжные механизмы Telegram. Часть торговли - вообще не фильмы, а сам доступ: общие VPN- и прокси-аккаунты, зеркала и переделанные приложения для стриминга, которые продают как услугу. Сканер считает такое поведение одним из признаков.
- Сбор данных: описаны 1057 каналов и около 209 тысяч постов, на них построена классификация пиратского поведения.
- Боевой сканер проверяет 249 133 новых канала и помечает 802 пиратских канала, 299 связанных и 108 ботов.
- Отчёты уходят в Telegram и 17 крупным правообладателям США, получение подтверждают 14 из них.
- 524 из 1101 канала недоступны, вдобавок удалена часть отдельных помеченных постов.
Почему это касается не только пиратства
Уберите тему, и останется универсальная машина для поиска публичных каналов и подачи жалоб в промышленных объёмах. Обходчик не знает, что такое пиратство; он умеет перебирать каналы и отдавать каждый классификатору. А поведение классификатора задаётся текстовым описанием того, что искать. Поменяйте описание, и тот же конвейер начнёт искать каналы про войну, протест, религию или меньшинство - с той же скоростью и за те же деньги. Код опубликован, поэтому повторить всё это стоит теперь выходных, а не бюджета.
Вторая половина результата не менее важна, чем первая: жалобы работают. Больше половины каналов исчезли за две недели без всякого суда. Это стоит помнить, когда тот же приём наведут не на фильмы. Конвейер, который выдаёт правдоподобные жалобы быстрее, чем люди успевают их проверять, превращает модерацию в игру чисел, а в ней автоматически побеждает сторона с автоматизацией.
Про точность. Двое проверяющих вручную разобрали 1000 постов и нашли четыре нормальных, помеченных как пиратские. В долях это 0,4 процента, что звучит как ничто, пока не встретится с масштабом: на четверти миллиона каналов за два месяца доли процента - это сотни ошибочных пометок, и за каждой чей-то канал. Автоматическое определение не убирает ошибку, оно просто уносит её из поля зрения.
Что из этого следует владельцу и читателю канала
Из метода вытекают два практических факта. Публичный канал находят, даже если вы его нигде не рекламировали: имена перебираются, а ссылки ведут на него откуда угодно. И канал - не архив: в работе измерили, как быстро каналы из жалоб перестают открываться, ответ измеряется днями, а не месяцами.
- Считайте публичный канал вещанием, а не закрытым пространством. Если материал опасен в чужих руках, канал для него неподходящая тара.
- Держите то, что нельзя потерять, ещё и вне платформы. Какой бы ни была причина удаления, обратный путь - это ваша собственная копия.
- Если вы зависите от чужого канала, сохраняйте нужное сейчас, а не когда ссылка перестанет открываться.
- Помните, что жалобы работают на объёме. Канал ложится и от ошибочной пометки так же легко, как от настоящей, - это довод в пользу второго канала связи с аудиторией.
Инструмент делали против экосистемы, которая действительно коммерческая и действительно большая. Цель законная, и цифры удалений показывают, что метод работает. Неудобно другое: он ровно так же работает у кого угодно ещё, и решает теперь не возможность, а то, на что его наведут.