Kernel.org борется с ИИ-краулерами, генерирующими миллионы запросов в день
ИИ-краулеры создают всё большую нагрузку на инфраструктуру Kernel.org, поскольку проект теперь использует около 20% общей вычислительной мощности процессора только для обработки автоматических парсеров.
Константин Рябицев, который помогает поддерживать инфраструктуру Kernel.org, говорит, что git.kernel.org получает около 6 миллионов запросов в день на страницы с информацией об отдельных коммитах. Proof-of-work Anubis блокирует примерно две трети запросов, но многие из них все же проходят.
Как и следовало ожидать, это оказывает большое влияние. Kernel.org использует 90 процессорных ядер в пяти локациях, и от 14 до 16 из них постоянно заняты преобразованием коммитов Git в HTML для парсеров.
«Мы тратим больше процессорных циклов на рендеринг коммитов для парсеров, чем на все остальные виды легитимного доступа, включая клонирование git».

ИИ-краулеры тратят больше ресурсов процессора, чем пользователи Git.
Вызывает досаду то, что данные, которые они собирают, уже доступны через Git. Вместо того чтобы клонировать репозитории и работать с ними локально, многие краулеры запрашивают каждую страницу коммитов по отдельности.
Проблема усугубляется тем, как устроен git.kernel.org. В основном репозитории Linux около 1,48 миллиона коммитов, а на сайте размещены сотни форков. Из-за разнообразия представлений коммитов, патчей, различий и обычного текста существует огромное количество URL-адресов, доступных для поисковых роботов.
Kernel.org пробовал разные способы контроля трафика, например блокировку определенных IP-адресов и сетей. Однако эти меры стали менее эффективными, когда поисковые роботы начали использовать резидентные и мобильные прокси-сети.
Позже команда запустила Anubis, который заставляет посетителей решать небольшую задачу на доказательство выполнения работы, прежде чем они смогут воспользоваться сайтом. К сожалению, как и следовало ожидать, поисковые роботы быстро адаптировались и начали решать еще более сложные задачи.
В связи с этим Kernel.org рассматривает более радикальный подход. Они могут сократить количество URL-адресов, доступных для сканирования, и ограничить ресурсоемкие действия для анонимных пользователей. Разумеется, репозитории ядра Linux и данные для разработки по-прежнему будут открыты для общественности.
Подробнее см. пост Рябицева.
Редактор: AndreyEx