Логотип
Программирование учит терпению, а баги — смирению. (автор не известен)

Kernel.org борется с ИИ-краулерами, генерирующими миллионы запросов в день

Kernel.org борется с ИИ-краулерами, генерирующими миллионы запросов в день

ИИ-краулеры создают всё большую нагрузку на инфраструктуру Kernel.org, поскольку проект теперь использует около 20% общей вычислительной мощности процессора только для обработки автоматических парсеров.

Константин Рябицев, который помогает поддерживать инфраструктуру Kernel.org, говорит, что git.kernel.org получает около 6 миллионов запросов в день на страницы с информацией об отдельных коммитах. Proof-of-work Anubis блокирует примерно две трети запросов, но многие из них все же проходят.

Как и следовало ожидать, это оказывает большое влияние. Kernel.org использует 90 процессорных ядер в пяти локациях, и от 14 до 16 из них постоянно заняты преобразованием коммитов Git в HTML для парсеров.

«Мы тратим больше процессорных циклов на рендеринг коммитов для парсеров, чем на все остальные виды легитимного доступа, включая клонирование git».

 

ИИ-краулеры тратят больше ресурсов процессора, чем пользователи Git.

 

Вызывает досаду то, что данные, которые они собирают, уже доступны через Git. Вместо того чтобы клонировать репозитории и работать с ними локально, многие краулеры запрашивают каждую страницу коммитов по отдельности.

Проблема усугубляется тем, как устроен git.kernel.org. В основном репозитории Linux около 1,48 миллиона коммитов, а на сайте размещены сотни форков. Из-за разнообразия представлений коммитов, патчей, различий и обычного текста существует огромное количество URL-адресов, доступных для поисковых роботов.

Kernel.org пробовал разные способы контроля трафика, например блокировку определенных IP-адресов и сетей. Однако эти меры стали менее эффективными, когда поисковые роботы начали использовать резидентные и мобильные прокси-сети.

Позже команда запустила Anubis, который заставляет посетителей решать небольшую задачу на доказательство выполнения работы, прежде чем они смогут воспользоваться сайтом. К сожалению, как и следовало ожидать, поисковые роботы быстро адаптировались и начали решать еще более сложные задачи.

Читать  Как освоить сопоставление строк с образцами, используя классы символов Bash

В связи с этим Kernel.org рассматривает более радикальный подход. Они могут сократить количество URL-адресов, доступных для сканирования, и ограничить ресурсоемкие действия для анонимных пользователей. Разумеется, репозитории ядра Linux и данные для разработки по-прежнему будут открыты для общественности.

 

Подробнее см. пост Рябицева.

Если вы нашли ошибку, пожалуйста, выделите фрагмент текста и нажмите Ctrl+Enter.

Редактор: AndreyEx

Рейтинг: 5 (1 голос)
Если статья понравилась, то поделитесь ей в социальных сетях:

Оставить комментарий

Ваш адрес email не будет опубликован. Обязательные поля помечены *

16 + 13 =

Это может быть вам интересно


Спасибо!

Теперь редакторы в курсе.

Прокрутить страницу до начала