Битва скрепперов и сайтов. Зачем вообще прятать данные?

· Paul Kolomiets

На этой неделе у меня было путешествие в чудесную страну ToS и публичный контент который одновременно можно и нельзя использовать. Я решил не писать скучный отчет о том, что делал и что не получилось.

Давайте лучше вместе подумаем о том, как мы оказались в такой ситуации. Это конечно странная привычка читать юридические документы, ну уж простите мне такую блажь. Сайты защищают контент. На практике скорее боятся потерять контроль над способом доступа к нему. Данные могут быть публично доступны человеку в браузере, но существует запрет получать те же данные автоматически.

Возможность альтернативного доступа ломает рекламу, аналитику как источник данных о пользователях, отчасти платные функции.

Если хочется конкретного примера, можно сдуть пыль с дела hiQ v. LinkedIn. Если кратко, аргумент о том, что данные публичны, и соответственно должны быть доступны для любых клиентов, был нивелирован по той логике, что ToS как договор с конечным пользователем более важен. И если владелец данных установил ограничения, что поделаешь.

Я намеренно упрощаю юридические выводы. Если вам важно разбираться в ситуации лучше, пожалуйста потратьте дополнительное время на это. Юридическая формулировка гораздо менее однозначна.

С тех пор так и живем. Вроде все можно и в то же время все нельзя.

Смешно. И все было бы хорошо, пока не появились роботы. Сценарии с использованием искусственного интеллекта не вписываются в эту картину. Допустим ваш агент действует совместно с вами, воздерживаясь от нарушений ToS. Например, пассивно собирает информацию пока вы самостоятельно смотрите страницы сайта.

Что вы будете вряд ли делать. Это абсурдный пример законопослушного агента. Вручную просмотреть несколько сотен страниц, чтобы набрать нужное количество данных для анализа, по меньшей мере утомительно.

Тем не менее даже если делать все правильно, все равно ваш паттерн действий поменялся. Вы запрашиваете больше данных, проводите меньше времени на каждой странице, реклама игнорируется. Большинство факторов из-за которых вводятся ограничения ToS, вспомним что я говорил в начале, нарушаются для категории пользователей активно пользующихся AI ботами.

А что еще более важно, это также работает для категории пользователей которые доверяют AI поиску. И если первую категорию компании могут проигнорировать, то вторую — нет, она гораздо более обширная и, в принципе, может не взаимодействовать с сайтом. Большинство ответов они могут получить не глядя в ленту.

Если этот фактор сработает, можно ожидать либо ослабления требований ToS, либо больше договоров между поисковыми системами и крупными поставщиками контента. По типу того, что происходит между Reddit и Google.

Я верю в то, что второй сценарий упрется либо в монопольную позицию поисковика и меры регулятора, либо окажется слишком невыгодным для поставщиков контента. Хочется верить, что мы прейдем не к новым вариантам заработка на контенте вместо еще более закрытой системы.

Потенциал для изменения ситуации я вижу в единственном факторе. А именно платный доступ. Если платный профиль будет означать расширенные права для AI ботов по сбору информации, это может быть достаточным альтернативой как для поставщиков контента, так и для продвинутых пользователей.

Возможно, мои прогнозы выглядят странно. Наверное мой хрустальный шар сегодня немного сбоит. В конце давайте я еще раз подчеркну самое важное как я считаю. Модель действий пользователя меняется. И это изменение заставить сайты адаптироваться. Очень вероятно что в направлении большей открытости.

Если похожая идея или задача у вас в работе — подробнее обо мне или напишите. В худшем случае у нас будет просто интересная тема для обсуждения, и каждый вернётся к своему коду.