Ворклог по задаче "Добавить мультиязычность"
Гипотеза: открытый Web снова станет конкурентным преимуществом
Последние примерно пятнадцать лет развитие веб-инфраструктуры двигалось в сторону всё большего ограничения машинного доступа.
Причины были вполне рациональными. Боты создавали нагрузку, парсили контент, искали уязвимости, занимались спамом, копировали базы, собирали цены, создавали фальшивые аккаунты. В ответ сайты постепенно обрастали CDN, WAF, rate limits, JavaScript challenges, fingerprinting, CAPTCHA, антискрейпингом и поведенческим анализом.
В результате возник парадокс современного интернета:
Мы создали Всемирную паутину для свободного связывания и распространения информации, а затем потратили двадцать лет на то, чтобы сделать эту информацию максимально неудобной для автоматического чтения.
Для Web, в котором основным потребителем страницы был человек с браузером, это имело смысл.
Я предполагаю, что с появлением AI этот баланс начинает меняться.
Бот перестаёт быть только паразитом
В старой экономике публичного сайта существовало довольно простое разделение:
Human → хороший посетительSearch crawler → терпим, потому что приводит humansOther bot → плохой посетитель
У последнего практически не было экономической ценности.
Он забирал страницу, потреблял CPU и bandwidth и ничего не покупал.
Поэтому естественная инженерная стратегия:
не пускать.
Но AI создаёт совершенно новый класс машинного потребителя.
AI crawler может читать сайт не для того, чтобы показать его владельцу украденную копию страницы, а для того, чтобы впоследствии ответить человеку:
Куда съездить из Далата на один день?
Чем porter отличается от stout?
Как правильно пользоваться финской сауной?
И если значительная часть человеческого поиска действительно перемещается из списка ссылок в диалог с AI, происходит принципиальная вещь:
бот становится посредником между издателем и человеком.
Получается:
Старый Web:Publisher ↓Google ↓SERP ↓Human ↓WebsiteAI Web:Publisher ↓Machine ↓understanding / synthesis ↓Human
И тогда запрос AI-бота уже нельзя автоматически считать бесполезным трафиком.
Возможно, это верхняя часть новой воронки привлечения пользователя.
Отсюда возникает парадокс
Индустрия потратила огромные деньги на создание инфраструктуры, прекрасно приспособленной для защиты информации от машин, ровно в тот момент, когда машины начинают становиться одним из основных способов потребления информации.
Причём лучшие и наиболее коммерчески успешные сайты часто защищены сильнее остальных.
Cloudflare, WAF, bot protection, dynamic rendering, authorization walls, rate limiting, JavaScript challenges.
В старой модели это преимущество.
В новой модели для публичного информационного ресурса часть этой инфраструктуры потенциально превращается в distribution handicap.
Самое абсурдное состояние может выглядеть так:
У компании лучший контент в отрасли, но AI знает конкурента лучше, потому что сайт конкурента проще читать.
Не потому, что конкурент лучше оптимизировал keywords.
Не потому, что у него больше backlinks.
А потому, что его знания физически доступны машине.
Второй парадокс: сайты научились дорого отдавать дешёвую информацию
Есть ещё одна проблема, которую я считаю существенной.
Современная веб-разработка много лет оптимизировалась под человеческую сессию.
Один человек открывает страницу, читает её десять секунд, кликает следующую.
Поэтому никого особенно не беспокоит, что получение одной страницы запускает:
SSR↓application server↓5 API calls↓15 database queries↓personalization↓analytics↓third-party services↓render
Человек физически медленный.
AI crawler — нет.
Он способен сказать серверу:
GET page 1GET page 2GET page 3GET page 4GET page 5...
несколько раз в секунду и продолжать это часами.
И неожиданно выясняется, что архитектура, прекрасно обслуживавшая 1000 людей, плохо обслуживает одного очень любознательного робота.
Поэтому просто сказать:
«Хорошо, завтра выключаем Cloudflare protection и разрешаем AI crawlers»
может оказаться невозможно.
За годы существования закрытого Web многие системы потеряли экономическую способность быть открытыми.
Моя ставка противоположная
Для публичных knowledge/content проектов я сознательно считаю массовое машинное чтение желательным поведением.
Поэтому архитектура должна исходить из предположения:
Мой сайт могут читать не тысячи людей, а миллионы машинных запросов. И это хорошо.
Следовательно, marginal cost выдачи публичного знания должен стремиться к нулю.
Если crawler хочет прочитать тысячу страниц — пусть читает.
Если несколько независимых AI-систем хотят одновременно скачать десять языковых версий одной энциклопедии — прекрасно.
Это не DDoS, пока поведение остаётся разумным и инфраструктура его выдерживает.
Это distribution.
VietnamGuru — первый эксперимент
14 августа 2026 года я опубликовал новый международный домен vietnamguru.travel.
Домен новый.
При этом я сознательно сделал его максимально простым для машинного исследования:
- обычные индексируемые URL;
- server-rendered HTML;
- нормальные
<a href>; - sitemap;
- canonical;
- hreflang;
- открытые языковые версии;
- связь со старым
vietnamguru.ru; - отсутствие искусственных препятствий для нормальных crawlers.
И практически сразу после публикации различные AI crawlers начали исследовать новый домен.
Некоторые делают несколько запросов в секунду и систематически проходят связанные страницы и языковые версии.
Я не пытаюсь остановить это поведение.
Наоборот, я считаю его первым наблюдаемым подтверждением того, что новый канал распространения действительно существует.
При этом весь проект работает на совершенно обычной инфраструктуре: небольшой сервер DigitalOcean с 4 CPU и 8 GB RAM при таком crawling остаётся далеко от предела производительности.
Это тоже часть эксперимента.
Моя ставка заключается не только в том, что нужно разрешить машинам читать.
Она заключается ещё и в том, что:
публичный knowledge resource должен быть настолько дешёвым в обслуживании, чтобы ему было экономически выгодно позволять машинам читать себя агрессивно.
Но crawling сам по себе ничего не доказывает
Это принципиальная оговорка.
Сегодня я наблюдаю только:
Discovery.
Мне ещё предстоит проверить следующие стадии:
Discovery ↓Crawling ↓Understanding ↓Retrieval ↓Citation ↓Recommendation
Сам факт прихода GPTBot, PerplexityBot или любого другого crawler не означает, что сайт получит аудиторию.
Поэтому эксперимент должен продолжаться.
Следующий интересный вопрос:
Через какое время после запуска совершенно нового домена независимые AI-системы смогут правильно отвечать на вопросы, используя информацию с него?
Ещё более сильный тест:
Когда они начнут использовать его по небрендовым запросам?
Не:
What is VietnamGuru?
а:
What waterfalls near Da Lat are worth visiting?
И наконец самый интересный уровень:
Когда AI начнёт самостоятельно считать ресурс достаточно полезным, чтобы рекомендовать его или использовать как evidence среди других источников?
Если гипотеза подтвердится
Тогда изменится само понятие оптимизации публичного сайта.
В предыдущем поколении существовало SEO:
помоги поисковой машине найти страницу, чтобы она привела на неё человека.
В следующем может появиться более фундаментальная задача:
помоги машине получить, понять, проверить и связать твои знания, чтобы она могла использовать их при решении задачи человека.
Это уже не совсем SEO.
И даже не обязательно GEO/AEO в сегодняшнем маркетинговом понимании.
Это machine accessibility как свойство информационной системы.
Тогда конкурентными характеристиками становятся:
доступностьструктурностьсвязностьсемантическая ясностьскоростьстабильные URLдешёвое массовое чтениеprovenanceактуальность
То есть многие чрезвычайно скучные инженерные свойства внезапно становятся свойствами дистрибуции.
И здесь появляется ещё один парадокс
В старом Web ценность сайта частично измерялась количеством людей, которых удалось заставить прийти на сайт.
AI может разрушить эту метрику.
Человек может никогда не открыть vietnamguru.travel.
Он спросит своего агента:
Стоит ли ехать в Далат в августе?
А агент прочитает VietnamGuru, сопоставит его с погодой, отзывами, расписанием транспорта и ещё пятью источниками и даст человеку ответ.
С точки зрения Google Analytics:
0 visitors.
С точки зрения реального влияния:
VietnamGuru участвовал в принятии решения.
Получается довольно забавная ситуация:
успешный информационный сайт будущего потенциально может становиться влиятельнее одновременно с уменьшением доли людей, непосредственно посещающих его страницы.
И тогда многие сегодняшние Web-метрики начинают измерять не то.
Более общая ставка
Моя гипотеза поэтому не про VietnamGuru и не про конкретных AI-crawlers.
Она такая:
По мере перехода от human-browsed Web к AI-mediated Web способность публичной информационной системы быть свободно, массово и дёшево прочитанной машинами станет конкурентным преимуществом.
Сегодня значительная часть индустрии по инерции считает bot traffic расходом или угрозой.
Я предполагаю, что для публичных knowledge resources часть этого traffic станет каналом распространения.
Поэтому возникает временное окно.
Пока другие владельцы контента спрашивают:
Как запретить AI забирать мой контент?
я хочу проверить противоположный вопрос:
Что произойдёт, если сделать свой knowledge corpus одним из самых удобных мест для AI, желающего разобраться в моей предметной области?
Возможно, ничего.
Возможно, AI-платформы построят совершенно другие механизмы получения knowledge.
Возможно, publishers действительно закроются и возникнет экономика лицензирования.
Возможно, сегодняшние crawlers через год вообще исчезнут.
Это эксперимент, а не установленный факт.
Но моя ставка на август 2026 года проста:
Если машины становятся новым интерфейсом человека к интернету, воевать с каждой машиной только потому, что она машина, — возможно, одна из последних привычек уходящего Web.
И я сознательно ставлю на противоположное:
Для публичного знания открытость снова станет преимуществом.