Разметка сайта для AI-видимости: полная система Schema.org + llms.txt для попадания в ответы ChatGPT, Perplexity и AI Overviews

Обложка статьи о разметке Schema.org и llms.txt для AI-видимости сайта

Ваш сайт исчезает из ответов ChatGPT и Perplexity, хотя в классической выдаче позиции держатся? Проблема не в контенте — ее решает разметка сайта для AI-видимости. Языковые модели не «читают» страницу, как Googlebot: им нужны явные сигналы о сущностях, авторстве, фактах и структуре. Без Schema.org и нового стандарта llms.txt вы остаетесь невидимы для AI Overviews, Яндекс-нейросетей и генеративных ассистентов — даже если занимаете топ-3.

В этом материале вы получите рабочую систему: какие типы Schema.org реально влияют на цитируемость в LLM, как собрать llms.txt без ошибок, какие связки разметки усиливают друг друга и как проверить, что AI-системы корректно считывают ваш сайт. Никакой воды — только то, что внедряется руками в ближайший спринт.

Начнем с того, как именно AI-системы парсят разметку и почему старые SEO-подходы здесь не работают.

Что такое разметка для AI-видимости и почему это уже не классическое SEO

Классическое SEO учило размечать страницы ради сниппетов в выдаче Google и Яндекса: звездочки рейтинга, цены, хлебные крошки. Разметка сайта для AI-видимости решает другую задачу — сделать факты о компании, продукте и авторе машиночитаемыми для языковых моделей. ChatGPT, Perplexity, Gemini и YandexGPT не «читают» страницу как пользователь; они парсят JSON-LD, сверяют сущности с графами знаний (Wikidata, Google Knowledge Graph) и решают, достаточно ли у источника подтвержденной фактуры, чтобы процитировать его в ответе.

Отсюда термин GEO — generative engine optimization. Если SEO оптимизирует ранжирование, то GEO оптимизирует попадание сайта в генеративный ответ и блок AI Overviews. Schema.org здесь перестает быть бонусом для красивого сниппета и становится базовым слоем: без явно описанных типов Organization, Person, Article, FAQPage модель просто не понимает, кто вы и почему вам можно верить.

Исследование «GEO: Generative Engine Optimization», представленное на конференции KDD 2024 командой из Принстона, IIT Delhi, Georgia Tech и Allen Institute for AI, показало: оптимизация контента под генеративные движки может повысить видимость в их ответах до 40%. Авторы протестировали 9 разных тактик на 10 000 запросов на системе, имитирующей Bing Chat, и топ-3 приема дали прирост цитируемости на 30–40%. Это переводит разметку и структурную работу с контентом из разряда «хорошо бы» в обязательный технический слой LLM-видимости.

Инфографика базовых типов Schema.org для AI-видимости сайта
Шесть типов разметки, закрывающих 80 процентов задач AI-видимости

Базовый набор Schema.org: что внедрять в первую очередь

Минимум из шести типов разметки закрывает примерно 80% задач AI-видимости — этого достаточно, чтобы вас начали цитировать в генеративных ответах. Логика простая: LLM ищут структурированные сущности и связи, а не угадывают смысл по HTML. JSON-LD здесь предпочтительнее Microdata и RDFa — он отделен от верстки, легко правится через GTM или шаблонизатор, и именно его рекомендует Google как формат структурированных данных: в общем случае Google рекомендует JSON-LD, если позволяет архитектура сайта, поскольку его проще внедрять и поддерживать в масштабе.

Article и BlogPosting для контентных страниц

Article (и его подтип BlogPosting) — основа любой статьи. Указывайте headline, datePublished, dateModified, author, publisher и mainEntityOfPage. Без этих полей LLM не понимает, насколько свежий у вас контент и кому он принадлежит.

Organization и Person как сигнал E-E-A-T

Organization на главной плюс Person (Author schema) на странице автора — это связка, которую ChatGPT и Perplexity используют для оценки экспертности. Обязательно заполняйте sameAs ссылками на LinkedIn, Wikidata, отраслевые профили — так вы попадаете в граф знаний.

FAQPage и HowTo — формат для дословного цитирования

LLM любят цитировать структурированные пары «вопрос-ответ» и пошаговые инструкции почти без изменений. FAQPage подходит для разделов с типовыми вопросами, HowTo — для практических гайдов. Учитывайте актуальный статус этих типов в Google Search: HowTo rich results были полностью свернуты на десктопе в сентябре 2023 года, а в 2025 Google убрал еще семь типов структурированных данных как редко используемые, FAQ rich results перестали показываться в Google Search 7 мая 2026 года. При этом FAQPage остается валидным типом Schema.org, и Google подтвердил, что продолжит парсить FAQ-разметку для понимания страниц — то есть для AI-видимости и LLM-извлечения смысл сохраняется, даже если визуальных сниппетов в выдаче больше нет.

BreadcrumbList помогает LLM понять иерархию сайта, Product или ProfessionalService — описать конкретное предложение с ценой, рейтингом и характеристиками.

Тип разметкиПоддержка в поисковых и AI-системах
Article / BlogPostingбазовый тип, читается всеми движками
Organization + Personоснова идентификации бренда и автора в графе знаний
FAQPageпарсится Google и LLM для понимания контента, визуальные rich results в Google отключены
HowToвизуальные rich results в Google отключены с 2023; используется LLM как структурный сигнал
BreadcrumbListподдерживается в Google и Яндексе для иерархии
Productчитается поисковиками и AI; обязательно соответствие видимому контенту
Схема связей сущностей Article Person Organization через graph и sameAs
Как @graph связывает Article, Person и Organization в единый граф знаний

@graph и связывание сущностей: превращаем разметку в граф знаний

Когда вы вставляете на страницу три отдельных блока JSON-LD — отдельно Article, отдельно Person, отдельно Organization — поисковик и LLM видят три не связанных острова. Парсер не понимает, что автор статьи работает в этой компании, а компания — та самая, что в Wikidata. Связи приходится достраивать эвристически, и часто они теряются. @graph решает это: вы складываете все сущности в один массив и соединяете их через @id — внутренние URI, на которые ссылаются другие узлы.

Для LLM это критично: модель строит локальный граф знаний прямо из вашей разметки и сопоставляет его с тем, что уже знает о бренде. Связка sameAs с Wikidata, Crunchbase, LinkedIn, Google Business Profile работает как верификация identity — нейросеть убеждается, что Organization из вашей разметки и есть та организация, про которую она читала в обучающей выборке.

{
  "@context": "https://schema.org",
  "@graph": [
    {
      "@type": "Article",
      "@id": "https://example.ru/post#article",
      "headline": "Разметка для AI-видимости",
      "author": {"@id": "https://example.ru/#ivanov"},
      "publisher": {"@id": "https://example.ru/#org"}
    },
    {
      "@type": "Person",
      "@id": "https://example.ru/#ivanov",
      "name": "Иван Иванов",
      "worksFor": {"@id": "https://example.ru/#org"},
      "sameAs": [
        "https://www.linkedin.com/in/ivanov",
        "https://www.wikidata.org/wiki/Q123456"
      ]
    },
    {
      "@type": "Organization",
      "@id": "https://example.ru/#org",
      "name": "Example Agency",
      "taxID": "7701234567",
      "sameAs": [
        "https://www.wikidata.org/wiki/Q987654",
        "https://g.page/example-agency"
      ]
    }
  ]
}

Обратите внимание: Article через @id ссылается на Person, Person — на Organization, а та через sameAs уходит в публичные базы. Получается замкнутый граф, который LLM читает за один проход.

Таблица AI-краулеров GPTBot ClaudeBot PerplexityBot и их назначение
Основные AI-краулеры и зачем им открывать или закрывать доступ

llms.txt и AI-краулеры: второй слой разметки для AI

Schema.org объясняет ИИ, что у вас на странице. llms.txt — куда смотреть в первую очередь. Это два разных слоя: разметка работает на уровне отдельного документа, llms.txt — на уровне всего сайта, как карта приоритетов для языковых моделей.

Файл размещается в корне (/llms.txt) в формате Markdown. Структура простая: H1 с названием проекта, абзац-описание, далее разделы со списками ссылок и короткими аннотациями — что это за страница и зачем она LLM. Отдельно выносят ключевые гайды, документацию, экспертные материалы. Для крупных сайтов делают расширенный llms-full.txt с полными текстами приоритетных страниц.

Параллельно настраивается robots.txt под AI-краулеров. Каждый ходит под своим User-agent:

КраулерЧейНазначение
GPTBotOpenAIобучение моделей
OAI-SearchBotOpenAIвыдача ChatGPT Search
ClaudeBotAnthropicобучение Claude
PerplexityBotPerplexityиндексация для ответов
Google-ExtendedGoogleобучение Gemini и AI Overviews
YandexGPTЯндекснейропоиск Яндекса

Логика обычно такая: ботам, которые формируют ответы пользователю (OAI-SearchBot, PerplexityBot), доступ открыт — это ваш трафик и цитирования. Разрешайте доступ OAI-SearchBot, Claude-SearchBot и PerplexityBot к контенту, а GPTBot и ClaudeBot (обучающие краулеры) блокируйте только если у вас есть конкретная причина отказаться от обучения моделей.

Третий элемент слоя — Speakable schema. Размечайте 2–3 предложения, которые голосовой ассистент или Алиса могут зачитать вслух как прямой ответ на вопрос пользователя.

Яндекс, Алиса и YandexGPT: специфика российского AI-поиска

Яндекс работает со Schema.org давно, но иначе, чем Google. Расширенные сниппеты в выдаче подтягиваются из стандартных типов (Product, Recipe, Article, FAQPage), а отдельный пласт — разметка для Турбо-страниц через RSS-фид с собственными атрибутами Яндекса. JSON-LD читается, но микроформаты и микроданные тоже остаются в обработке — Яндекс к ним лояльнее, чем западные краулеры.

Для попадания в ответы YandexGPT и GigaChat базовая Schema-разметка работает как сигнал авторитетности, но решает не она. Эти модели сильнее опираются на текстовую структуру: четкие H2/H3, фактические утверждения короткими абзацами, явные определения в первом предложении раздела. Прописывайте Organization с ИНН, ОГРН и физическим адресом — для российских юрлиц это базовый сигнал привязки сущности к реальной компании.

Алиса при голосовых ответах задействует SpeakableSpecification — размечайте 2–3 коротких предложения с прямым ответом на вопрос. Длина фрагмента — до 30 секунд озвучки.

Принципиальное отличие от Google и OpenAI: Яндекс ждет связки с Яндекс.Бизнесом, Яндекс.Картами и Дзеном через sameAs. Без этих ссылок граф сущности остается неполным, и шанс попасть в нейроответ падает.

График исполнения JavaScript AI-краулерами GPTBot ClaudeBot PerplexityBot
Ни один основной AI-краулер не исполняет JavaScript — данные Vercel и MERJ

SSR vs CSR: почему AI-краулеры не видят вашу разметку

Главная техническая ловушка — JSON-LD, который инжектится в DOM после загрузки страницы через React, Vue или GTM. Браузер пользователя его увидит, а краулер — нет. По данным независимого исследования Vercel и MERJ, на выборке более 500 миллионов обращений GPTBot не зафиксировано ни одного факта исполнения JavaScript: GPTBot скачивает JS-файлы в 11,5% случаев, но никогда их не запускает; то же верно для ClaudeBot, PerplexityBot, ExternalAgent Meta и Bytespider — ни один AI-краулер сегодня не исполняет JavaScript. По состоянию на июнь 2026 года ни один из основных AI-краулеров — GPTBot, OAI-SearchBot, ChatGPT-User, ClaudeBot, Claude-SearchBot, PerplexityBot, Meta-ExternalAgent, Bytespider — не рендерит JavaScript. Они забирают сырой HTML, извлекают что нашли, и уходят — никаких повторных попыток.

Это означает, что весь ваш Article, FAQPage и Organization, добавленные тегом через gtm.js или useEffect, для AI просто не существуют.

Что работает:

  • SSR — Next.js, Nuxt, Astro отдают JSON-LD сразу в <head> ответа сервера.
  • Пререндеринг через Prerender.io или Rendertron для SPA, которые переписать нельзя.
  • Статическая вставка <script type="application/ld+json"> прямо в шаблон, минуя CSR-логику.

Быстрая проверка занимает секунды. Выполните curl -A "GPTBot" https://ваш-сайт/page и грепните вывод по application/ld+json. Если блока нет — разметки для AI у вас нет. Параллельно смотрите серверные логи: фиксируйте визиты ботов и сверяйте, какой HTML им отдается.

Валидация и замер эффекта: от Rich Results Test до Citation Rate

Разметка прошла без ошибок — это нулевая точка, а не финиш. Дальше начинается долгая работа: смотреть, заходят ли AI-краулеры, цитируют ли вас модели и растет ли доля упоминаний бренда в генеративных ответах.

Инструменты валидации

Базовый набор: Rich Results Test от Google (проверяет, подходит ли разметка под расширенные результаты), Schema Markup Validator на validator.schema.org (показывает синтаксис JSON-LD без фильтра под Google-фичи) и валидатор структурированных данных в Яндекс.Вебмастере. Прогоняйте каждый шаблон страницы через все три — у них разные правила интерпретации.

Логи AI-краулеров

Откройте access.log и грепайте по User-Agent: GPTBot, PerplexityBot, ClaudeBot, OAI-SearchBot, Google-Extended, YandexGPT. Аналога Search Console для AI-ботов нет — единственный способ убедиться, что AI-краулеры действительно ходят к вам, это смотреть серверные логи по их user-agent-строкам. Настройте дашборд в Grafana или хотя бы еженедельную выгрузку.

Метрики GEO

Три ключевые цифры, которые сейчас формируются как индустриальные ориентиры:

  • Share of Model — доля ответов LLM на релевантные запросы вашей ниши, где упомянут ваш бренд. Считается на выборке промптов.
  • Citation Rate — процент ответов, где есть ссылка именно на ваш домен (а не просто упоминание имени).
  • Attribution Rate — доля трафика из AI-источников в общем реферальном потоке (utm и referer от chat.openai.com, perplexity.ai).

Ручной мониторинг цитируемости

Раз в неделю гоняйте список из 30–50 промптов-зондов через ChatGPT, Perplexity, Алису и Gemini. Фиксируйте: упомянут ли бренд, есть ли ссылка, какие конкуренты рядом. Это даст качественную картину, которую цифры не покажут.

Частые ошибки, которые убивают AI-видимость

Большинство проблем со структурированными данными — это не баги парсеров, а ошибки на стороне внедрения. Вот шесть типичных:

  1. Расхождение видимого контента и JSON-LD. В разметке цена 4990 ₽, на странице — 5490 ₽. Парсер видит несоответствие и игнорирует блок целиком. Google прямо требует, чтобы структурированные данные совпадали со значениями, видимыми пользователю: структурированные данные должны совпадать со значениями, которые видит клиент, а предоставление некорректных данных на товарных страницах нарушает правила Google для разработчиков.
  2. Дубли Organization с разными @id на главной, в подвале и на странице «О компании». Граф рассыпается, sameAs не склеивается с Wikidata.
  3. Неверный тип сущности — Product вместо Service для консалтинга, Article вместо HowTo для инструкции. Тип определяет, в какой ответ AI вас подтянет.
  4. JSON-LD, вставленный только через JavaScript после загрузки. GPTBot и часть краулеров Perplexity не исполняют JS — разметки для них нет.
  5. FAQPage с рекламными вопросами типа «Почему мы лучшие?». LLM такие блоки распознают как маркетинг и понижают доверие.
  6. Organization без sameAs на профили в соцсетях, Wikidata, отраслевые каталоги. Без внешних связей сущность не подтверждается.

Заключение

Главное — перестать воспринимать структурированные данные как формальность для сниппетов. Разметка сайта для AI-видимости работает только в связке: чистый @graph со связанными сущностями, рабочий llms.txt, серверный рендеринг и регулярная валидация. Соберите эту систему один раз — и страницы начнут стабильно попадать в ответы ChatGPT, Perplexity, AI Overviews и YandexGPT.

С чего начать на этой неделе: проверьте ключевые URL в Rich Results Test, выгрузите логи и посмотрите, заходят ли GPTBot и PerplexityBot, добавьте Organization и Article через @graph, заведите llms.txt. Дальше — замеряйте Citation Rate и докручивайте по данным, а не по ощущениям.

Часто задаваемые вопросы

Гарантирует ли разметка попадание в ответы ChatGPT и AI Overviews?

Нет, не гарантирует. Разметка через Schema.org и JSON-LD — необходимое, но не достаточное условие: без нее шансы на цитирование в генеративном поиске резко падают, но одной микроразметки мало. Параллельно нужны авторитетные источники, четкая фактура, сигналы E-E-A-T и техническая доступность для GPTBot, ClaudeBot, PerplexityBot.

Какие 3 типа Schema.org внедрить первыми, если ресурсы ограничены?

Стартовый минимум: Organization с заполненным sameAs (соцсети, Wikidata, отраслевые каталоги), Article с явным author и datePublished, а также FAQPage на ключевых страницах. Эта тройка закрывает базу E-E-A-T, связывает бренд с графом знаний и дает контент в формате, удобном для извлечения и цитирования LLM.

Чем JSON-LD лучше Microdata и RDFa для AI-краулеров?

JSON-LD живет отдельным блоком в <head> или <body> и не зависит от верстки — его легко поддерживать, тестировать и масштабировать через шаблоны. Schema.org — это совместный проект, поддерживаемый Google, Microsoft, Yahoo и Yandex, а Google прямо рекомендует JSON-LD как наиболее удобный в поддержке формат. Microdata и RDFa завязаны на HTML-атрибуты, поэтому любая правка дизайна может сломать структурированные данные.

Как llms.txt связан с микроразметкой?

Это два слоя одной задачи: Schema.org описывает смысл контента на конкретной странице, а llms.txt — это карта сайта для LLM с приоритетами, описаниями разделов и ссылками на чистые markdown-версии. Микроразметка отвечает за «что это за объект», llms.txt — за «куда идти и что читать». В связке они дают AI-моделям полную навигацию по ресурсу.

Как проверить, что GPTBot и PerplexityBot реально видят мою разметку?

Самый надежный способ — анализ серверных логов (access.log) с фильтром по user-agent: GPTBot, PerplexityBot, ClaudeBot, Google-Extended. Дополнительно — curl с подменой UA на бот, чтобы увидеть ровно тот HTML, который получает краулер. Финальная проверка — AI-зонды: задать модели вопрос с упоминанием вашего URL и посмотреть, цитирует ли она факты из JSON-LD.

Почему AI-боты не видят мой JSON-LD?

Чаще всего причина одна: разметка инжектится JavaScript уже после загрузки страницы, а большинство AI-краулеров вообще не исполняют JS. Решение — серверный рендеринг (SSR), пререндер или статическая вставка JSON-LD прямо в исходный HTML. Проверить легко: откройте view-source: страницы — если блока <script type="application/ld+json"> там нет, бот его тоже не увидит.

Как связать бренд с Wikidata через sameAs?

Сначала найдите или создайте сущность компании в Wikidata и зафиксируйте ее Q-идентификатор (например, Q12345). Затем в JSON-LD типа Organization добавьте массив sameAs с URL вида https://www.wikidata.org/wiki/Q12345, а также ссылки на верифицированные профили в соцсетях, Crunchbase, отраслевых реестрах. Это ключевой сигнал для попадания в граф знаний и однозначной идентификации бренда моделями.

Работает ли Schema.org для Яндекса и YandexGPT?

Да, Яндекс поддерживает основные типы Schema.org — Organization, Article, Product, BreadcrumbList, FAQPage — и использует их для колдунщиков и нейроответов. Для Алисы и голосовых сценариев имеет смысл добавить Speakable. Валидацию удобно делать через «Валидатор микроразметки» Яндекс.Вебмастера параллельно с Rich Results Test от Google.

Нужна ли отдельная разметка для голосовых ассистентов?

Да, для голосового поиска полезен тип Speakable — он помечает фрагменты текста, пригодные для зачитывания вслух Google Assistant и Алисой. Это короткие смысловые блоки (обычно 20–30 секунд звучания) с прямым ответом на вопрос. Без Speakable ассистент сам решит, какой кусок озвучить, и часто выбирает неудачный.

Как измерить эффект внедрения разметки на AI-видимость?

Базовые метрики LLM-видимости: Citation Rate (доля ответов модели со ссылкой на ваш домен по релевантным промптам), Share of Model (ваша доля упоминаний против конкурентов), а также рост визитов AI-ботов в логах и реферального трафика с chat.openai.com, perplexity.ai, gemini.google.com. Заметный эффект обычно проявляется не сразу — циклы обхода AI-краулеров и обновления retrieval-индексов растянуты по времени, поэтому замеры стоит вести регулярно по фиксированному списку промптов, иначе динамика будет нечитаемой.

Фото эксперта

Материал проверен экспертом

Дмитрий Медведко

Дмитрий руководил такими медиа-проектами, как CPA Mafia, CyberAff, ProTraffic, AffTimes, CPA Monstro и Affiliate Valley. Его опыт дополнил и краткий стаж работы менеджером по работе с вебмастерами в нутра-партнерке WebVork, что обогатило его знания в области affiliate-маркетинга.

31 декабря 2024 г. Дмитрий покинул должность руководителя медиа-проектов в холдинге ADSBASE. На текущий момент возглавляет CPA.LIVE и форум ADDSET.

Подтверждая свою экспертность в digital-маркетинге, Дмитрий обладает внушительным списком сертификатов.

Дмитрий Медведко Автор

Эксперт с глубоким погружением в affiliate-индустрию. За плечами — управление медиа проектами вроде CPA Mafia, CyberAff, ProTraffic, AffTimes, CPA Monstro и Affiliate Valley, а также практический опыт в нутра-сегменте, полученный в партнерке WebVork.

📝 Всего статей: 105 ⭐ Средняя оценка: 5 🏆 Баллы: 18375
CPA.LIVE
Добавить комментарий