Ваш сайт исчезает из ответов ChatGPT и Perplexity, хотя в классической выдаче позиции держатся? Проблема не в контенте — ее решает разметка сайта для AI-видимости. Языковые модели не «читают» страницу, как Googlebot: им нужны явные сигналы о сущностях, авторстве, фактах и структуре. Без Schema.org и нового стандарта llms.txt вы остаетесь невидимы для AI Overviews, Яндекс-нейросетей и генеративных ассистентов — даже если занимаете топ-3.
В этом материале вы получите рабочую систему: какие типы Schema.org реально влияют на цитируемость в LLM, как собрать llms.txt без ошибок, какие связки разметки усиливают друг друга и как проверить, что AI-системы корректно считывают ваш сайт. Никакой воды — только то, что внедряется руками в ближайший спринт.
Начнем с того, как именно AI-системы парсят разметку и почему старые SEO-подходы здесь не работают.
Что такое разметка для AI-видимости и почему это уже не классическое SEO
Классическое SEO учило размечать страницы ради сниппетов в выдаче Google и Яндекса: звездочки рейтинга, цены, хлебные крошки. Разметка сайта для AI-видимости решает другую задачу — сделать факты о компании, продукте и авторе машиночитаемыми для языковых моделей. ChatGPT, Perplexity, Gemini и YandexGPT не «читают» страницу как пользователь; они парсят JSON-LD, сверяют сущности с графами знаний (Wikidata, Google Knowledge Graph) и решают, достаточно ли у источника подтвержденной фактуры, чтобы процитировать его в ответе.
Отсюда термин GEO — generative engine optimization. Если SEO оптимизирует ранжирование, то GEO оптимизирует попадание сайта в генеративный ответ и блок AI Overviews. Schema.org здесь перестает быть бонусом для красивого сниппета и становится базовым слоем: без явно описанных типов Organization, Person, Article, FAQPage модель просто не понимает, кто вы и почему вам можно верить.
Исследование «GEO: Generative Engine Optimization», представленное на конференции KDD 2024 командой из Принстона, IIT Delhi, Georgia Tech и Allen Institute for AI, показало: оптимизация контента под генеративные движки может повысить видимость в их ответах до 40%. Авторы протестировали 9 разных тактик на 10 000 запросов на системе, имитирующей Bing Chat, и топ-3 приема дали прирост цитируемости на 30–40%. Это переводит разметку и структурную работу с контентом из разряда «хорошо бы» в обязательный технический слой LLM-видимости.

Базовый набор Schema.org: что внедрять в первую очередь
Минимум из шести типов разметки закрывает примерно 80% задач AI-видимости — этого достаточно, чтобы вас начали цитировать в генеративных ответах. Логика простая: LLM ищут структурированные сущности и связи, а не угадывают смысл по HTML. JSON-LD здесь предпочтительнее Microdata и RDFa — он отделен от верстки, легко правится через GTM или шаблонизатор, и именно его рекомендует Google как формат структурированных данных: в общем случае Google рекомендует JSON-LD, если позволяет архитектура сайта, поскольку его проще внедрять и поддерживать в масштабе.
Article и BlogPosting для контентных страниц
Article (и его подтип BlogPosting) — основа любой статьи. Указывайте headline, datePublished, dateModified, author, publisher и mainEntityOfPage. Без этих полей LLM не понимает, насколько свежий у вас контент и кому он принадлежит.
Organization и Person как сигнал E-E-A-T
Organization на главной плюс Person (Author schema) на странице автора — это связка, которую ChatGPT и Perplexity используют для оценки экспертности. Обязательно заполняйте sameAs ссылками на LinkedIn, Wikidata, отраслевые профили — так вы попадаете в граф знаний.
FAQPage и HowTo — формат для дословного цитирования
LLM любят цитировать структурированные пары «вопрос-ответ» и пошаговые инструкции почти без изменений. FAQPage подходит для разделов с типовыми вопросами, HowTo — для практических гайдов. Учитывайте актуальный статус этих типов в Google Search: HowTo rich results были полностью свернуты на десктопе в сентябре 2023 года, а в 2025 Google убрал еще семь типов структурированных данных как редко используемые, FAQ rich results перестали показываться в Google Search 7 мая 2026 года. При этом FAQPage остается валидным типом Schema.org, и Google подтвердил, что продолжит парсить FAQ-разметку для понимания страниц — то есть для AI-видимости и LLM-извлечения смысл сохраняется, даже если визуальных сниппетов в выдаче больше нет.
BreadcrumbList и Product для коммерческих страниц
BreadcrumbList помогает LLM понять иерархию сайта, Product или ProfessionalService — описать конкретное предложение с ценой, рейтингом и характеристиками.
| Тип разметки | Поддержка в поисковых и AI-системах |
|---|---|
| Article / BlogPosting | базовый тип, читается всеми движками |
| Organization + Person | основа идентификации бренда и автора в графе знаний |
| FAQPage | парсится Google и LLM для понимания контента, визуальные rich results в Google отключены |
| HowTo | визуальные rich results в Google отключены с 2023; используется LLM как структурный сигнал |
| BreadcrumbList | поддерживается в Google и Яндексе для иерархии |
| Product | читается поисковиками и AI; обязательно соответствие видимому контенту |

@graph и связывание сущностей: превращаем разметку в граф знаний
Когда вы вставляете на страницу три отдельных блока JSON-LD — отдельно Article, отдельно Person, отдельно Organization — поисковик и LLM видят три не связанных острова. Парсер не понимает, что автор статьи работает в этой компании, а компания — та самая, что в Wikidata. Связи приходится достраивать эвристически, и часто они теряются. @graph решает это: вы складываете все сущности в один массив и соединяете их через @id — внутренние URI, на которые ссылаются другие узлы.
Для LLM это критично: модель строит локальный граф знаний прямо из вашей разметки и сопоставляет его с тем, что уже знает о бренде. Связка sameAs с Wikidata, Crunchbase, LinkedIn, Google Business Profile работает как верификация identity — нейросеть убеждается, что Organization из вашей разметки и есть та организация, про которую она читала в обучающей выборке.
{
"@context": "https://schema.org",
"@graph": [
{
"@type": "Article",
"@id": "https://example.ru/post#article",
"headline": "Разметка для AI-видимости",
"author": {"@id": "https://example.ru/#ivanov"},
"publisher": {"@id": "https://example.ru/#org"}
},
{
"@type": "Person",
"@id": "https://example.ru/#ivanov",
"name": "Иван Иванов",
"worksFor": {"@id": "https://example.ru/#org"},
"sameAs": [
"https://www.linkedin.com/in/ivanov",
"https://www.wikidata.org/wiki/Q123456"
]
},
{
"@type": "Organization",
"@id": "https://example.ru/#org",
"name": "Example Agency",
"taxID": "7701234567",
"sameAs": [
"https://www.wikidata.org/wiki/Q987654",
"https://g.page/example-agency"
]
}
]
}
Обратите внимание: Article через @id ссылается на Person, Person — на Organization, а та через sameAs уходит в публичные базы. Получается замкнутый граф, который LLM читает за один проход.

llms.txt и AI-краулеры: второй слой разметки для AI
Schema.org объясняет ИИ, что у вас на странице. llms.txt — куда смотреть в первую очередь. Это два разных слоя: разметка работает на уровне отдельного документа, llms.txt — на уровне всего сайта, как карта приоритетов для языковых моделей.
Файл размещается в корне (/llms.txt) в формате Markdown. Структура простая: H1 с названием проекта, абзац-описание, далее разделы со списками ссылок и короткими аннотациями — что это за страница и зачем она LLM. Отдельно выносят ключевые гайды, документацию, экспертные материалы. Для крупных сайтов делают расширенный llms-full.txt с полными текстами приоритетных страниц.
Параллельно настраивается robots.txt под AI-краулеров. Каждый ходит под своим User-agent:
| Краулер | Чей | Назначение |
|---|---|---|
| GPTBot | OpenAI | обучение моделей |
| OAI-SearchBot | OpenAI | выдача ChatGPT Search |
| ClaudeBot | Anthropic | обучение Claude |
| PerplexityBot | Perplexity | индексация для ответов |
| Google-Extended | обучение Gemini и AI Overviews | |
| YandexGPT | Яндекс | нейропоиск Яндекса |
Логика обычно такая: ботам, которые формируют ответы пользователю (OAI-SearchBot, PerplexityBot), доступ открыт — это ваш трафик и цитирования. Разрешайте доступ OAI-SearchBot, Claude-SearchBot и PerplexityBot к контенту, а GPTBot и ClaudeBot (обучающие краулеры) блокируйте только если у вас есть конкретная причина отказаться от обучения моделей.
Третий элемент слоя — Speakable schema. Размечайте 2–3 предложения, которые голосовой ассистент или Алиса могут зачитать вслух как прямой ответ на вопрос пользователя.
Яндекс, Алиса и YandexGPT: специфика российского AI-поиска
Яндекс работает со Schema.org давно, но иначе, чем Google. Расширенные сниппеты в выдаче подтягиваются из стандартных типов (Product, Recipe, Article, FAQPage), а отдельный пласт — разметка для Турбо-страниц через RSS-фид с собственными атрибутами Яндекса. JSON-LD читается, но микроформаты и микроданные тоже остаются в обработке — Яндекс к ним лояльнее, чем западные краулеры.
Для попадания в ответы YandexGPT и GigaChat базовая Schema-разметка работает как сигнал авторитетности, но решает не она. Эти модели сильнее опираются на текстовую структуру: четкие H2/H3, фактические утверждения короткими абзацами, явные определения в первом предложении раздела. Прописывайте Organization с ИНН, ОГРН и физическим адресом — для российских юрлиц это базовый сигнал привязки сущности к реальной компании.
Алиса при голосовых ответах задействует SpeakableSpecification — размечайте 2–3 коротких предложения с прямым ответом на вопрос. Длина фрагмента — до 30 секунд озвучки.
Принципиальное отличие от Google и OpenAI: Яндекс ждет связки с Яндекс.Бизнесом, Яндекс.Картами и Дзеном через sameAs. Без этих ссылок граф сущности остается неполным, и шанс попасть в нейроответ падает.

SSR vs CSR: почему AI-краулеры не видят вашу разметку
Главная техническая ловушка — JSON-LD, который инжектится в DOM после загрузки страницы через React, Vue или GTM. Браузер пользователя его увидит, а краулер — нет. По данным независимого исследования Vercel и MERJ, на выборке более 500 миллионов обращений GPTBot не зафиксировано ни одного факта исполнения JavaScript: GPTBot скачивает JS-файлы в 11,5% случаев, но никогда их не запускает; то же верно для ClaudeBot, PerplexityBot, ExternalAgent Meta и Bytespider — ни один AI-краулер сегодня не исполняет JavaScript. По состоянию на июнь 2026 года ни один из основных AI-краулеров — GPTBot, OAI-SearchBot, ChatGPT-User, ClaudeBot, Claude-SearchBot, PerplexityBot, Meta-ExternalAgent, Bytespider — не рендерит JavaScript. Они забирают сырой HTML, извлекают что нашли, и уходят — никаких повторных попыток.
Это означает, что весь ваш Article, FAQPage и Organization, добавленные тегом через gtm.js или useEffect, для AI просто не существуют.
Что работает:
- SSR — Next.js, Nuxt, Astro отдают JSON-LD сразу в
<head>ответа сервера. - Пререндеринг через Prerender.io или Rendertron для SPA, которые переписать нельзя.
- Статическая вставка
<script type="application/ld+json">прямо в шаблон, минуя CSR-логику.
Быстрая проверка занимает секунды. Выполните curl -A "GPTBot" https://ваш-сайт/page и грепните вывод по application/ld+json. Если блока нет — разметки для AI у вас нет. Параллельно смотрите серверные логи: фиксируйте визиты ботов и сверяйте, какой HTML им отдается.
Валидация и замер эффекта: от Rich Results Test до Citation Rate
Разметка прошла без ошибок — это нулевая точка, а не финиш. Дальше начинается долгая работа: смотреть, заходят ли AI-краулеры, цитируют ли вас модели и растет ли доля упоминаний бренда в генеративных ответах.
Инструменты валидации
Базовый набор: Rich Results Test от Google (проверяет, подходит ли разметка под расширенные результаты), Schema Markup Validator на validator.schema.org (показывает синтаксис JSON-LD без фильтра под Google-фичи) и валидатор структурированных данных в Яндекс.Вебмастере. Прогоняйте каждый шаблон страницы через все три — у них разные правила интерпретации.
Логи AI-краулеров
Откройте access.log и грепайте по User-Agent: GPTBot, PerplexityBot, ClaudeBot, OAI-SearchBot, Google-Extended, YandexGPT. Аналога Search Console для AI-ботов нет — единственный способ убедиться, что AI-краулеры действительно ходят к вам, это смотреть серверные логи по их user-agent-строкам. Настройте дашборд в Grafana или хотя бы еженедельную выгрузку.
Метрики GEO
Три ключевые цифры, которые сейчас формируются как индустриальные ориентиры:
- Share of Model — доля ответов LLM на релевантные запросы вашей ниши, где упомянут ваш бренд. Считается на выборке промптов.
- Citation Rate — процент ответов, где есть ссылка именно на ваш домен (а не просто упоминание имени).
- Attribution Rate — доля трафика из AI-источников в общем реферальном потоке (utm и referer от chat.openai.com, perplexity.ai).
Ручной мониторинг цитируемости
Раз в неделю гоняйте список из 30–50 промптов-зондов через ChatGPT, Perplexity, Алису и Gemini. Фиксируйте: упомянут ли бренд, есть ли ссылка, какие конкуренты рядом. Это даст качественную картину, которую цифры не покажут.
Частые ошибки, которые убивают AI-видимость
Большинство проблем со структурированными данными — это не баги парсеров, а ошибки на стороне внедрения. Вот шесть типичных:
- Расхождение видимого контента и JSON-LD. В разметке цена 4990 ₽, на странице — 5490 ₽. Парсер видит несоответствие и игнорирует блок целиком. Google прямо требует, чтобы структурированные данные совпадали со значениями, видимыми пользователю: структурированные данные должны совпадать со значениями, которые видит клиент, а предоставление некорректных данных на товарных страницах нарушает правила Google для разработчиков.
- Дубли Organization с разными
@idна главной, в подвале и на странице «О компании». Граф рассыпается, sameAs не склеивается с Wikidata. - Неверный тип сущности — Product вместо Service для консалтинга, Article вместо HowTo для инструкции. Тип определяет, в какой ответ AI вас подтянет.
- JSON-LD, вставленный только через JavaScript после загрузки. GPTBot и часть краулеров Perplexity не исполняют JS — разметки для них нет.
- FAQPage с рекламными вопросами типа «Почему мы лучшие?». LLM такие блоки распознают как маркетинг и понижают доверие.
- Organization без
sameAsна профили в соцсетях, Wikidata, отраслевые каталоги. Без внешних связей сущность не подтверждается.
Заключение
Главное — перестать воспринимать структурированные данные как формальность для сниппетов. Разметка сайта для AI-видимости работает только в связке: чистый @graph со связанными сущностями, рабочий llms.txt, серверный рендеринг и регулярная валидация. Соберите эту систему один раз — и страницы начнут стабильно попадать в ответы ChatGPT, Perplexity, AI Overviews и YandexGPT.
С чего начать на этой неделе: проверьте ключевые URL в Rich Results Test, выгрузите логи и посмотрите, заходят ли GPTBot и PerplexityBot, добавьте Organization и Article через @graph, заведите llms.txt. Дальше — замеряйте Citation Rate и докручивайте по данным, а не по ощущениям.
Часто задаваемые вопросы
Нет, не гарантирует. Разметка через Schema.org и JSON-LD — необходимое, но не достаточное условие: без нее шансы на цитирование в генеративном поиске резко падают, но одной микроразметки мало. Параллельно нужны авторитетные источники, четкая фактура, сигналы E-E-A-T и техническая доступность для GPTBot, ClaudeBot, PerplexityBot.
Стартовый минимум: Organization с заполненным sameAs (соцсети, Wikidata, отраслевые каталоги), Article с явным author и datePublished, а также FAQPage на ключевых страницах. Эта тройка закрывает базу E-E-A-T, связывает бренд с графом знаний и дает контент в формате, удобном для извлечения и цитирования LLM.
JSON-LD живет отдельным блоком в <head> или <body> и не зависит от верстки — его легко поддерживать, тестировать и масштабировать через шаблоны. Schema.org — это совместный проект, поддерживаемый Google, Microsoft, Yahoo и Yandex, а Google прямо рекомендует JSON-LD как наиболее удобный в поддержке формат. Microdata и RDFa завязаны на HTML-атрибуты, поэтому любая правка дизайна может сломать структурированные данные.
Это два слоя одной задачи: Schema.org описывает смысл контента на конкретной странице, а llms.txt — это карта сайта для LLM с приоритетами, описаниями разделов и ссылками на чистые markdown-версии. Микроразметка отвечает за «что это за объект», llms.txt — за «куда идти и что читать». В связке они дают AI-моделям полную навигацию по ресурсу.
Самый надежный способ — анализ серверных логов (access.log) с фильтром по user-agent: GPTBot, PerplexityBot, ClaudeBot, Google-Extended. Дополнительно — curl с подменой UA на бот, чтобы увидеть ровно тот HTML, который получает краулер. Финальная проверка — AI-зонды: задать модели вопрос с упоминанием вашего URL и посмотреть, цитирует ли она факты из JSON-LD.
Чаще всего причина одна: разметка инжектится JavaScript уже после загрузки страницы, а большинство AI-краулеров вообще не исполняют JS. Решение — серверный рендеринг (SSR), пререндер или статическая вставка JSON-LD прямо в исходный HTML. Проверить легко: откройте view-source: страницы — если блока <script type="application/ld+json"> там нет, бот его тоже не увидит.
Сначала найдите или создайте сущность компании в Wikidata и зафиксируйте ее Q-идентификатор (например, Q12345). Затем в JSON-LD типа Organization добавьте массив sameAs с URL вида https://www.wikidata.org/wiki/Q12345, а также ссылки на верифицированные профили в соцсетях, Crunchbase, отраслевых реестрах. Это ключевой сигнал для попадания в граф знаний и однозначной идентификации бренда моделями.
Да, Яндекс поддерживает основные типы Schema.org — Organization, Article, Product, BreadcrumbList, FAQPage — и использует их для колдунщиков и нейроответов. Для Алисы и голосовых сценариев имеет смысл добавить Speakable. Валидацию удобно делать через «Валидатор микроразметки» Яндекс.Вебмастера параллельно с Rich Results Test от Google.
Да, для голосового поиска полезен тип Speakable — он помечает фрагменты текста, пригодные для зачитывания вслух Google Assistant и Алисой. Это короткие смысловые блоки (обычно 20–30 секунд звучания) с прямым ответом на вопрос. Без Speakable ассистент сам решит, какой кусок озвучить, и часто выбирает неудачный.
Базовые метрики LLM-видимости: Citation Rate (доля ответов модели со ссылкой на ваш домен по релевантным промптам), Share of Model (ваша доля упоминаний против конкурентов), а также рост визитов AI-ботов в логах и реферального трафика с chat.openai.com, perplexity.ai, gemini.google.com. Заметный эффект обычно проявляется не сразу — циклы обхода AI-краулеров и обновления retrieval-индексов растянуты по времени, поэтому замеры стоит вести регулярно по фиксированному списку промптов, иначе динамика будет нечитаемой.








