Перейти к содержимому

LLMs.txt для AI-агентов

llms.txt — это специальный markdown-файл в корне сайта или раздела, который даёт AI-агентам короткое и структурированное описание проекта, а также ссылки на основные материалы в LLM-friendly формате.

Для базы знаний он выполняет ту же роль, что robots.txt для краулеров и sitemap.xml для поисковиков, но ориентирован именно на inference-сценарии: когда агенту нужно быстро понять структуру сайта и подтянуть релевантный контекст в промпт или RAG-пайплайн.

Обычная HTML-страница неудобна для агента:

  • в ней есть навигация, боковые панели, служебные блоки и лишний шум
  • контент разбит на десятки URL
  • агенту трудно понять, какие страницы главные, а какие второстепенные

llms.txt решает эту задачу так:

  • даёт краткое описание проекта в одном месте
  • показывает канонические ссылки на ключевые материалы
  • помогает начать с сокращённого контекста и только потом расширяться
  • упрощает подключение документации к IDE-агентам, чат-ботам и RAG-ассистентам

В типовой схеме встречаются три уровня контекста:

  • llms.txt — обзорный индекс: что это за проект и какие материалы читать дальше
  • llms-small.txt — короткий контекст для быстрого ответа или первичной маршрутизации
  • llms-full.txt — полный контекст, когда агенту нужен максимум деталей

Для этой базы знаний доступны:

  • llms.txt — обзор и основные наборы документации
  • llms-small.txt — сокращённая версия для быстрых сценариев
  • llms-full.txt — полный контекст по базе знаний

Вариант 1. Подключать URL как внешний источник контекста

Заголовок раздела «Вариант 1. Подключать URL как внешний источник контекста»

Подходит для агентов и чатов, которые умеют читать URL напрямую.

Практика:

  • сначала передавайте агенту https://wpcraft.ru/kb/llms.txt
  • если ответа недостаточно, переключайте его на llms-small.txt
  • для глубоких технических вопросов передавайте llms-full.txt

Это даёт контролируемую эскалацию контекста: от дешёвого и короткого к полному и дорогому.

Вариант 2. Использовать в RAG или knowledge ingestion

Заголовок раздела «Вариант 2. Использовать в RAG или knowledge ingestion»

Подходит для внутренних AI-ассистентов, support-ботов и агентов в IDE.

Рекомендуемый поток:

  1. Забрать llms.txt как entrypoint.
  2. Извлечь из него ключевые ссылки на нужные разделы.
  3. При необходимости догружать llms-small.txt или llms-full.txt.
  4. Индексировать полученный контекст в локальное хранилище, vector store или knowledge cache.

Такой подход лучше, чем слепо индексировать весь сайт, потому что llms.txt уже задаёт curated-структуру материалов.

Вариант 3. Использовать в system prompt или инструкциях агента

Заголовок раздела «Вариант 3. Использовать в system prompt или инструкциях агента»

Если агент работает по инструкции, можно явно прописать источник:

Если вопрос касается базы знаний WPC, сначала прочитай https://wpcraft.ru/kb/llms.txt.
Если нужны детали по конкретной теме, используй llms-small.txt или llms-full.txt.
Отдавай приоритет этим файлам перед случайным HTML-скрапингом сайта.

Это особенно полезно для:

  • кастомных GPT/assistants
  • Claude Projects
  • Copilot/Cursor workflows
  • агентных пайплайнов с retrieval step

Для сайтов на Astro Starlight удобнее всего генерировать эти файлы автоматически через плагин starlight-llms-txt.

Базовая схема:

import { defineConfig } from "astro/config";
import starlight from "@astrojs/starlight";
import starlightLlmsTxt from "starlight-llms-txt";
export default defineConfig({
site: "https://example.com/",
integrations: [
starlight({
title: "My Docs",
plugins: [starlightLlmsTxt()],
}),
],
});

После сборки сайт получает маршруты llms.txt, llms-small.txt и llms-full.txt автоматически.

  • Используйте llms.txt как точку входа, а не как замену всей документации.
  • Давайте агенту короткий контекст первым, полный — только по необходимости.
  • Держите названия разделов и описания страниц ясными: это напрямую влияет на качество навигации агента.
  • Если сайт русскоязычный, проверьте корректную UTF-8-выдачу для .txt файлов на проде.
  • Не путайте llms.txt с robots.txt: первый помогает понять контент, второй регулирует поведение ботов.
  • документация продукта
  • база знаний
  • developer portal
  • support center
  • сайт со сложной архитектурой разделов
  • контентный проект, где агенту нужно быстро находить authoritative pages

На self-hosted WordPress файл можно вести через AI-агента: плагин Enable Abilities for MCP даёт две abilities — ewpa/get-llms-txt (чтение, определение источника файла и валидация по спецификации llmstxt.org) и ewpa/update-llms-txt (запись с авто-маршрутизацией через SEOPress Pro или виртуальный /llms.txt). Это позволяет агенту проверять и обновлять файл без доступа к файловой системе.