Новый подход к управлению знаниями
Андрей Карпати, бывший директор по ИИ в Tesla и сооснователь OpenAI, представил концепцию LLM Knowledge Bases. Этот метод меняет принципы работы с исследовательскими проектами, предлагая использовать большие языковые модели для формирования и ведения баз данных в формате Markdown (.md). Решение устраняет проблему потери контекста, повышая прозрачность и эффективность обработки информации.
Почему RAG — это не всегда решение?
Карпати критикует «статичность» традиционных систем, где контекст обнуляется после закрытия сессии. В отличие от векторных баз данных и технологии Retrieval-Augmented Generation (RAG), подход Карпати делает ставку на простоту. В системе используются:
- Markdown-файлы как основной формат хранения данных.
- Инструмент Obsidian Web Clipper для импорта веб-контента.
- LLM для автоматизации создания и редактирования заметок.

Изображение, сгенерированное моделью Grok.
Как работает система самокоррекции
Модель не просто сохраняет данные, а активно структурирует их: создает перекрестные ссылки, пишет энциклопедические заметки и проводит регулярный «linting» (проверку здоровья). Это позволяет превратить разрозненные материалы в «живую» базу, которая самостоятельно устраняет несоответствия и обновляет связи.
Преимущества перед «черным ящиком»
Ключевое достоинство метода — доступность. Файлы формата .md легко редактируются вручную, что исключает проблему «черного ящика», свойственную векторным хранилищам. Модель работает с уже структурированными данными, что значительно снижает нагрузку на вычисления и повышает точность ответов.

Архитектура системы. Источник: X@himanshu
Корпоративный потенциал и будущее
Хотя изначально система создавалась для личных нужд, она отлично подходит для создания «корпоративных библий», автоматически синхронизируемых с внутренней документацией. Карпати планирует использовать эти базы данных для генерации синтетических данных и последующего дообучения специализированных моделей.
«Я часто генерирую динамический HTML для интерактивной работы с визуализациями. Также удобно создавать мини-базы знаний для голосового взаимодействия с LLM во время пробежек на 7–10 миль», — Лекс Фридман.





