Тонкая настройка больших языковых моделей (LLM) — критически важный процесс для их адаптации под конкретные задачи, однако колоссальные требования к видеопамяти делают его практически недоступным для обычного оборудования. Исследователи из Гонконгского университета науки и технологий (HKUST) представили систему SlideFormer, позволяющую проводить обучение моделей объемом более 123 миллиардов параметров на одном потребительском GPU, например, Nvidia RTX 4090.
Архитектура и методы оптимизации
В основе SlideFormer лежит архитектура «скользящих слоев» (sliding layers). Она превращает GPU в своего рода динамическое окно: система эффективно совмещает вычислительные мощности графического адаптера с ресурсами центрального процессора, используя многоуровневый ввод-вывод.
Ключевые преимущества этого подхода:
- Управление памятью: Предварительно выделенные GPU-кэши и буферы в оперативной памяти минимизируют фрагментацию и избавляют от постоянного перераспределения ресурсов.
- Оптимизация вычислений: Использование специализированных ядер Triton позволяет устранить «бутылочные горлышки» при передаче данных.

Результаты и производительность
Тестирование системы показало впечатляющие результаты в сравнении с популярными решениями вроде ZeRO-Offload и ColossalAI. SlideFormer обеспечивает следующие показатели:
- Рост пропускной способности от 1,40 до 6,27 раза.
- Снижение пикового потребления видеопамяти более чем на 50%.
- Экономия ресурсов оперативной памяти на 40%.
На практике это означает возможность обучения моделей на 123 млрд параметров на одной RTX 4090 с увеличением размера пакета данных в 8 раз. Если же пользователь располагает мощной рабочей станцией с 256 ГБ ОЗУ, SlideFormer позволяет полноценно работать с моделями до 24 млрд параметров без деградации производительности.
Перспективы технологии
Разработка SlideFormer делает шаг в сторону демократизации искусственного интеллекта. Теперь небольшие компании и частные исследователи могут обучать и адаптировать передовые LLM, не прибегая к аренде дорогостоящих вычислительных кластеров, что открывает новые горизонты для локальных ИИ-проектов.






