Домой ИИ и технологии Локальный ИИ-сервер Lemonade 11.9 получил поддержку бэкенда AMD ROCm HRX

Локальный ИИ-сервер Lemonade 11.9 получил поддержку бэкенда AMD ROCm HRX

Релиз версии Lemonade 11.9 принес экспериментальную поддержку AMD ROCm HRX. Новый бэкенд нацелен на повышение производительности ИИ-нагрузок на архитектурах RDNA3 и Strix Halo.

3
0

Разработчики выпустили версию локального ИИ-сервера Lemonade 11.9. Главным нововведением обновления стало внедрение экспериментального бэкенда Llama.cpp HRX, который обеспечивает взаимодействие с новой средой выполнения AMD HRX Runtime. На текущий момент поддержка реализована для видеокарт серии Radeon RX 7900 (архитектура RDNA3) и мобильных процессоров со встроенной графикой Strix Halo.

Логотип или графическое отображение архитектуры вычислительных ядер AMD

Особенности технологии HRX в стеке AMD

Технология HRX является важным элементом экосистемы ROCm и частью инициатив Loom/Hyperloom, представленных AMD на мероприятии Advancing AI в Сан-Франциско. В рамках концепции оптимизации агентных рабочих нагрузок HRX выступает альтернативой традиционному LLVM IR. Новый стек использует компилятор Loom, который позволяет быстрее транслировать сгенерированный код в оптимизированные ассемблерные инструкции AMDGPU.

Согласно документации репозитория hrx-system на GitHub, данный набор минимальных компонентов среды выполнения предоставляет общую основу для интеграции с GPU, NPU и CPU компании AMD. Проект нацелен на обеспечение высокой производительности и низкой задержки. Фактически, HRX представляет собой специализированный и более легкий подмножество ROCm, адаптированное для клиентских систем, в отличие от исходного ROCm, который исторически был сфокусирован преимущественно на сегменте дата-центров.

Перспективы производительности и интеграция с Llama.cpp

Инженер AMD Стелла Лоренцо, инициировавшая обсуждение в сообществе GGML, подчеркнула, что текущие бэкенды Vulkan и HIP, производные от CUDA, не всегда позволяют добиться максимальной эффективности на клиентском оборудовании. Разработка HRX ведется последние несколько месяцев параллельно с созданием выделенного бэкенда для Llama.cpp.

Технические показатели новой разработки выглядят многообещающе:

  • Прирост скорости префилла (prefill) оценивается в 30–50% по сравнению с существующими решениями Vulkan и HIP в Llama.cpp.
  • Для задач декодирования, не относящихся к MTP, ожидается прирост производительности до 10% в пересчете на токены в секунду.
  • Упрощение процесса разработки за счет более компактного стека.

Первоначальный вариант реализации оптимизирован для работы с моделью unsloth/Qwen3-30B-A3B-Instruct-2507-GGUF (квантование Q4_K_M). Хотя работа находится на ранней стадии и носит экспериментальный характер, целью является создание redistributable-библиотек для включения в основной стек ROCm. В версии Lemonade 11.9 поддержка HRX реализована для графических ядер GFX1100 и GFX1151 под управлением Linux.

Помимо интеграции HRX, релиз Lemonade 11.9 добавляет поддержку архитектуры Qwen3-Next в основной бэкенд Llama.cpp и включает ряд сопутствующих улучшений общей производительности системы.

Технический контекст и эволюция стека AMD

Интеграция HRX знаменует важный поворот в стратегии AMD по унификации своего программного обеспечения для ИИ. Ранее компания долгое время фокусировалась на внедрении MLIR (Multi-Level Intermediate Representation) и SPIR-V в качестве предпочтительного общего промежуточного представления. Однако появление Loom IR в составе экосистемы Hyperloom меняет ландшафт: это кастомное, более специализированное решение, созданное с учетом специфики аппаратной архитектуры AMD. В отличие от стандартного LLVM IR, который использовался годами, Loom IR призван обеспечить более прямой путь трансляции кода в оптимизированные ассемблерные инструкции AMDGPU.

С технической точки зрения HRX — это коллекция минимальных компонентов среды выполнения, которые предлагают альтернативную реализацию HIP (Heterogeneous-Compute Interface for Portability), поставляемого в составе классического ROCm. Разработчики позиционируют его как «общую подложку» (common substrate), необходимую для обеспечения низкой задержки и высокой производительности не только на дискретных GPU, но и в сегментах NPU и CPU. По словам Стеллы Лоренцо, создание HRX продиктовано сложностями, с которыми сталкивается ROCm при развертывании на клиентских ОС: исторически стек создавался для нужд центров обработки данных, что создавало серьезные препятствия для эффективной работы на потребительских системах.

Особенности реализации в Llama.cpp

В текущем RFC-запросе, инициированном инженерами AMD, внимание сфокусировано на создании выделенного бэкенда ggml-hrx. Хотя команда уже провела обширные экспериментальные исследования для широкого спектра моделей, для первой публичной демонстрации был выбран узкий, но репрезентативный кейс: работа с моделью unsloth/Qwen3-30B-A3B-Instruct-2507-GGUF в квантовании Q4_K_M. Этот выбор обусловлен желанием показать, как минимальный набор ядер (kernel library) способен эффективно утилизировать ресурсы RDNA3 (W7900) и RDNA3.5 (Strix Halo).

Важно отметить, что, несмотря на высокую эффективность, появление HRX в экспериментальном состоянии во второй половине 2026 года эксперты называют долгожданным, но запоздалым шагом. Тем не менее, возможность достижения прироста в 30–50% при операциях префилла по сравнению с существующими бэкендами делает технологию крайне перспективной для локальных LLM. В будущем AMD планирует развивать эту ветку, расширяя покрытие моделей, операционных систем и конфигураций аппаратного обеспечения, чтобы в конечном итоге сделать HRX полноценным, распространяемым набором библиотек, интегрированным в официальные релизы ROCm.

Источник: https://www.phoronix.com