Китайская компания Meituan представила LongCat-2.0 — современную большую языковую модель, насчитывающую 1,6 трлн параметров. Особенностью системы стало её обучение: весь процесс, включая предобучение и инференс, был реализован на вычислительном кластере из 50 тысяч отечественных ASIC-ускорителей. Это делает LongCat-2.0 одним из самых масштабных примеров создания LLM на национальной аппаратной базе.
В данном контексте под ASIC понимаются специализированные чипы, спроектированные для задач машинного обучения. Хотя поставщик оборудования официально не называется, использование коммуникационной библиотеки HCCL (Huawei Collective Communication Library) указывает на тесную интеграцию с экосистемой Huawei.
Архитектура модели ориентирована на агентные сценарии: взаимодействие с API, написание и отладку кода, а также реализацию многошаговых цепочек рассуждений. Для обучения системы использовался корпус данных объемом более 30 трлн токенов, включающий код и мультиязычные тексты.

Ключевым технологическим решением стал механизм разреженного внимания LongCat Sparse Attention (LSA). Он минимизирует количество операций, выбирая только наиболее значимые элементы контекста, что позволяет эффективно обрабатывать до 1 млн токенов, приближая сложность вычислений к линейной.
Модель использует архитектуру Mixture of Experts (MoE), где на каждый токен задействуется от 33 до 56 млрд активных параметров. Этот динамический подход обеспечивает экономию ресурсов при выполнении простых запросов и максимальную точность при обработке сложных задач.
Для повышения качества ответов применяется метод дистилляции MOPD (Multi-Teacher On-Policy Distill). Система объединяет знания трех групп экспертов:
- Агентные эксперты: специализируются на управлении инструментами и API.
- Reasoning-эксперты: отвечают за многошаговую логику и STEM-дисциплины.
- Интерактивные эксперты: минимизируют галлюцинации и обеспечивают строгое следование инструкциям.
Согласно результатам тестов, модель демонстрирует высокий уровень в программировании и агентных задачах. В бенчмарке SWE-bench Pro система набрала 59,5 балла, показав результаты, сопоставимые с топовыми решениями отрасли. Также впечатляющие показатели зафиксированы в Terminal-Bench 2.1 и задачах для веб-агентов.
Практическое применение LongCat-2.0 включает автоматизацию работы с SQL, рефакторинг сложных кодовых баз, генерацию полноценных веб-приложений и создание 3D-сцен на базе Three.js. Подобные разработки подтверждают, что создание моделей с триллионным масштабом на локальных вычислительных мощностях стало реальностью, усиливая технологическую конкуренцию на мировом рынке искусственного интеллекта.






