Домой Новости ИИ Meituan представила LongCat-2.0: первую LLM с триллионным масштабом, обученную на китайских чипах

Meituan представила LongCat-2.0: первую LLM с триллионным масштабом, обученную на китайских чипах

Система с 1,6 трлн параметров ориентирована на сложные агентные сценарии и была обучена на кластере из 50 тысяч специализированных чипов.

Китайская компания Meituan представила LongCat-2.0 — современную большую языковую модель, насчитывающую 1,6 трлн параметров. Особенностью системы стало её обучение: весь процесс, включая предобучение и инференс, был реализован на вычислительном кластере из 50 тысяч отечественных ASIC-ускорителей. Это делает LongCat-2.0 одним из самых масштабных примеров создания LLM на национальной аппаратной базе.

В данном контексте под ASIC понимаются специализированные чипы, спроектированные для задач машинного обучения. Хотя поставщик оборудования официально не называется, использование коммуникационной библиотеки HCCL (Huawei Collective Communication Library) указывает на тесную интеграцию с экосистемой Huawei.

Архитектура модели ориентирована на агентные сценарии: взаимодействие с API, написание и отладку кода, а также реализацию многошаговых цепочек рассуждений. Для обучения системы использовался корпус данных объемом более 30 трлн токенов, включающий код и мультиязычные тексты.

Meituan представила LongCat-2.0: первую LLM с триллионным масштабом, обученную на китайских чипах
Meituan представила LongCat-2.0: первую LLM с триллионным масштабом, обученную на китайских чипах — иллюстрация к материалу. Источник: ixbt.com

Ключевым технологическим решением стал механизм разреженного внимания LongCat Sparse Attention (LSA). Он минимизирует количество операций, выбирая только наиболее значимые элементы контекста, что позволяет эффективно обрабатывать до 1 млн токенов, приближая сложность вычислений к линейной.

Модель использует архитектуру Mixture of Experts (MoE), где на каждый токен задействуется от 33 до 56 млрд активных параметров. Этот динамический подход обеспечивает экономию ресурсов при выполнении простых запросов и максимальную точность при обработке сложных задач.

Для повышения качества ответов применяется метод дистилляции MOPD (Multi-Teacher On-Policy Distill). Система объединяет знания трех групп экспертов:

  • Агентные эксперты: специализируются на управлении инструментами и API.
  • Reasoning-эксперты: отвечают за многошаговую логику и STEM-дисциплины.
  • Интерактивные эксперты: минимизируют галлюцинации и обеспечивают строгое следование инструкциям.

Согласно результатам тестов, модель демонстрирует высокий уровень в программировании и агентных задачах. В бенчмарке SWE-bench Pro система набрала 59,5 балла, показав результаты, сопоставимые с топовыми решениями отрасли. Также впечатляющие показатели зафиксированы в Terminal-Bench 2.1 и задачах для веб-агентов.

Практическое применение LongCat-2.0 включает автоматизацию работы с SQL, рефакторинг сложных кодовых баз, генерацию полноценных веб-приложений и создание 3D-сцен на базе Three.js. Подобные разработки подтверждают, что создание моделей с триллионным масштабом на локальных вычислительных мощностях стало реальностью, усиливая технологическую конкуренцию на мировом рынке искусственного интеллекта.

Источник: https://www.ixbt.com