JetBrains представила Mellum2.1: відкриту MoE-модель на 12 млрд параметрів для агентів програмування
JetBrains випустила Mellum2.1 — відкриту модель, створену для агентів програмування та швидких субагентів. Mellum2.1 — це мисленнєва модель із сумішшю експертів на 12B параметрів від JetBrains, яка активує 2,5B параметрів на токен. Вона доступна за ліцензією Apache 2.0 на Hugging Face. Архітектура не змінилася порівняно з Mellum2. Оновлення майже повністю забезпечене навчанням із підкріпленням (RL) у реальних програмних середовищах. У результаті отримано невелику модель, яку можна розгортати самостійно: вона досліджує репозиторій, редагує файли та перевіряє власні зміни.
Коротко
- Розмір: 12B загалом, 2,5B активних (64 експерти, 8 активних), контекст на 131 072 токени
- Працює на: ваших власних GPU через vLLM або SGLang (швидкість протестовано на 1 NVIDIA H200). Збірки GGUF починаються від 7,0 ГБ для llama.cpp, Ollama та LM Studio.
- Продуктивність: перевершує Mellum2 у 15 із 17 зазначених бенчмарків; перемагає Qwen3.5-9B у 5 із 17
- Найкращий результат: 82,0 у LiveCodeBench v6, попереду Qwen3.5-9B (75,4) і Gemma 4 E4B (69,4)
- Найгірший результат: 17,4 у Terminal-Bench 2.1, нижче за Qwen3.5-9B (21,7)
- Підсумок (найкраще): високі результати в програмуванні та висока пропускна здатність лише з 2,5B активних параметрів.
- Підсумок (найгірше): усе ще поступається Qwen3.5-9B у складних агентних програмних завданнях і знаннях.
Що таке Mellum2.1?
Mellum2.1 — це наступна версія Mellum2 Thinking, яку JetBrains відкрила у червні 2026 року. Опублікований чекпойнт — Mellum2.1-12B-A2.5B-Thinking. Це модель міркування, яка перед відповіддю видає свій ланцюжок міркувань. JetBrains орієнтує її на 3 способи використання: агент-робітник, універсальний помічник із міркувань і приватне самостійне розгортання.
Як працює архітектура Mellum2.1?
Модель має 28 шарів і 64 експерти. Маршрутизатор активує 8 експертів на токен. У механізмі уваги використовується увага з групованими запитами: 32 голови запитів і 4 голови KV. У 3 із кожних 4 шарів використовується ковзне вікно на 1 024 токени. Довжина контексту становить 131 072 токени, а словник має 98 304 токени. Ваги постачаються у форматі bfloat16.
Як навчали Mellum2.1?
Майже вся нова робота була зосереджена на донавчанні. RL перейшло з короткого фінального етапу до основної частини навчання. JetBrains додала завдання RL із математики, змагального програмування, науки, використання інструментів і програмної інженерії. Компанія відфільтрувала відкриті набори даних RL, вилучивши зламані тести, відповіді, які неможливо перевірити, а також надто прості або неможливі завдання. Для програмної інженерії модель навчається в реальних репозиторіях із доступом до оболонки та інструментів редагування файлів. Вона отримує винагороду, коли тести проходять. Під час навчання було запущено мільйони ізольованих середовищ у тисячах середовищ.
Як Mellum2.1 показує себе в бенчмарках?
JetBrains оцінила Mellum2.1, Mellum2, Qwen3.5-9B і Gemma 4 E4B за допомогою одного пайплайна в режимі мислення. Усі результати самостійно оприлюднені JetBrains.
Найбільший стрибок відбувся в агентному програмуванні. Результат SWE-bench Verified зріс із 2,0 до 47,0. SWE-bench Pro зріс із 0,0 до 28,0. Terminal-Bench 2.1 зріс із 0,6 до 17,4. Для агентних запусків використовувався рушій із відкритим кодом Pi v0.73.1 із контекстом на 114 тисяч токенів.
Mellum2.1 очолює групу в LiveCodeBench v6 (82,0), HumanEval+ (91,5), MBPP+ (79,4) і BFCL v4 (62,3). Qwen3.5-9B усе ще лідирує в SWE-bench Verified (50,0), SWE-bench Pro (38,0), AIME 25/26 (86,7) і GPQA Diamond (77,8). Безпека також покращилася: показник HarmBench знизився з 21,5 до 8,5, а менше значення є кращим.
Важливо враховувати пайплайни. У власній картці Qwen зазначено 65,6 у LiveCodeBench v6 і 81,7 у GPQA Diamond. JetBrains виміряла для тієї самої моделі 75,4 і 77,8.
Наскільки швидка Mellum2.1?
Донавчання не змінило архітектуру, тож швидкість відповідає Mellum2. На 1 H200 під значним навантаженням JetBrains заявляє, що Mellum2.1 обслуговує майже вдвічі більше токенів, ніж Qwen3.5-9B. Для одного запиту багатотокенове передбачення (MTP) робить її приблизно в 1,6 раза швидшою. Головку MTP для спекулятивного декодування у vLLM обіцяють додати найближчим часом.
Як запустити Mellum2.1 локально?
Повна модель запускається у vLLM із параметром --reasoning-parser qwen3. Виклик інструментів додає --enable-auto-tool-choice --tool-call-parser hermes. JetBrains рекомендує temperature 0,6, top_p 0,95 і top_k 20.
У примітках до випуску JetBrains зазначено, що збірки GGUF перебувають у процесі підготовки. У репозиторії GGUF уже перелічено 5 файлів:
- BF16: 24,3 ГБ (еталон)
- Q8_0: 12,9 ГБ, 96,1% збігу топового токена
- Q6_K: 10,9 ГБ, 93,9% збігу топового токена
- Q4_K_M: 8,1 ГБ, 88,0% збігу топового токена (рекомендовано)
- MXFP4_MOE: 7,0 ГБ, 85,6% збігу топового токена
Mellum2.1 проти Qwen3.5-9B і Gemma 4 E4B
| Характеристика | Mellum2.1 | Mellum2 Thinking | Qwen3.5-9B | Gemma 4 E4B |
|---|---|---|---|---|
| Архітектура | MoE, 64 експерти, 8 активних | MoE (така сама, як у 2.1) | Hybrid Gated DeltaNet + gated attention | Щільна, з вбудовуваннями для кожного шару |
| Загальна кількість параметрів | 12B | 12B | 9B (мовна модель) | 8B із вбудовуваннями |
| Активні / ефективні параметри | 2,5B активних | 2,5B активних | 9B (щільна) | 4,5B ефективних |
| Контекст | 131 072 | 131 072 | 262 144 нативно, до 1 010 000 | 128K |
| Модальність | Текст | Текст | Текст, зображення, відео | Текст, зображення, аудіо |
| Ліцензія | Apache 2.0 | Apache 2.0 | Apache 2.0 | Apache 2.0 |
| LiveCodeBench v6* | 82,0 | 69,4 | 75,4 | 69,4 |
| SWE-bench Verified* | 47,0 | 2,0 | 50,0 | 23,0 |
| Terminal-Bench 2.1* | 17,4 | 0,6 | 21,7 | 3,4 |
| BFCL v4* | 62,3 | 49,6 | 58,5 | 52,5 |
| GPQA Diamond* | 64,6 | 51,0 | 77,8 | 53,1 |
| AIME 25/26* | 83,3 | 60,1 | 86,7 | 45,0 |
*Рядки з бенчмарками: спільний пайплайн JetBrains, режим мислення, із картки моделі Mellum2.1. У власних картках розробники наводять інші результати для Qwen3.5-9B і Gemma 4 E4B.
Основні висновки
- Mellum2.1 — це мисленнєва модель MoE на 12B параметрів із 2,5B активних параметрів, доступна за ліцензією Apache 2.0.
- RL у реальних репозиторіях підвищило результат SWE-bench Verified із 2,0 до 47,0.
- Вона очолює протестовану групу в LiveCodeBench v6 (82,0) і BFCL v4 (62,3).
- Qwen3.5-9B усе ще перемагає в SWE-bench Pro, GPQA Diamond і AIME.
- GGUF-версія розміром від 7,0 до 8,1 ГБ робить локальні субагенти для програмування практичними.
Перегляньте ваги моделі, збірки GGUF, технічний блог і технічний звіт Mellum2. Уся подяка належить досліднику цього проєкту. Також підписуйтеся на нас у Twitter і не забудьте приєднатися до нашого сабреддіту про машинне навчання зі 150 тисячами+ учасників та підписатися на нашу розсилку. Стривайте! Ви є в Telegram? тепер ви також можете приєднатися до нас у Telegram.
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.