Знайомтеся: аутсайдер Saluki 27B — 2-бітна версія Qwen3.8-27B, яка перевершує оригінал у виклику інструментів
Underdog, асистент на пристрої від Conway Research, випустив Saluki 27B за ліцензією Apache 2.0. Underdog Saluki 27B — це 2-бітний GGUF Qwen3.8-27B, який вміщується у 7,89 ГБ. Повна модель BF16 потребує 54 ГБ. Underdog налаштував стиснення так, щоб зберегти виклик інструментів — навичку, яка перетворює чатову модель на агента. Для розробників це означає агентну модель класу 27B, яка працює у стандартному llama.cpp.
Коротко
- Розмір: 27B щільних параметрів. 7,89 ГБ у форматі GGUF проти 54 ГБ для BF16.
- Працює на: стандартному llama.cpp та застосунках на його основі, з повним перенесенням обчислень на GPU. Опційне доповнення для роботи із зором на 629 МБ або 928 МБ.
- Продуктивність: середнє збереження 96% за 9 бенчмарками порівняно з повною Qwen3.8-27B.
- Найкращий результат: паралельні виклики інструментів — 42 проти 35 у повної моделі (збереження 120%).
- Найгірший результат: AIME 2025 — 79,2 проти 96,7 (близько 82% збереження).
- Підсумок:
- Найкраще: перевершує оригінал розміром 54 ГБ у виклику інструментів, маючи файл обсягом менш як 8 ГБ.
- Найгірше: результати змагальних математичних задач і багатокрокового міркування погіршуються на 12–18 пунктів.
Що таке Underdog Saluki 27B?
Saluki 27B — це 2-бітний GGUF Qwen3.8-27B зі змішаною точністю, створений для локальних агентів. Він поєднує 3 етапи роботи:
- В основі лежить Qwen3.8-27B — щільна модель на 27B параметрів від команди Qwen. Вона має 64 шари, поєднує лінійну увагу Gated DeltaNet із вентильованою увагою та підтримує 262 144 токени у нативному режимі.
- Другий шар — це Qwen3.8-27B-GSQ-RCO-GGUF від ISTA-DASLab. GSQ навчає точні низькобітові скалярні сітки для кожного тензора. RCO призначає тип квантування кожному тензору в межах фіксованого бюджету розміру. Найменший файл ISTA, IQ2_XS, має розмір 8,4 ГБ і 2,50 біта на вагу.
- Третій шар — власний етап Underdog. Він зменшив файл до 7,89 ГБ і оптимізував його для виклику інструментів. Файл має назву
IQ2-mixі містить тег imatrix. Underdog не опублікував повний опис рецепта цього етапу.
Як Saluki показує себе в бенчмарках?
Underdog поділяє свої результати на 2 групи.
У першій групі обидві моделі тестувалися в одному середовищі:
- Underdog Bench: 120 завдань із BFCL v4, зафіксованих до тестування. Режим міркування вимкнено, температура — 0. Saluki набирає 88 балів, повна модель — 84, а Bonsai 2 від PrismML — 70.
- Паралельні виклики інструментів: 100 паралельних завдань BFCL v4 з офіційною перевіркою. Saluki — 42, повна модель — 35.
- SWE-bench Verified: 50 проблем. Saluki вирішує 30, повна модель — 33.
У другій групі Saluki порівнюється з опублікованими результатами повнорозмірної моделі:
| Бенчмарк | Saluki 27B | Qwen3.8-27B (публічні дані) |
|---|---|---|
| IFEval (prompt-loose) | 93.5 | 91.5 |
| IFBench (prompt-loose) | 72.7 | 71.0 |
| MBPP+ | 78.0 | 83.9 |
| MuSR | 67.5 | 79.6 |
| AIME 2025 (avg@4) | 79.2 | 96.7 |
| AIME 2026 (avg@4) | 80.0 | 94.6 |
Як Saluki порівнюється з іншими компактними збірками Qwen3.8-27B?
| Характеристика | Underdog Saluki 27B | Qwen3.8-27B (BF16) | ISTA GSQ-RCO IQ2_XS | PrismML Bonsai 2 27B (PTQ1_0) |
|---|---|---|---|---|
| Організація | Underdog (Conway Research) | команда Qwen | ISTA-DASLab | PrismML |
| Параметри | 27B | 27B | 27B | 27.36B |
| Розмір файлу | 7,89 ГБ | 54 ГБ | 8,4 ГБ | 5,95 ГБ |
| Бітів на вагу | Не розкрито (2-бітний мікс) | 16 | 2,50 | 1,75 |
| Контекст | Не розкрито | 262 144 у нативному режимі | Не розкрито | 262K |
| Зір | Доповнення, 629 або 928 МБ | Нативний | mmproj на 0,9 ГБ | Опційний, 0,63 ГБ |
| Середовище виконання | Стандартний llama.cpp | Transformers, vLLM, SGLang | Стандартний llama.cpp, Ollama, LM Studio | Форк llama.cpp від PrismML |
| Underdog Bench (зі 120) | 88 | 84 | Не розкрито | 70 |
| Заявлений постачальником показник | 96% середнього збереження, 9 бенчмарків | Базовий рівень | 100,3% відновлення у режимі zero-shot | 98,2% від FP16, 14 бенчмарків |
| Ліцензія | Apache 2.0 | Apache 2.0 | Apache 2.0 | Apache 2.0 |
Bonsai 2 має менший розмір і демонструє 98,2% збереження за 14 бенчмарками в режимі міркування. Він також показує кращі результати з математики, зокрема 95,00 на AIME25. Однак для нього потрібен форк llama.cpp від PrismML, оскільки стандартний llama.cpp відхиляє його формати пакування. Saluki працює на стандартному llama.cpp. Кожен постачальник використовує власне середовище тестування, тому результати різних постачальників не можна безпосередньо порівнювати.
Ключові висновки
- Saluki 27B вміщує Qwen3.8-27B у 7,89 ГБ замість 54 ГБ.
- Вона перевершує повну модель у виклику інструментів: 88 проти 84.
- Кількість паралельних викликів інструментів зростає з 35 до 42.
- Найбільше погіршуються результати з математики та міркування — приблизно до 82–85%.
- Вона працює у стандартному llama.cpp за ліцензією Apache 2.0.
Перегляньте картку моделі на Hugging Face, сторінку запуску Underdog та анонс у X. Уся подяка досліднику цього проєкту. Також підписуйтеся на нас у Twitter і не забудьте приєднатися до нашого сабреддіту про машинне навчання з понад 150 тисячами учасників та підписатися на нашу розсилку. Стривайте! Ви є в Telegram? тепер ви також можете приєднатися до нас у Telegram.
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.