Знакомьтесь: аутсайдер Saluki 27B — 2-битная версия Qwen3.8-27B, превосходящая оригинал в вызове инструментов
Underdog, ассистент, работающий на устройстве, от Conway Research выпустил Saluki 27B по лицензии Apache 2.0. Underdog Saluki 27B — это 2-битная модель GGUF на основе Qwen3.8-27B, занимающая 7,89 ГБ. Полная модель BF16 требует 54 ГБ. Underdog настроила сжатие таким образом, чтобы сохранить возможность вызова инструментов — навык, превращающий чат-модель в агента. Для разработчиков это означает агентскую модель класса 27B, работающую в стандартной версии llama.cpp.
Кратко
- Размер: 27B плотных параметров. 7,89 ГБ в формате GGUF против 54 ГБ для BF16.
- Работает на: стандартной llama.cpp и приложениях на её основе, с полной выгрузкой на GPU. Опциональное дополнение для поддержки зрения объёмом 629 или 928 МБ.
- Производительность: среднее сохранение 96% результатов в 9 тестах по сравнению с полной Qwen3.8-27B.
- Лучший результат: параллельные вызовы инструментов — 42 против 35 у полной модели (сохранение 120%).
- Худший результат: AIME 2025 — 79,2 против 96,7 (примерно 82% сохранения).
- Итог:
- Лучшее: превосходит оригинальную модель объёмом 54 ГБ в вызове инструментов, занимая менее 8 ГБ.
- Худшее: результаты в соревновательной математике и многошаговом рассуждении снижаются на 12–18 пунктов.
Что такое Underdog Saluki 27B?
Saluki 27B — это 2-битная модель GGUF со смешанной точностью на основе Qwen3.8-27B, созданная для локальных агентов. Она объединяет 3 этапа работы:
- В основе лежит Qwen3.8-27B — плотная модель на 27B параметров от команды Qwen. Она содержит 64 слоя, сочетает линейное внимание Gated DeltaNet с управляемым вниманием и поддерживает 262 144 токена изначально.
- Второй слой — это Qwen3.8-27B-GSQ-RCO-GGUF от ISTA-DASLab. GSQ обучает точные скалярные сетки с низкой разрядностью для каждого тензора. RCO назначает тип квантования каждому тензору в рамках фиксированного ограничения на размер. Самый компактный файл ISTA, IQ2_XS, занимает 8,4 ГБ при 2,50 бита на вес.
- Третий слой — собственная обработка Underdog. Она уменьшила размер файла до 7,89 ГБ и оптимизировала его для вызова инструментов. Файл называется
IQ2-mixи содержит тег imatrix. Underdog не опубликовала полный рецепт этой обработки.
Как Saluki показывает себя в тестах?
Underdog разделяет результаты на 2 группы.
В первой группе обе модели запускались в одном и том же тестовом окружении:
- Underdog Bench: 120 задач из BFCL v4, зафиксированных до начала тестирования. Режим рассуждений отключён, температура — 0. Saluki набрала 88 баллов, полная модель — 84, а Bonsai 2 от PrismML — 70.
- Параллельные вызовы инструментов: 100 параллельных задач BFCL v4 с официальной проверкой. Saluki — 42, полная модель — 35.
- SWE-bench Verified: 50 задач. Saluki исправила 30, полная модель — 33.
Во второй группе Saluki сравнивается с опубликованными результатами полноразмерной модели:
| Тест | Saluki 27B | Qwen3.8-27B (опубликованные данные) |
|---|---|---|
| IFEval (prompt-loose) | 93.5 | 91.5 |
| IFBench (prompt-loose) | 72.7 | 71.0 |
| MBPP+ | 78.0 | 83.9 |
| MuSR | 67.5 | 79.6 |
| AIME 2025 (avg@4) | 79.2 | 96.7 |
| AIME 2026 (avg@4) | 80.0 | 94.6 |
Как Saluki сравнивается с другими компактными сборками Qwen3.8-27B?
| Характеристика | Underdog Saluki 27B | Qwen3.8-27B (BF16) | ISTA GSQ-RCO IQ2_XS | PrismML Bonsai 2 27B (PTQ1_0) |
|---|---|---|---|---|
| Организация | Underdog (Conway Research) | команда Qwen | ISTA-DASLab | PrismML |
| Параметры | 27B | 27B | 27B | 27.36B |
| Размер файла | 7,89 ГБ | 54 ГБ | 8,4 ГБ | 5,95 ГБ |
| Бит на вес | Не раскрыто (смесь 2-битных форматов) | 16 | 2.50 | 1.75 |
| Контекст | Не раскрыто | 262 144 токена изначально | Не раскрыто | 262K |
| Зрение | Дополнение, 629 или 928 МБ | Встроенная поддержка | mmproj 0,9 ГБ | Опционально, 0,63 ГБ |
| Среда выполнения | Стандартная llama.cpp | Transformers, vLLM, SGLang | Стандартная llama.cpp, Ollama, LM Studio | Форк llama.cpp от PrismML |
| Underdog Bench (из 120) | 88 | 84 | Не раскрыто | 70 |
| Заявленный производителем показатель | Среднее сохранение 96%, 9 тестов | Базовый уровень | 100,3% восстановления в режиме zero-shot | 98,2% от FP16, 14 тестов |
| Лицензия | Apache 2.0 | Apache 2.0 | Apache 2.0 | Apache 2.0 |
Bonsai 2 меньше по размеру и сообщает о сохранении 98,2% результатов в 14 тестах в режиме рассуждений. Она также показывает более высокие результаты в математике, включая 95,00 на AIME25. Однако для неё требуется форк llama.cpp от PrismML, поскольку стандартная llama.cpp отклоняет используемые форматы упаковки. Saluki работает в стандартной llama.cpp. Каждый производитель использует собственное тестовое окружение, поэтому результаты разных производителей нельзя напрямую сравнивать.
Ключевые выводы
- Saluki 27B помещает Qwen3.8-27B в 7,89 ГБ вместо 54 ГБ.
- Она превосходит полную модель в вызове инструментов: 88 против 84.
- Количество параллельных вызовов инструментов увеличивается с 35 до 42.
- Наибольшие потери наблюдаются в математике и рассуждении — показатели снижаются примерно до 82–85%.
- Она работает в стандартной llama.cpp по лицензии Apache 2.0.
Ознакомьтесь с карточкой модели на Hugging Face, страницей запуска Underdog и объявлением в X. Все заслуги принадлежат исследователю этого проекта. Также подписывайтесь на нас в Twitter и не забудьте присоединиться к нашему сабреддиту о машинном обучении с более чем 150 тысячами участников и подписаться на нашу рассылку. Постойте! Вы есть в Telegram? теперь к нам можно присоединиться и в Telegram.
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.