Запознайте се с аутсайдера Saluki 27B: 2-битов Qwen3.8-27B, който надминава оригинала при извикване на инструменти
Underdog, асистентът на устройството от Conway Research, пусна Saluki 27B под лиценза Apache 2.0. Underdog Saluki 27B е 2-битов GGUF на Qwen3.8-27B, който се побира в 7.89 GB. Пълният BF16 модел изисква 54 GB. Underdog е настроил компресията така, че да защити извикването на инструменти — умението, което превръща чат модел в агент. За разработчиците това означава агентен модел от клас 27B, който работи в стандартния llama.cpp.
Накратко
- Размер: 27B плътни параметъра. 7.89 GB GGUF спрямо 54 GB за BF16.
- Работи на: стандартния llama.cpp и приложенията, изградени върху него, с пълно прехвърляне към GPU. Опционален визуален добавъчен модул от 629 MB или 928 MB.
- Производителност: средно запазване на 96% в 9 бенчмарка спрямо пълния Qwen3.8-27B.
- Най-добро: Паралелни извиквания на инструменти — 42 спрямо 35 за пълния модел (120% запазване).
- Най-слабо: AIME 2025 — 79.2 спрямо 96.7 (около 82% запазване).
- Извод:
- Най-добро: превъзхожда оригинала от 54 GB при извикването на инструменти във файл под 8 GB.
- Най-слабо: състезателната математика и многостъпковото разсъждение спадат с 12 до 18 пункта.
Какво представлява Underdog Saluki 27B?
Saluki 27B е 2-битов GGUF със смесена точност на Qwen3.8-27B, създаден за локални агенти. Той съчетава 3 етапа на работа:
- Базата е Qwen3.8-27B, плътен модел с 27B параметъра от екипа на Qwen. Той има 64 слоя, съчетава линейно внимание Gated DeltaNet с gated attention и поддържа 262 144 токена нативно.
- Вторият слой е Qwen3.8-27B-GSQ-RCO-GGUF на ISTA-DASLab. GSQ обучава точни скаларни решетки с малка битова дълбочина за всеки тензор. RCO задава тип квантизация на всеки тензор при фиксиран бюджет за размера. Най-малкият файл на ISTA, IQ2_XS, е 8.4 GB при 2.50 бита на тегло.
- Третият слой е собственият етап на Underdog. Той намалява файла до 7.89 GB и е насочен към извикването на инструменти. Файлът се нарича
IQ2-mixи съдържа imatrix етикет. Underdog не е публикувал пълната рецепта за този етап.
Как се представя Saluki в бенчмарковете?
Underdog разделя резултатите си на 2 групи.
Първата група изпълнява и двата модела в една и съща тестова среда:
- Underdog Bench: 120 задачи от BFCL v4, фиксирани преди тестването. Режимът на разсъждение е изключен, температурата е 0. Saluki получава 88 точки, пълният модел — 84, а Bonsai 2 на PrismML — 70.
- Паралелни извиквания на инструменти: 100 паралелни задачи от BFCL v4 с официалния проверяващ инструмент. Saluki — 42, пълният модел — 35.
- SWE-bench Verified: 50 проблема. Saluki решава 30, а пълният модел — 33.
Втората група сравнява Saluki с публично обявени резултати за пълноразмерни модели:
| Бенчмарк | Saluki 27B | Qwen3.8-27B (публичен) |
|---|---|---|
| IFEval (свободен промпт) | 93.5 | 91.5 |
| IFBench (свободен промпт) | 72.7 | 71.0 |
| MBPP+ | 78.0 | 83.9 |
| MuSR | 67.5 | 79.6 |
| AIME 2025 (avg@4) | 79.2 | 96.7 |
| AIME 2026 (avg@4) | 80.0 | 94.6 |
Как Saluki се сравнява с други компактни версии на Qwen3.8-27B?
| Характеристика | Underdog Saluki 27B | Qwen3.8-27B (BF16) | ISTA GSQ-RCO IQ2_XS | PrismML Bonsai 2 27B (PTQ1_0) |
|---|---|---|---|---|
| Организация | Underdog (Conway Research) | Екипът на Qwen | ISTA-DASLab | PrismML |
| Параметри | 27B | 27B | 27B | 27.36B |
| Размер на файла | 7.89 GB | 54 GB | 8.4 GB | 5.95 GB |
| Битове на тегло | Не е обявено (2-битов микс) | 16 | 2.50 | 1.75 |
| Контекст | Не е обявен | 262 144 нативно | Не е обявен | 262K |
| Зрение | Добавъчен модул, 629 или 928 MB | Нативно | 0.9 GB mmproj | Опционален 0.63 GB |
| Среда за изпълнение | Стандартен llama.cpp | Transformers, vLLM, SGLang | Стандартен llama.cpp, Ollama, LM Studio | Форк на llama.cpp на PrismML |
| Underdog Bench (от 120) | 88 | 84 | Не е обявено | 70 |
| Основен резултат на разработчика | 96% средно запазване, 9 бенчмарка | Базова стойност | 100.3% възстановяване при zero-shot | 98.2% от FP16, 14 бенчмарка |
| Лиценз | Apache 2.0 | Apache 2.0 | Apache 2.0 | Apache 2.0 |
Bonsai 2 е по-малък и отчита 98.2% запазване в 14 бенчмарка в режим на разсъждение. Той също така показва по-силни резултати по математика, включително 95.00 на AIME25. Въпреки това изисква форка на llama.cpp на PrismML, тъй като стандартният llama.cpp отхвърля неговите формати за пакетиране. Saluki работи със стандартния llama.cpp. Всеки разработчик използва собствена тестова среда, затова резултатите между различните разработчици не са пряко сравними.
Основни изводи
- Saluki 27B побира Qwen3.8-27B в 7.89 GB спрямо първоначалните 54 GB.
- Той превъзхожда пълния модел при извикването на инструменти: 88 спрямо 84.
- Паралелните извиквания на инструменти се увеличават от 35 на 42.
- Математиката и разсъждението понасят най-големия спад — до около 82–85%.
- Работи със стандартния llama.cpp под лиценза Apache 2.0.
Разгледайте картата на модела в Hugging Face, страницата за представянето на Underdog и съобщението в X. Всички заслуги са за изследователя на този проект. Също така, не се колебайте да ни последвате в Twitter и не забравяйте да се присъедините към нашия SubReddit с над 150 хил. членове за машинно обучение и да се абонирате за нашия бюлетин. Чакайте! В Telegram ли сте? вече можете да се присъедините към нас и в Telegram.
Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.