Sakhanda Wire
NVDA — MSFT — GOOGL — META — AMZN —
← До новин

Знайомтеся: аутсайдер Saluki 27B — 2-бітна версія Qwen3.8-27B, яка перевершує оригінал у виклику інструментів

Underdog, асистент на пристрої від Conway Research, випустив Saluki 27B за ліцензією Apache 2.0. Underdog Saluki 27B — це 2-бітний GGUF Qwen3.8-27B, який вміщується у 7,89 ГБ. Повна модель BF16 потребує 54 ГБ. Underdog налаштував стиснення так, щоб зберегти виклик інструментів — навичку, яка перетворює чатову модель на агента. Для розробників це означає агентну модель класу 27B, яка працює у стандартному llama.cpp.

Коротко

  • Розмір: 27B щільних параметрів. 7,89 ГБ у форматі GGUF проти 54 ГБ для BF16.
  • Працює на: стандартному llama.cpp та застосунках на його основі, з повним перенесенням обчислень на GPU. Опційне доповнення для роботи із зором на 629 МБ або 928 МБ.
  • Продуктивність: середнє збереження 96% за 9 бенчмарками порівняно з повною Qwen3.8-27B.
  • Найкращий результат: паралельні виклики інструментів — 42 проти 35 у повної моделі (збереження 120%).
  • Найгірший результат: AIME 2025 — 79,2 проти 96,7 (близько 82% збереження).
  • Підсумок:
    • Найкраще: перевершує оригінал розміром 54 ГБ у виклику інструментів, маючи файл обсягом менш як 8 ГБ.
    • Найгірше: результати змагальних математичних задач і багатокрокового міркування погіршуються на 12–18 пунктів.

Що таке Underdog Saluki 27B?

Saluki 27B — це 2-бітний GGUF Qwen3.8-27B зі змішаною точністю, створений для локальних агентів. Він поєднує 3 етапи роботи:

  • В основі лежить Qwen3.8-27B — щільна модель на 27B параметрів від команди Qwen. Вона має 64 шари, поєднує лінійну увагу Gated DeltaNet із вентильованою увагою та підтримує 262 144 токени у нативному режимі.
  • Другий шар — це Qwen3.8-27B-GSQ-RCO-GGUF від ISTA-DASLab. GSQ навчає точні низькобітові скалярні сітки для кожного тензора. RCO призначає тип квантування кожному тензору в межах фіксованого бюджету розміру. Найменший файл ISTA, IQ2_XS, має розмір 8,4 ГБ і 2,50 біта на вагу.
  • Третій шар — власний етап Underdog. Він зменшив файл до 7,89 ГБ і оптимізував його для виклику інструментів. Файл має назву IQ2-mix і містить тег imatrix. Underdog не опублікував повний опис рецепта цього етапу.

Як Saluki показує себе в бенчмарках?

Underdog поділяє свої результати на 2 групи.

У першій групі обидві моделі тестувалися в одному середовищі:

  • Underdog Bench: 120 завдань із BFCL v4, зафіксованих до тестування. Режим міркування вимкнено, температура — 0. Saluki набирає 88 балів, повна модель — 84, а Bonsai 2 від PrismML — 70.
  • Паралельні виклики інструментів: 100 паралельних завдань BFCL v4 з офіційною перевіркою. Saluki — 42, повна модель — 35.
  • SWE-bench Verified: 50 проблем. Saluki вирішує 30, повна модель — 33.

У другій групі Saluki порівнюється з опублікованими результатами повнорозмірної моделі:

БенчмаркSaluki 27BQwen3.8-27B (публічні дані)
IFEval (prompt-loose)93.591.5
IFBench (prompt-loose)72.771.0
MBPP+78.083.9
MuSR67.579.6
AIME 2025 (avg@4)79.296.7
AIME 2026 (avg@4)80.094.6

Як Saluki порівнюється з іншими компактними збірками Qwen3.8-27B?

ХарактеристикаUnderdog Saluki 27BQwen3.8-27B (BF16)ISTA GSQ-RCO IQ2_XSPrismML Bonsai 2 27B (PTQ1_0)
ОрганізаціяUnderdog (Conway Research)команда QwenISTA-DASLabPrismML
Параметри27B27B27B27.36B
Розмір файлу7,89 ГБ54 ГБ8,4 ГБ5,95 ГБ
Бітів на вагуНе розкрито (2-бітний мікс)162,501,75
КонтекстНе розкрито262 144 у нативному режиміНе розкрито262K
ЗірДоповнення, 629 або 928 МБНативнийmmproj на 0,9 ГБОпційний, 0,63 ГБ
Середовище виконанняСтандартний llama.cppTransformers, vLLM, SGLangСтандартний llama.cpp, Ollama, LM StudioФорк llama.cpp від PrismML
Underdog Bench (зі 120)8884Не розкрито70
Заявлений постачальником показник96% середнього збереження, 9 бенчмарківБазовий рівень100,3% відновлення у режимі zero-shot98,2% від FP16, 14 бенчмарків
ЛіцензіяApache 2.0Apache 2.0Apache 2.0Apache 2.0

Bonsai 2 має менший розмір і демонструє 98,2% збереження за 14 бенчмарками в режимі міркування. Він також показує кращі результати з математики, зокрема 95,00 на AIME25. Однак для нього потрібен форк llama.cpp від PrismML, оскільки стандартний llama.cpp відхиляє його формати пакування. Saluki працює на стандартному llama.cpp. Кожен постачальник використовує власне середовище тестування, тому результати різних постачальників не можна безпосередньо порівнювати.

Ключові висновки

  • Saluki 27B вміщує Qwen3.8-27B у 7,89 ГБ замість 54 ГБ.
  • Вона перевершує повну модель у виклику інструментів: 88 проти 84.
  • Кількість паралельних викликів інструментів зростає з 35 до 42.
  • Найбільше погіршуються результати з математики та міркування — приблизно до 82–85%.
  • Вона працює у стандартному llama.cpp за ліцензією Apache 2.0.

Перегляньте картку моделі на Hugging Face, сторінку запуску Underdog та анонс у X. Уся подяка досліднику цього проєкту. Також підписуйтеся на нас у Twitter і не забудьте приєднатися до нашого сабреддіту про машинне навчання з понад 150 тисячами учасників та підписатися на нашу розсилку. Стривайте! Ви є в Telegram? тепер ви також можете приєднатися до нас у Telegram.

Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.

Вперше опубліковано виданням MarkTechPost

Читати оригінал на MarkTechPost ↗

Текст і зображення належать MarkTechPost і наводяться тут із зазначенням авторства та посиланням на оригінальну публікацію.

← До новин

Ще новини

Усі останні новини