Meta Muse Glimmer пренася локални AI агенти на потребителски GPU
Meta пуска Muse Glimmer под лиценз Apache 2.0 за локални AI агенти, които могат да работят на потребителски GPU.
Лабораторията за суперинтелигентност на компанията публикува теглата на модела с 30 милиарда параметъра в Hugging Face. Meta посочва, че разработчиците могат да го използват за локално програмиране, извикване на функции, локални агенти и оценяване от типа LLM-as-a-judge.
Релийзът е насочен към оперативно ограничение, пред което са изправени AI екипите: хостваните в облака модели се нуждаят от мрежов достъп и централизирана инфраструктура. Вместо това Meta представя Muse Glimmer за работни натоварвания, които изискват модел на устройството, включително персонални агенти с достъп до графици, съобщения, файлове и друг личен контекст.
Meta Muse Glimmer води в няколко бенчмарка за агентни задачи
Бенчмарк тестовете на Meta поставят Muse Glimmer пред Gemma4-31B и Qwen3.6-27B в пет от осем общи агентни бенчмарка. Моделът получава 75.5 в MCP Atlas. Gemma4-31B достига 54.2, а Qwen3.6-27B записва 62.5.
DeepSearch QA показва сходен резултат. Meta съобщава резултат от 74.6 за Muse Glimmer срещу 61.7 за Gemma4-31B и 71.1 за Qwen3.6-27B. Предоставеното съобщение определя и двата бенчмарка като тестове на способността на агента да работи в рамките на зададени структури и да изпълнява многостъпкови заявки.
Моделът получава 23.5 в τ²-Banking. Gemma4-31B записва 15.1. Qwen3.6-27B достига 16.7.
Muse Glimmer също постига 47.6 в WildClawBench, пред 37.6 за Gemma4-31B и 43.2 за Qwen3.6-27B. Резултатът му в GAIA2 достига 43.3, в сравнение съответно с 36.4 и 40.0.
Други резултати за агенти са в полза на Qwen3.6-27B. Таблицата на Meta дава на този модел 1 141 в GDPval-AA срещу 953 за Muse Glimmer и 811 за Gemma4-31B. Qwen3.6-27B също води в SkillsBench with Skills с 46.6, докато Muse Glimmer записва 44.3.
OSWorld-Verified показва най-голямата разлика в тази група. Meta съобщава 75.6 за Qwen3.6-27B. Muse Glimmer достига 65.9, а Gemma4-31B получава 58.5.
Тези тестове измерват задачи с ограничения. Те не показват как ще се държи локален агент, след като организация свърже към него собствените си файлове, календари, системи за съобщения или вътрешни инструменти.
Резултатите от програмирането разделят Muse Glimmer и Qwen
Резултатите на Muse Glimmer в програмирането показват по-тясно сравнение. Моделът води в SWE-Bench Pro с резултат 51.2. Meta съобщава 36.9 за Gemma4-31B и 50.2 за Qwen3.6-27B.
SciCode дава близък резултат. Muse Glimmer получава 43.6, малко над Gemma4-31B с 43.4. Qwen3.6-27B записва 39.8.
Qwen3.6-27B води в още две оценки на програмирането. Той получава 77.2 в SWE-Bench Verified в сравнение със 76.0 за Muse Glimmer. TerminalBench 2.1 дава на Qwen3.6-27B резултат 60.7; Muse Glimmer достига 51.7, а Gemma4-31B записва 43.4.
Локалният агент за програмиране прави повече от това да създава код. Той се нуждае от структура, която определя до кои хранилища, терминали, тестови среди и команди може да получи достъп моделът. Meta посочва, че Muse Glimmer поддържа OpenClaw и други модели за оркестрация на агенти, а персонализираните структури са описани в документацията за разработчици.
Организация, която оценява модела за софтуерна работа, трябва да определи наличните за агента команди и хранилища, преди да измери успеха при изпълнение на задачите. Предоставеният материал описва обучение за повторни опити при неуспешни извиквания на инструменти. Това поведение изисква контрол върху повторните опити, особено когато даден инструмент може да променя изходния код или да извиква външна система.
Мултимодалните резултати са в полза на Qwen в повечето тестове
Muse Glimmer приема редуващи се текст и изображения чрез специален енкодер за възприятие. Meta посочва, че този дизайн позволява на агентите да интерпретират екранни снимки, диаграми и документи като част от разговор.
Диаграмата с резултатите поставя Muse Glimmer начело в Charxiv Reasoning. Резултатът му достига 78.8 срещу 77.7 за Gemma4-31B и 78.4 за Qwen3.6-27B.
Qwen3.6-27B води в ScreenSpot Pro със 76.1. Muse Glimmer записва 75.4, а Gemma4-31B получава 75.9. Същият модел води и в OmniDocBench v1.5 със 77.8 в сравнение със 75.8 за Muse Glimmer и 72.5 за Gemma4-31B.
MMMU Pro показва по-малки разлики. Meta посочва 74 за Muse Glimmer. Qwen3.6-27B достига 75, а Gemma4-31B записва 73.
Тези резултати са важни за екипи, които обмислят агенти, действащи чрез визуални интерфейси. Моделът за разчитане на екранни снимки може да интерпретира видяното, но локалното тестване все пак трябва да обхваща разрешенията, оформленията на дисплея, форматите на документите и грешките, връщани от свързаните инструменти.
Данните за безопасността показват по-нисък отчетен процент на успешни атаки от Qwen
Meta съобщава и за две оценки, свързани с безопасността: CI Memories и Siren AgentDojo. Диаграмата използва различни показатели за всеки тест.
При CI Memories Meta посочва процент на нарушенията от 26.4 за Muse Glimmer и оценка за покритие от 64.8. Gemma4-31B записва процент на нарушенията от 12.1 с покритие 53.0. Qwen3.6-27B постига процент на нарушенията от 53.4 и покритие 66.9.
Резултатът от Siren AgentDojo използва процент на успешните атаки и полезност. Meta дава на Muse Glimmer процент на успешните атаки от 28.4 и оценка за полезност 94.2. Gemma4-31B получава 25.6 за процента на успешните атаки, а полезността му е 90.8. Qwen3.6-27B записва съответно 40.3 и 92.7.
Резултатите от общото разсъждение добавят контекст към твърденията за агентите
Muse Glimmer води в четири от шестте теста за общи способности и разсъждение в сравнението на Meta. Той получава 77.0 в IFBench. Gemma4-31B записва 76.0, а Qwen3.6-27B достига 70.8.
Резултатът в AIME 2026 е 94.7 за Muse Glimmer. Meta съобщава 89.2 за Gemma4-31B и 94.1 за Qwen3.6-27B. В AA-LCR Muse Glimmer достига 80.0, пред 68.3 и 73.3.
Моделът също води в Beam 128K с 65.1. Qwen3.6-27B получава 63.0. Gemma4-31B записва 58.2.
Gemma4-31B води в GPQA Diamond с 85.7. Muse Glimmer получава 83.5, следван от Qwen3.6-27B с 84.2. Gemma4-31B също постига най-високия резултат в Humanity’s Last Exam, Text No Tools — 23.6; Muse Glimmer достига 22.0.
Нито един модел не води във всеки тест. Вместо това резултатите на Meta показват, че Muse Glimmer се конкурира близко с два модела с подобен размер в смесена група от оценки за агенти, програмиране, визуални възможности, безопасност и разсъждение.
Ограниченията на паметта оформят дизайна за локално внедряване
Meta посочва, че модел с 30 милиарда параметъра в пълна точност би изисквал повече от 55 GB памет. Вместо това Muse Glimmer използва приблизително 4-битова квантизация на теглата, което намалява езиковия модел до под 20 GB.
Това разпределение оставя памет за KV кеш. Моделът също се нуждае от място за енкодера за възприятие и за модел, генериращ предварителни токени при спекулативно декодиране. Meta цели обем на паметта от 24 GB или 32 GB за тези компоненти.
Компанията посочва, че моделът за предварително генериране, базиран на DFlash, предлага блокове от токени, които основният модел проверява паралелно. Meta твърди, че това ускорява генерирането в сравнение със стандартния изход токен по токен и запазва идентично качество на резултата. Предоставената публикация не включва данни за токени в секунда, размери на заявките, консумация на енергия или резултати при едновременна работа.
Meta е тествала своята версия K-Quant-17GB с квантизиран модел за предварително генериране DFlash на хардуер MacBook M4-Max, хардуер MacBook M5-Max и RTX-5090. Компанията описва полученото изживяване като подходящо за плавни разговори и взаимодействие с агенти в реално време.
Публичните тегла са достъпни чрез Hugging Face. Meta посочва, че интеграциите с llama.cpp, MLX и ExecuTorch ще бъдат налични през следващите дни.
Вижте също: Alibaba тества нов бизнес модел за Qwen — AI с отворен код
Искате ли да научите повече за AI и големите данни от лидери в индустрията? Посетете AI & Big Data Expo, което ще се проведе в Амстердам, Калифорния и Лондон. Всеобхватното събитие е част от TechEx и се провежда едновременно с други водещи технологични събития, включително Cyber Security & Cloud Expo. Натиснете тук за повече информация.
AI News се поддържа от TechForge Media. Разгледайте други предстоящи събития и уебинари за корпоративни технологии тук.
Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.