Meta Muse Glimmer переносит локальных ИИ-агентов на потребительские GPU
Meta выпускает Muse Glimmer под лицензией Apache 2.0 для локальных ИИ-агентов, способных работать на потребительском графическом процессоре.
Подразделение компании Superintelligence Labs опубликовало веса модели с 30 миллиардами параметров на Hugging Face. Meta заявляет, что разработчики могут использовать её для локального программирования, вызова функций, локальных агентов и оценки по принципу LLM-as-a-judge.
Релиз направлен на решение операционного ограничения, с которым сталкиваются команды, работающие с ИИ: размещённым в облаке моделям необходим доступ к сети и централизованная инфраструктура. Вместо этого Meta предлагает Muse Glimmer для задач, требующих модели на устройстве, включая персональных агентов с доступом к расписаниям, сообщениям, файлам и другому приватному контексту.
Meta Muse Glimmer лидирует в нескольких бенчмарках агентских задач
Согласно результатам бенчмарков Meta, Muse Glimmer опередила Gemma4-31B и Qwen3.6-27B в пяти из восьми общих агентских бенчмарков. Модель набрала 75,5 балла в MCP Atlas. Gemma4-31B получила 54,2, а Qwen3.6-27B — 62,5.
DeepSearch QA демонстрирует схожую картину. Meta сообщает, что Muse Glimmer набрала 74,6 балла против 61,7 у Gemma4-31B и 71,1 у Qwen3.6-27B. В представленном анонсе указано, что оба бенчмарка проверяют способность агента работать в рамках заданных оболочек и выполнять многошаговые запросы.
Модель набрала 23,5 балла в τ²-Banking. Gemma4-31B получила 15,1. Qwen3.6-27B набрала 16,7.
Muse Glimmer также получила 47,6 в WildClawBench, опередив Gemma4-31B с результатом 37,6 и Qwen3.6-27B с результатом 43,2. В GAIA2 она набрала 43,3 против 36,4 и 40,0 соответственно.
В других агентских тестах преимущество оказалось у Qwen3.6-27B. Согласно таблице Meta, эта модель набрала 1 141 балл в GDPval-AA против 953 у Muse Glimmer и 811 у Gemma4-31B. Qwen3.6-27B также лидировала в SkillsBench with Skills с результатом 46,6, тогда как Muse Glimmer набрала 44,3.
OSWorld-Verified продемонстрировал самый большой разрыв в этой группе. Meta сообщает о результате 75,6 для Qwen3.6-27B. Muse Glimmer набрала 65,9, а Gemma4-31B — 58,5.
Эти тесты измеряют результаты в ограниченных задачах. Они не показывают, как будет вести себя локальный агент после подключения организации к её собственным файлам, календарям, системам обмена сообщениями или внутренним инструментам.
Результаты программирования разделились между Muse Glimmer и Qwen
Результаты Muse Glimmer в программировании демонстрируют более узкое сравнение. Модель возглавила SWE-Bench Pro с результатом 51,2. Meta сообщает о 36,9 для Gemma4-31B и 50,2 для Qwen3.6-27B.
SciCode продемонстрировал близкие результаты. Muse Glimmer набрала 43,6, незначительно опередив Gemma4-31B с результатом 43,4. Qwen3.6-27B получила 39,8.
Qwen3.6-27B лидировала в двух других оценках программирования. Она набрала 77,2 в SWE-Bench Verified против 76,0 у Muse Glimmer. В TerminalBench 2.1 Qwen3.6-27B получила 60,7; Muse Glimmer набрала 51,7, а Gemma4-31B — 43,4.
Локальный агент для программирования делает больше, чем просто создаёт код. Ему нужна оболочка, определяющая, к каким репозиториям, терминалам, тестовым средам и командам модель может получить доступ. Meta заявляет, что Muse Glimmer поддерживает OpenClaw и другие схемы оркестрации агентов, а пользовательские оболочки описаны в документации для разработчиков.
Организации, оценивающей модель для работы с программным обеспечением, следует определить доступные агенту команды и репозитории до измерения успешности выполнения задач. В представленном материале описывается обучение повторным попыткам при неудачных вызовах инструментов. Такое поведение требует контроля за повторными попытками, особенно если инструмент может изменять исходный код или вызывать внешнюю систему.
В большинстве мультимодальных тестов преимущество у Qwen
Muse Glimmer принимает чередующиеся текст и изображения через специализированный модуль восприятия. Meta заявляет, что такая архитектура позволяет агентам интерпретировать скриншоты, диаграммы и документы в рамках диалога.
Согласно таблице бенчмарков, Muse Glimmer опередила соперников в Charxiv Reasoning. Её результат составил 78,8 против 77,7 у Gemma4-31B и 78,4 у Qwen3.6-27B.
Qwen3.6-27B лидировала в ScreenSpot Pro с результатом 76,1. Muse Glimmer набрала 75,4, а Gemma4-31B — 75,9. Эта же модель возглавила OmniDocBench v1.5 с результатом 77,8 против 75,8 у Muse Glimmer и 72,5 у Gemma4-31B.
MMMU Pro продемонстрировал меньшие различия. Meta указывает для Muse Glimmer результат 74. Qwen3.6-27B набрала 75, а Gemma4-31B — 73.
Эти результаты важны для команд, рассматривающих агентов, взаимодействующих с визуальными интерфейсами. Модель, способная читать скриншоты, может интерпретировать увиденное, однако локальное тестирование всё равно должно охватывать разрешения, компоновку экранов, форматы документов и ошибки, возвращаемые подключёнными инструментами.
Показатели безопасности демонстрируют более низкую заявленную успешность атак по сравнению с Qwen
Meta также сообщает о двух оценках, связанных с безопасностью: CI Memories и Siren AgentDojo. Для каждого теста на диаграмме используются разные показатели.
В CI Memories Meta указывает для Muse Glimmer частоту нарушений 26,4 и показатель охвата 64,8. Gemma4-31B продемонстрировала частоту нарушений 12,1 при охвате 53,0. Для Qwen3.6-27B указана частота нарушений 53,4 и охват 66,9.
В Siren AgentDojo используются показатели успешности атак и полезности. Meta указывает для Muse Glimmer успешность атак 28,4 и показатель полезности 94,2. Gemma4-31B получила 25,6 по успешности атак, а её полезность составила 90,8. Qwen3.6-27B показала результаты 40,3 и 92,7.
Результаты в области общего рассуждения дополняют заявления об агентских возможностях
Muse Glimmer возглавила четыре из шести тестов общих возможностей и рассуждения в сравнении Meta. В IFBench она набрала 77,0. Gemma4-31B получила 76,0, а Qwen3.6-27B — 70,8.
В AIME 2026 Muse Glimmer набрала 94,7. Meta сообщает о 89,2 для Gemma4-31B и 94,1 для Qwen3.6-27B. В AA-LCR Muse Glimmer получила 80,0, опередив модели с результатами 68,3 и 73,3.
Модель также лидировала в Beam 128K с результатом 65,1. Qwen3.6-27B набрала 63,0. Gemma4-31B получила 58,2.
Gemma4-31B возглавила GPQA Diamond с результатом 85,7. Muse Glimmer набрала 83,5, за ней следует Qwen3.6-27B с результатом 84,2. Gemma4-31B также показала лучший результат в Humanity’s Last Exam, Text No Tools, — 23,6; Muse Glimmer набрала 22,0.
Ни одна модель не лидирует во всех тестах. Результаты Meta показывают, что Muse Glimmer ведёт близкую борьбу с двумя моделями аналогичного размера в смешанном наборе оценок агентских, программистских, визуальных, связанных с безопасностью и логических возможностей.
Ограничения памяти определяют конфигурацию локального развёртывания
Meta заявляет, что полноточной модели с 30 миллиардами параметров потребуется более 55 ГБ памяти. Вместо этого Muse Glimmer использует квантование весов примерно до 4 бит, уменьшая объём языковой модели до менее чем 20 ГБ.
Такое распределение оставляет память для KV-кэша. Модели также требуется место для модуля восприятия и средства формирования черновика для спекулятивного декодирования. Meta ориентируется на объём памяти 24 или 32 ГБ для этих компонентов.
Компания заявляет, что средство формирования черновика на базе DFlash предлагает основную модели блоки токенов для параллельной проверки. По словам Meta, это ускоряет генерацию по сравнению со стандартной выдачей токенов один за другим и сохраняет идентичное качество вывода. В представленном сообщении не приводятся показатели токенов в секунду, размеры запросов, данные об энергопотреблении или результаты при параллельной работе.
Meta тестировала версию K-Quant-17GB со средством формирования квантованного черновика DFlash на оборудовании MacBook M4-Max, MacBook M5-Max и RTX-5090. Компания описывает полученный опыт как подходящий для плавного общения и взаимодействия с агентом в реальном времени.
Общедоступные веса доступны через Hugging Face. Meta заявляет, что интеграции с llama.cpp, MLX и ExecuTorch появятся в ближайшие дни.
См. также: Alibaba тестирует новую бизнес-модель для ИИ Qwen с открытым исходным кодом
Хотите узнать больше об ИИ и больших данных от лидеров отрасли? Посетите AI & Big Data Expo, которая пройдёт в Амстердаме, Калифорнии и Лондоне. Это масштабное мероприятие является частью TechEx и проводится одновременно с другими ведущими технологическими мероприятиями, включая Cyber Security & Cloud Expo. Нажмите здесь, чтобы получить дополнительную информацию.
AI News работает при поддержке TechForge Media. Ознакомьтесь с другими предстоящими мероприятиями и вебинарами для предприятий в области технологий здесь.
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.