
Судячи з тенденцій, Meta не бажала чекати на реліз Qwen 3.8 27B і вирішила випустити свою нову LLM швидше за китайських колег.
Meta Superintelligence Labs оголосила про вихід Muse Glimmer - нової моделі, яка стає доступною як відкриті ваги під ліцензією Apache 2.0. Цей 30-мільярдний монстр оптимізований для роботи без постійного підключення до хмарних сервісів, дозволяючи користувачам запускати складні AI-завдання прямо на своїх персональних пристроях.
Сьогодні Meta Superintelligence Labs виклала на huggingface відкриті ваги Muse Glimmer - наступний прорив у сфері штучного інтелекту. Модель, яка має 30 мільярдів параметрів, була розроблена з акцентом на сценарії "агентів", що працюють у режимі постійної готовності (always-on).
Ключова перевага Muse Glimmer полягає в її ефективності: вона достатньо компактна, щоб працювати на звичайних Mac або PC з однією споживчою відеокартою (від 16 ГБ для кванту Q4/IQ4). Це відкриває двері для широкого спектру застосувань: від локальних агентів та функціонального виклику (function calling) до локального кодування та оцінки LLM-а як судді (LLM-as-a-Judge). Завдяки своїй архітектурі, Muse Glimmer демонструє високу продуктивність у ключових агентних завданнях, не поступаючись лідерам свого розміру.
⤢ ВІДКРИТИХоча локальні моделі досягли вражаючих результатів у логічному мисленні, генерації коду та використанні інструментів, більшість з них все ще залежать від хмарної інфраструктури та стабільного доступу до мережі.
Muse Glimmer змінює цю парадигму. Запускаючи моделі локально, користувачі отримують повну автономію: доступ до ШІ будь-де, будь-коли, незалежно від наявності інтернету. Це стає все більш реальним завдяки спільноті open source, яка доводить, що менші моделі, які проходять якісне навчання, можуть досягати продуктивності, близької до найпередових моделей, у вузькоспеціалізованих завданнях. Muse Glimmer була спеціально оптимізована для цих локальних сценаріїв.
Відповідно до традиції Meta щодо поширення фундаментальних досліджень у сфері ШІ, Muse Glimmer сьогодні доступна як open weights (відкриті ваги) на Hugging Face. Разом із моделлю Meta надала деталізовану документацію для розробників, щоб спростити процес створення та запуску власних агентів. Модель розроблена для безшовної інтеграції з інструментами, які вже використовуються спільнотою. Оптимізовані інтеграції для llama.cpp, MLX та ExecuTorch будуть доступні найближчими днями, що дозволить перейти від завантаження до функціонального агента за лічені хвилини.
У релізному пості, Meta оцінила Muse Glimmer за широким спектром бенчмарків, щоб виміряти її здатність до автономної поведінки. Порівняно з Gemma4-31B та Qwen3.6-26B, Muse Glimmer показує сильні результати для свого класу та розміру на багатьох широко використовуваних LLM бенчмарках.
Ключ до локальної ефективності - це швидкість. Агент, який відповідає або планує наступний крок протягом хвилин, руйнує потік реальної роботи. Meta застосувала дві критичні оптимізації, щоб Muse Glimmer працювала на практичних швидкостях на спожившому обладнанні, не жертвуючи якістю.
1. Адаптація моделі до пристрою (Квантування):У повній точності 30B модель вимагала б понад 55 ГБ пам'яті, що значно більше, ніж пропонує будь-який споживчий GPU. Meta використовує техніки квантування для стиснення ваг моделі до приблизно 4-бітної точності, зменшуючи розмір мовної моделі до 20 ГБ і менше. Це залишає достатньо "вільного простору" для робочої пам'яті моделі (контекст / KV cache), модуля сприйняття зображень та спекулятивного декодера (маленької MTP моделі), щоб усе це могло працювати одночасно в межах 24 ГБ або 32 ГБ. Meta підтвердила, що це стиснення не призводить до деградації логіки в агентних завданнях.
2. Прискорення генерації через Speculative Decoding:Мовні моделі зазвичай генерують текст токен за токеном, що може здаватися повільним під час довгих ланцюжків логічного мислення. Muse Glimmer постачається з легкою "драфт" (draft) моделлю на основі DFlash, невеликою супутньою мережею, яка спекулятивно підкидує цілі блоки токенів одночасно. Основна модель потім перевіряє ці пропозиції паралельно, приймаючи правильні токени та виправляючи неправильні. Ця техніка дозволяє Muse Glimmer генерувати текст значно швидше, ніж стандартна генерація токен за токеном, зберігаючи при цьому ідентичну якість виводу. Для випуску ми надаємо квантовані версії драфт-моделей, щоб мінімізувати додаткове навантаження на пам'ять.
Meta вимірювала швидкість Q4_K кванту вагою 17GB моделі разом із квантованим драфтером DFlash на MacBook M4-Max, M4-Max та на RTX-5090, і виявила, що модель достатньо швидка для плавної розмови та взаємодії в реальному часі, при цьому весь процес відбувається повністю на локальному пристрої.
Muse Glimmer доступна вже зараз. Ви можете завантажити ваги на Hugging Face. У найближчі дні ви зможете запустити її локально через таких партнерів Meta, як Ollama, LM Studio та Unsloth. Ви також можете розгорнути її за допомогою edge-фреймворків, включаючи llama.cpp, ExecuTorch та MLX, або обслуговувати її в масштабі за допомогою vLLM та SGLang.
Ви навіть можете налаштувати модель під свої потреби, використовуючи функцію TorchTitan від PyTorch для подальшої кастомізації.
Meta активно працює з партнерами, включаючи AMD, ARM, Dell, Intel та NVIDIA, для оптимізації продуктивності на різних пристроях. Крім того, Meta випускає багату документацію, щоб розробники мали всі необхідні ресурси для початку роботи та відповідального використання Muse Glimmer. Це включає посібники зі налаштування власних сценаріїв (scaffolds), що робить старт створення особистих агентів на перший день максимально простим.
Muse Glimmer це продовження багаторічної історії Meta у сфері відкритих досліджень ШІ, розширюючи її у сферу агентного ШІ та надаючи розробникам доступ до локальних можливостей агентів.