Sakhanda Wire
NVDA $223.96 +2.27% MSFT $499.99 +0.03% GOOGL $354.30 -0.96% META $592.10 +0.37% AMZN $274.48 +0.82%
← До новин

Mistral AI випустила Shieldstral 1.0 3B: мультимодальний класифікатор безпеки з відкритими вагами та адаптацією до політик, співставний із моделями у 7 разів більшого розміру

Mistral AI випустила Shieldstral 1.0 3B — мультимодальний класифікатор безпеки з відкритими вагами та адаптацією до політик, який розглядає модерацію контенту як єдине запитання «так/ні», а не як фіксовану таксономію категорій шкоди. Більшість моделей захисних механізмів вбудовують перелік категорій у ваги, тому перенесення такої моделі в новий контекст розгортання потребує повторного навчання — до того ж один і той самий контент може бути прийнятним у дослідницькому інструменті з кібербезпеки, але шкідливим на платформі для психічного здоров’я. Shieldstral змінює цей підхід: оператори формулюють політику звичайною мовою під час інференсу, а модель повертає калібрований показник безпеки за один прямий прохід. Побудована на основі Ministral-3-3B-Base-2512 із вбудованим візуальним енкодером Pixtral і випущена за ліцензією Apache 2.0, модель демонструє середній F1 84,9% для безпеки тексту — на рівні GPT-OSS-Safeguard-20B — і 83,8% для мультимодальної безпеки, випереджаючи всі базові моделі, оцінені Mistral.

Чи придатна вона для розгортання?

Так, і локально. Shieldstral-1.0-3B потребує 16 ГБ відеопам’яті у форматі BF16, працює на одному GPU та ліцензується за Apache 2.0 для комерційного й некомерційного використання. Варіанти запуску вже доступні: vLLM (≥0.26.0, рекомендовано), llama.cpp через конвертацію в GGUF із квантизацією Q8_0/Q5_K_M/Q4_K_M, SGLang і Transformers — а тонке налаштування підтримується через Axolotl. Класифікатор генерує один токен, тому затримка й вартість значно нижчі, ніж у захисних моделей на основі міркувань, таких як GPT-OSS-Safeguard-20B.

  • Для якого рівня компаній: обсяг у 16 ГБ робить модель доступною для команд, що створюють AI-продукти на стадії seed і не можуть обґрунтувати витрати на контракт із постачальником послуг модерації, тоді як відкрита ліцензія та можливість самостійного розгортання підходять для компаній середнього бізнесу й підприємств, яким потрібні захисні механізми всередині VPC або локально з міркувань резидентності даних і аудиту. Постачальники мультитенантних SaaS отримують окрему перевагу — одна контрольна точка може застосовувати різну політику для кожного клієнта.
  • Галузі: споживчі соціальні платформи та платформи користувацького контенту, освітні технології та середовища для безпеки дітей, застосунки для охорони здоров’я й психічного здоров’я, автоматизація підтримки у фінтеху та страхуванні, ігри й голосові чати, маркетплейси та перевірка реклами/креативів, а також розгортання в державному секторі з вимогами щодо суверенітету.
  • Застосування: модерація користувацьких запитів, модерація відповідей моделей, класифікація відмов, перевірка зображень із підписами для реклами й мемів, курування навчальних даних і корпусів RAG, фільтрація результатів в агентних конвеєрах і застосування політик для кожного клієнта. Оскільки результатом є безперервний показник, а не мітка, команди можуть налаштовувати поріг для кожного середовища або передавати сумнівні результати на перевірку людиною замість жорсткого блокування.

Модерація як бінарне запитання

Shieldstral зводить модерацію до одного запитання «так/ні». Фіксоване системне повідомлення визначає завдання; повідомлення користувача містить три поля: <Instruct> (контекст оцінювання та суворість), <Query> (політика, сформульована як одне запитання «так/ні») і <Document> (запит, відповідь, пара запит–відповідь або зображення з необов’язковим текстом).

Під час інференсу модель виконує розгортання лише в напрямку ідентифікаторів токенів yes і no, а потім нормалізує їх за допомогою softmax у безперервний показник із порогом τ=0,5. Це об’єднує класифікацію запитів, модерацію відповідей, виявлення відмов і виявлення токсичності в одну задачу — і означає, що політика повністю міститься в запиті. Mistral рекомендує використовувати одну політику за виклик; для широкого вердикту «безпечний/небезпечний» перелічіть категорії в <Instruct> і поставте одне широке <Query>.

Рецепт підготовки даних

Заявлена перевага походить від даних, а не від масштабу: приблизно 54,1 млн зразків — 45,2 млн текстових зразків із відкритим кодом, 4,4 млн синтетичних контрастивних текстових зразків і 4,5 млн мультимодальних. Рівень уніфікації на основі шаблонів перетворює кожен набір даних на однаковий формат інструкція–запит–документ за допомогою процесорів для окремих наборів даних, із випадковими формулюваннями та каліброваною суворістю (суворою для ворожих джейлбрейків, м’якшою для даних про якість відповідей).

Найцікавіша частина — контрастивна генерація. LLM переписує безпечний текст у небезпечний варіант, який порушує цільову категорію, але навмисно не порушує суміжну, створюючи позитивний і складний негативний приклади на основі ідентичного контенту за один виклик. Це навчає модель визначати, яку саме політику порушено, а не здійснювати грубий поділ на безпечне/небезпечне. Дані зображень — які неможливо синтезувати так само, як текст, — доповнюються загальними наборами зображень як негативними прикладами, мутацією запитів у межах візуальної таксономії з 14 підкатегорій і фільтрацією за допомогою переранжувальника «бачення–мова».

Навчання — це тонке налаштування LoRA, після якого виконується тристороннє злиття SLERP: 0,6 публічних і згенерованих даних, 0,3 лише публічних даних, 0,1 Ministral-3B-Instruct.

Результати

Для безпеки тексту Shieldstral демонструє середній F1 84,9%, зрівнявшись із GPT-OSS-Safeguard-20B (84,9%) як найменша модель у порівнянні, із кращими результатами на ToxicChat (84,1), HarmBench (99,4) і Aegis v2 response (87,2). Для мультимодальної безпеки модель показує 83,8% загалом проти 77,6% у OmniGuard-7B, очолюючи результати на VLGuard (97,7) та UnsafeBench (81,8); LlavaGuard-7B усе ще лідирує на однойменному бенчмарку з результатом 81,4.

На бенчмарку адаптивності — створеному на основі навмисно відмінної таксономії з 12 суперкласів, 26 підкатегорій і 52 кінцевих категорій із 90 фіксованими запитами, де жодна кінцева категорія не відповідає однозначно навчальним даним, — Shieldstral отримує F1 91,3%, поступаючись GPT-OSS-Safeguard-20B (94,1%) і Nemotron-3.5-Safety-4B (91,8%), але без генерації ланцюжка міркувань. Виявлення відмов дає загальний результат 91,5% проти 93,7% у GPT-OSS-Safeguard-20B.

Де модель слабша: класифікація багатомовних запитів відстає для арабської та індонезійської мов, а також для запитів RTP-LX (70,3 проти 86,1 у Nemotron-3.5-Safety-4B). Mistral також відзначає нижчу надійність на ворожих або обфускованих вхідних даних і дуже довгих документах. Навчальний контекст становить 32 тисячі токенів для 12 мов.

Ключові висновки

  • Мультимодальний захисний механізм на 3B із ліцензією Apache 2.0; політика задається звичайномовним запитанням під час інференсу, повторне навчання не потрібне.
  • F1 84,9% для тексту відповідає результату моделі на 20B; мультимодальний F1 83,8% — найкращий серед оцінених базових моделей.
  • 54,1 млн зразків із контрастивними переписуваннями суміжних категорій — фактичний механізм узагальнення політики.
  • Один прямий прохід, один вихідний токен, безперервний показник із τ=0,5 — достатньо дешево для фільтрації в реальному часі.
  • Слабкі місця: малоресурсні мови, обфусковані вхідні дані, довгі документи.

Ознайомтеся зі статтею, моделлю на Hugging Face та технічними деталями. Також підписуйтеся на нас у Twitter і не забудьте приєднатися до нашого сабредіту про машинне навчання зі 150 тис.+ учасників та підписатися на нашу розсилку. Стривайте! Ви є в Telegram? Тепер ви також можете приєднатися до нас у Telegram.

Потрібно співпрацювати з нами для просування вашого репозиторію GitHub, сторінки на Hugging Face, релізу продукту, вебінару тощо? Зв’яжіться з нами

Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.

Вперше опубліковано виданням MarkTechPost

Читати оригінал на MarkTechPost ↗

Текст і зображення належать MarkTechPost і наводяться тут із зазначенням авторства та посиланням на оригінальну публікацію.

← До новин

Ще новини

Усі останні новини