Sakhanda Wire
NVDA MSFT GOOGL META AMZN
← До новин

webAI представила TwIL-LM: сімейство моделей формальної логіки на 1,7 і 3 млрд параметрів для автоформалізації на локальному обладнанні

webAI випустила TwIL-LMсімейство з двох моделей для міркувань у формальній логіці з 1,7 млрд і 3 млрд параметрів. Модель із 3 млрд параметрів, TwIL-LM3, є об’єднаною донавченою версією SmolLM3-3B; модель із 1,7 млрд параметрів є адаптером PEFT LoRA для SmolLM2-1.7B-Instruct. Обидві моделі призначені для автоформалізації: перекладу англійської мови в логіку першого порядку та перевірки того, чи випливає висновок із передумов. Обидві працюють локально: для моделі 1,7B доступна квантизована збірка обсягом 1,06 ГБ, а для 3B — GGUF Q4_K_M обсягом 1,78 ГіБ. В анонсі webAI описує реліз як такий, що перевершує gpt-oss-120b у чотирьох із п’яти напрямів формального міркування.

Чи придатна вона до розгортання?

Частково. Наразі лише для некомерційного використання.

Обидві контрольні точки поширюються за Ліцензією webAI для некомерційного використання вер. 1.0. Для розгортання, що приносить дохід, потрібна окрема угода з webAI.

  • Рівень компанії: будь-який розмір. GGUF 3B Q4_K_M має обсяг 1,78 ГіБ і працює на CPU або з 4 ГБ VRAM. Версія 1.7B Q4_K_M має обсяг 1,06 ГБ.
  • Галузі: комплаєнс і RegTech, фінансові послуги, охорона здоров’я та фармацевтика, юридичні й контрактні операції, дослідження формальних методів. webAI позиціонує локальне виконання для середовищ, де дані не можуть залишати пристрій.
  • Застосування: переклад логіки першого порядку (FOL), класифікація логічного слідування над наборами передумов, перетворення природної мови на структурований запит, підготовка та критика формалізацій у Lean, а також рівень верифікації, що перевіряє результат більшої моделі.

Як було створено TwIL-LM3?

На базовій моделі виконано чотири етапи. Контрольоване донавчання LoRA на синтетичному корпусі з формальної логіки. Злиття контрольних точок — усереднення контрольних точок SFT у просторі параметрів. Інтерполяція WiSE-FT назад до попередньо навченої базової моделі на рівні λ = 0.25. Потім MGPO — етап GRPO із вагами на основі ентропії, виконаний за допомогою програмного верифікатора. Опублікована контрольна точка — крок 2071.

Це λ має вирішальне значення: зберігається лише чверть різниці після донавчання. Споріднена версія, у якій пропустили інтерполяцію, отримала вищий результат у домені — 0,515 за макроворотами, — але втратила близько дванадцяти пунктів у здатності на відкладених даних. webAI не опублікувала цю версію.

Продуктивність

В анонсі webAI наведено результати 96,4 для виведення правил, 87,6 для семантичного парсингу, 64,6 для формалізації в Lean, 52,0 для відповідей у точному форматі та 68,7 для маркування логічного слідування.

Зазначено два треки. На треку A, присвяченому формальній логіці в межах домену, TwIL-LM3 набирає 0,4488 за середнім показником шести напрямів і 0,4218 за макроворотами — метрикою, на яку орієнтується навчальний процес. Вона випереджає кожну версію аж до LFM2.5-8B-A1B включно за всіма шістьма цільовими напрямами: 0,4218 проти 0,3757, маючи втричі менше параметрів. Вона не випереджає дві найбільші версії. Qwen3-8B отримує показник 0,5336 проти 0,4218, але більша частина цього результату припадає на зарахування за вільним збігом; за суворим критерієм strict-7 показники становлять 0,2093 і 0,1971 відповідно. gpt-oss-120b отримує 0,5192 проти 0,4488 за середнім показником шести напрямів.

Саме ефективність є однозначною перевагою, зазначеною в картці моделі. TwIL-LM3 генерує найкоротші відповіді серед усіх версій — 482 токени на треку B — і, відповідно, забезпечує найбільшу кількість відповідей за секунду: 32,9 проти 4,2 у 120B.

Перенесення на відкладені дані

TwIL-LM3 покращує результат у межах домену на +26% відносно: макроворота зростає з 0,336 до 0,422, водночас середній показник на відкладеному ядрі збільшується на +0,022. У картці моделі зазначено, що це єдина версія в проєкті, яка покращує результати на обох треках. LogicBench зростає з 0,6467 до 0,7167. GSM8K дещо знижується — з 0,8833 до 0,8733, а IFEval погіршується з 0,6767 до 0,6433.

Модель 1.7B демонструє інший компроміс. Її основний макропоказник становить 0,361 проти 0,185 у неадаптованої базової моделі. Результати поза розподілом неоднозначні: LogicBench BQA покращується з 0,563 до 0,590, тоді як GSM8K знижується з 0,413 до 0,380, а ARC-C із ланцюжком міркувань — з 0,587 до 0,463.

Ключові висновки

  • TwIL-LM3 (3B) і TwIL-LM (1.7B) призначені для формальної логіки; обидві моделі поширюються за некомерційною ліцензією.
  • Версія TwIL-LM3, доступна для завантаження, поступається gpt-oss-120b за середнім показником шести напрямів: 0,4488 проти 0,5192.
  • Її справжня перевага — ефективність: 32,9 відповіді/с за довжини генерацій 482 токени.
  • Саме WiSE-FT із λ = 0.25 не дає перевагам у межах домену зруйнувати продуктивність на відкладених даних.

Перегляньте ваги моделі і технічні деталі. Також підписуйтеся на нас у Twitter і не забудьте приєднатися до нашого сабреддіту про машинне навчання із понад 150 тис. учасників та підписатися на нашу розсилку. Стривайте! Ви є в Telegram? Тепер ви також можете приєднатися до нас у Telegram.

Потрібно співпрацювати з нами для просування вашого репозиторію GitHub, сторінки Hugging Face, релізу продукту, вебінару тощо? Зв’яжіться з нами

Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.

Вперше опубліковано виданням MarkTechPost

Читати оригінал на MarkTechPost ↗

Текст і зображення належать MarkTechPost і наводяться тут із зазначенням авторства та посиланням на оригінальну публікацію.

← До новин

Ще новини

Усі останні новини