Sakhanda Wire
NVDA MSFT GOOGL META AMZN
← Към новините

webAI представи TwIL-LM: семейство модели за формална логика с 1,7 и 3 млрд. параметри за автоформализация на локален хардуер

webAI пусна TwIL-LM, семейство от два модела за разсъждение във формалната логика със 1,7B и 3B параметъра. Моделът 3B, TwIL-LM3, е обединен фино настроен модел на базата на SmolLM3-3B; моделът 1,7B е PEFT LoRA адаптер за SmolLM2-1.7B-Instruct. И двата са насочени към автоформализация: превод на английски език на логика от първи ред и проверка дали дадено заключение следва от предпоставките му. И двата работят локално, като за 1,7B има квантизирана версия от 1,06 GB, а за 3B — GGUF файл с размер 1,78 GiB и Q4_K_M. В съобщението си webAI представя изданието чрез превъзходството му над gpt-oss-120b в четири от пет направления на формалното разсъждение.

Може ли да бъде внедрен?

Частично. Към момента — само за некомерсиална употреба.

И двата контролни пункта се разпространяват под Лиценза на webAI за некомерсиална употреба, версия 1.0. Внедряването с цел генериране на приходи изисква отделно споразумение с webAI.

  • Ниво на компанията: всякакъв размер. GGUF файлът Q4_K_M за 3B е 1,78 GiB и работи на CPU или с 4 GB VRAM. Q4_K_M версията за 1,7B е 1,06 GB.
  • Индустрии: съответствие и RegTech, финансови услуги, здравеопазване и фармацевтика, правни и договорни операции, изследвания във формалните методи. webAI позиционира локалното изпълнение за среди, в които данните не могат да напускат устройството.
  • Приложения: превод към логика от първи ред (FOL), класификация на логическата последица върху множества от предпоставки, преобразуване на естествен език в структурирана заявка, създаване и критика на формализации в Lean и слой за верификация, който проверява резултата на по-голям модел.

Как е създаден TwIL-LM3?

Върху базовия модел са приложени четири етапа. Контролирано фино настройване с LoRA върху синтетичен корпус по формална логика. Сливане на контролни пунктове чрез усредняване на междинни SFT контролни пунктове в пространството на параметрите. Интерполация с WiSE-FT обратно към предварително обучения базов модел при λ = 0.25. След това MGPO — претеглен според ентропията етап на GRPO, изпълнен спрямо програмна верификация. Публикуваният контролен пункт е стъпка 2071.

Това λ е от съществено значение: запазва се само една четвърт от промяната вследствие на финото настройване. Паралелна версия, която пропуска интерполацията, постигна по-висок резултат в домейна — 0,515 при макрогейта, но загуби приблизително дванадесет пункта от способностите си при задържаните данни. webAI не публикува тази версия.

Производителност

В съобщението си webAI посочва резултати от 96,4 при извеждане на правила, 87,6 при семантично парсване, 64,6 при формализация в Lean, 52,0 при отговори в точен формат и 68,7 при означаване на логическа последица.

Отчетени са два тестови потока. В поток A, за формална логика в рамките на домейна, TwIL-LM3 постига 0,4488 при средната стойност за шестте направления и 0,4218 при макрогейта — метриката, спрямо която се управлява обучаващият процес. Той води всички версии до и включително LFM2.5-8B-A1B във всичките шест целеви направления — 0,4218 спрямо 0,3757 при една трета от параметрите. Не води двете най-големи версии. Qwen3-8B печели при гейта с 0,5336 срещу 0,4218, но по-голямата част от това се дължи на кредит за свободно съвпадение; при strict-7 резултатите са съответно 0,2093 и 0,1971. gpt-oss-120b печели средната стойност за шестте направления с 0,5192 срещу 0,4488.

Именно ефективността е аспектът, по който картата на модела е категорична. TwIL-LM3 генерира най-кратките отговори от всички версии — 482 токена в поток B — и съответно предоставя най-много отговори в секунда: 32,9 спрямо 4,2 за версията 120B.

Трансфер при задържани данни

TwIL-LM3 се подобрява в рамките на домейна с +26% относително — макрогейтът нараства от 0,336 до 0,422 — като същевременно печели +0,022 при средната стойност за основните задържани данни. В картата на модела се посочва, че това е единствената версия в проекта, която постига подобрение и в двата потока. LogicBench нараства от 0,6467 до 0,7167. GSM8K леко спада от 0,8833 до 0,8733, а IFEval регресира от 0,6767 до 0,6433.

Моделът 1,7B представлява различен компромис. Основният му резултат при макрогейта е 0,361 спрямо 0,185 за неадаптираната базова версия. Резултатите извън разпределението са смесени: LogicBench BQA се подобрява от 0,563 до 0,590, докато GSM8K спада от 0,413 до 0,380, а ARC-C с верига от мисли спада от 0,587 до 0,463.

Основни изводи

  • TwIL-LM3 (3B) и TwIL-LM (1,7B) са насочени към формалната логика и двата се разпространяват под некомерсиален лиценз.
  • Пуснатият TwIL-LM3 изостава от gpt-oss-120b при средната стойност за шестте направления — 0,4488 срещу 0,5192.
  • Истинското му предимство е ефективността: 32,9 отговора в секунда при генериране на 482 токена.
  • Именно WiSE-FT при λ = 0.25 предотвратява срива на производителността при задържани данни въпреки подобренията в рамките на домейна.

Разгледайте теглата на модела и техническите подробности. Също така можете да ни последвате в Twitter и не забравяйте да се присъедините към нашия SubReddit с над 150 хил. членове за машинно обучение и да се абонирате за нашия бюлетин. Чакайте! В Telegram ли сте? Вече можете да се присъедините към нас и в Telegram.

Искате да си партнирате с нас за популяризиране на вашето GitHub хранилище ИЛИ страница в Hugging Face, ИЛИ представяне на продукт, ИЛИ уебинар и т.н.? Свържете се с нас

Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.

Първоначално публикувано от MarkTechPost на

Прочетете оригинала в MarkTechPost ↗

Текстът и изображенията са собственост на MarkTechPost и са възпроизведени тук с посочване на авторството и връзка към оригиналната публикация.

← Към новините

Още новини

Всички последни новини