Sakhanda Wire
NVDA $230.69 +0.09% MSFT $529.83 +1.38% GOOGL $352.15 +1.11% META $719.19 -0.24% AMZN $258.57 +1.78%
← До новин

Модель, якої не існувало, тож ви створили її самі

Моделі не існувало, тож ви створили її самі
Опубліковано 8 жовтня 2026 року
Оновити на GitHub
Минулого тижня я хотів отримати невелику версію переписувача промптів, який постачається з Qwen-Image 2.1. Офіційна версія — це модель на 9 млрд параметрів, якій потрібно близько 20 ГБ пам’яті й яка обмірковує запит тисячі токенів, перш ніж написати один абзац. На Hub я знайшов лише стиснені копії тієї самої моделі на 9 млрд параметрів. Тож я описав, чого хочу, ML Intern, а наступного дня вже мав версію на 0,8 млрд параметрів, яка працює на CPU. Вона повертає коректний результат у 99,7% випадків і використовує приблизно чверть токенів учителя. Обчислення для всього проєкту, включно з розміткою моделлю на 9 млрд параметрів 8 797 прикладів запитів, коштували 16 доларів США.

Протягом наступних кількох днів я створив ще п’ять моделей у такий самий спосіб. Кожна починалася з повідомлення в HuggingChat з увімкненим ML-intern, а завершувалася публічною моделлю на Hub з оцінюванням у картці моделі. ML-intern планує роботу, запитує в мене бюджет, перш ніж щось витрачати, запускає невеликий тест перед основним завданням, а потім навчає, оцінює та публікує модель на обладнанні Hugging Face.

Як я формулюю запити до ML Intern

Саме першому повідомленню я приділяю найбільше уваги. Мій перший промпт для моделі citrus, про яку йдеться нижче, містив близько 450 слів. До шостого проєкту він зріс майже до 2 000 слів, адже кожен проєкт навчав мене чогось, що я хотів додати до наступного. Усі сім промптів є на GitHub за адресою yvrjsharma/ml-intern-prompts — саме такими, якими я їх написав.

Промпт починається з ідеї в одному рядку та пояснення, навіщо вона мені потрібна. Потім у ньому вказуються точні складові: датасет, базова модель, скрипт навчання. Усе, що я вже перевірив, потрапляє під заголовок, який буквально звучить як "Перевірені факти, не виводити повторно", щоб агент витрачав бюджет на роботу, а не на повторне відкриття того, що мені вже відомо. Для LoRA з кутом огляду камери в цьому розділі було зазначено, який тренер щойно отримав підтримку прозорих зображень і які відкриті проблеми на GitHub робили резервний тренер ризикованим.

Два рядки в промпті є критично важливими. Перший вимагає отримати базовий результат до початку будь-якого навчання. Наприклад, у промпті citrus сказано: "Також повідомте оцінку базової моделі без навчання за тією самою метрикою, щоб ми могли побачити покращення." Без цього ви отримуєте навчену модель і не маєте уявлення, чи краща вона за початкову. Другий — це димовий тест із перевіркою. Для LoRA зображень я попросив виконати 50 кроків навчання, а потім перевірити, чи справді збережені ваги змінилися, перш ніж оплачувати повний запуск.

Наприкінці промпту я описую очікувані результати й обмежую вартість. Я визначаю, що має міститися в картці моделі, і додаю інструкцію на кшталт: "Обмежте загальні витрати сумою 12 доларів США та запитайте мене, перш ніж перевищувати її." Оскільки ML-intern починає кожне завдання з нульовим бюджетом і потребує дозволу перед виконанням платних завдань, це обмеження витрат суворо дотримується. Якщо не вказати бюджет, агент запропонує кілька варіантів залежно від масштабу проєкту й запитає, якому з них ви надаєте перевагу.

Не обов’язково робити все це з першої спроби. Наприклад, у моєму описі citrus не було розділу verified-facts, але ML Intern усе одно створив модель, яка більш ніж утричі підвищила точність моделі Qwen3.5-2B. Дозвольте розповісти про 6 речей, які я створив за допомогою Ml-Intern лише за кілька днів.

1. Модель, яка знається на вашій галузі

Загальна модель комп’ютерного зору може описати пожовклий лист цитрусового дерева. Однак визначити, чи це проблема з кліщами або дефіцит магнію, а також запропонувати біологічні й небіологічні засоби лікування рослини, дуже складно. За допомогою Claude я зібрав навчальний датасет із трьох джерел, розміщених організацією Project-AgML на Hub. Отриманий citrus-disease-vlm-instruct — це датасет із 3 017 анотованих зображень, що охоплюють 21 різного шкідника, хворобу, дефіцит поживних речовин і підхід до лікування. ML-intern виконав донавчання Qwen3.5-2B на цих прикладах, попередньо перевіривши базову модель.

На 335 тестових фотографіях базова модель правильно визначала проблему у 14,9% випадків. Після двох епох на одній A10G донавчена модель досягла 52,8%. Вартість обчислень — близько 1,90 долара США.

Переглянути: Модель · Датасет · Застосунок Citrus Doctor

2. Модель, яка малює вашого персонажа

Моделі зображень знають безліч персонажів. Huggy, намальований у пласкому стилі фірмових матеріалів Hugging Face, серед них не був. Я попросив ML-Intern створити LoRA для FLUX.2 klein base 4B, навчену на 84 зображеннях із підписами з датасету Chunte/huggy_for_training.

Агент зберігав контрольну точку кожні 100 кроків і створював той самий набір промптів для кожної з них, що спростило вибір. Крок 200 став першим, на якому Huggy повністю відповідав моделі. Починаючи з кроку 500, стиль Huggy почав проникати в промпти, які не мали до нього жодного стосунку! Навчена LoRA також працює на дистильованій моделі klein за 4 кроки. Вартість обчислень — близько 7,60 долара США.

Переглянути: Модель · Датасет · Застосунок Huggy Generator

3. Модель, яка вміє робити новий трюк

  1. LoRA для кута огляду камери — одні з найпопулярніших доповнень спільноти для попередніх моделей Qwen-Image. Ви можете дати моделі зображення об’єкта й попросити показати його під кутом 45 градусів зліва. Коли через кілька днів після випуску Qwen-Image 2.1 я перевірив ситуацію, ніхто ще не створив таку модель, тож доручив ML-intern розробити її.

Qwen camera angle LoRA

ML-intern відобразив 1 030 відсканованих побутових об’єктів із Google Scanned Objects під 24 кутами кожен — 24 722 прозорі зображення — у CPU-завданні, яке коштувало кілька центів. Пізніше він відібрав 461 об’єкт для навчання та 40 для тестування, а також 1 844 пари зображень до і після навчання, рівномірно розподілені між 23 інструкціями щодо камери.

Навчання тривало 2 000 кроків, приблизно 90 хвилин, на одному A100 (~3,75 долара США). Увесь проєкт зайняв близько половини дня та 48 завдань, включно з тими, що завершилися помилкою через відсутні пакети або неправильні шляхи й були повторно надіслані ML-Intern. Загальна вартість обчислень — близько 16 доларів США.

Переглянути: Модель · Датасет · Застосунок Viewpoint Orbit

  1. Doodle-in LoRA — ще одна цікава ідея. Завантажте фотографію з пурпуровим начерком і додайте короткий промпт із назвою об’єкта. LoRA замінює начерк цим об’єктом, зберігаючи початкове освітлення та композицію.

Для цього не існувало датасету, тож у своєму промпті я описав, як його створити. Потрібно взяти реальну фотографію з Open Images, видалити один об’єкт за допомогою моделі зафарбовування LaMa й намалювати начерк на місці, де раніше був об’єкт. Незмінена фотографія є цільовим зображенням. ML-intern написав і протестував скрипти створення пар у CPU-пісочниці, а потім запустив їх як GPU-завдання, водночас записуючи автора та ліцензію кожної вихідної фотографії. Він створив 6 042 навчальні пари й тестовий набір із 160 пар, де 40 тестових пар походять із 23 класів об’єктів, які повністю не використовувалися під час навчання.

Перед навчанням він виміряв базову модель самостійно та разом із Viggle turbo LoRA, а також перевірив, що виконання редагувань пакетами створює ідентичні зображення, завдяки чому оцінювання стало дешевшим. Навчання тривало 2 000 кроків — 1 годину 38 хвилин на одному A100 (~4 долари США), а порівняння збережених контрольних точок на 48 тестових парах обрало крок 500.

У поєднанні з Viggle turbo LoRA за 6 кроків LoRA показала дуже добрі результати. 67,5% об’єктів були виявлені там, де їх намалювали, за 4,7 секунди на редагування. Об’єкти з 23 невідомих класів розташовувалися так само надійно, як і решта (65,0% проти 64,2%). Проєкт зайняв трохи більше доби та 59 завдань. Загальна вартість обчислень — близько 24 доларів США.

Переглянути: Модель · Датасет · Застосунок Doodle-in

4. Модель, яка підходить для вашого пристрою

  1. Pocket Rewriter на початку цієї статті — перша з них. ML-intern почав із генерації 8 797 коротких запитів на створення зображень за допомогою невеликої instruct-моделі через Inference Providers, дотримуючись набору, визначеного в моєму промпті: фотографії, плакати, логотипи, інфографіка тощо; приблизно третина запитів вимагала точного тексту в лапках, а багато з них були іншими мовами, не англійською. Потім учитель на 9 млрд параметрів переписав усі їх на одному A100 за 2 години 37 хвилин (~6,50 долара США). Після фільтрації за якістю для навчального датасету було відібрано 1 840 прикладів.
Qwen Image 2.1 Pocket Studio

Навчання студентських моделей на 0,8 млрд і 2 млрд параметрів тривало 12 і 18 хвилин на A10G (0,75 долара США за обидві). Версія на 0,8 млрд також постачається як файл GGUF розміром 812 МБ для запуску на CPU. Проєкт зайняв близько 11 годин і 24 завдання. Загальна вартість обчислень — близько 16 доларів США.

Переглянути: Студентська модель Pocket rewriter 0.8B · Студентська модель 2B · Датасет · Застосунок Pocket Studio · Порівняти вчителя й студента на Rewriter Arena

  1. Agate-Preview-002-4step — друга. Agate Preview 002 від Logolabs — це текстово-зображувальна модель із 260 млн параметрів, достатньо мала для браузера, але їй потрібно 50 кроків із guidance, тобто 100 проходів мережею на одне зображення. Я попросив ML-intern дистилювати її лише до 4 проходів!

Знадобилося два запуски. Під час першого було кешовано 155 000 навчальних зображень як латентні представлення, guidance вбудовано в модель, а кількість кроків поетапно скорочено з 16 до 8 і до 4 — усе на A100. Студентська модель на 4 кроки перевершила запуск учителя на тих самих 4 кроках за GenEval і FID, після чого ML-intern експортував її в ONNX для браузера. Цей запуск тривав близько 13 годин і коштував 22 долари США.

Під час другого запуску я попросив ML-Intern ще трохи покращити студентську модель на 4 кроки. Він створив ще 24 000 пар зображень з учителем на 16 кроках і близько години донавчав на них студентську модель на 4 кроки. GenEval зріс із 0,509 до 0,536 проти 0,563 у вчителя на 50 кроках — лише за 4 кроки (чверть обчислень). ML-intern повторно експортував браузерну версію. Другий запуск тривав близько 8 годин. Загальна вартість обчислень обох запусків — близько 37 доларів США.

Переглянути: Модель Agate на 4 кроки · Датасет · Запустити Agate у браузері · Agate 4-step LIVE

Скільки це коштувало

Модель Базова модель Обчислення
Citrus Doctor Qwen3.5-2B 1,90 долара США
Huggy LoRA FLUX.2 klein base 4B 7,60 долара США
Pocket rewriter (0,8B і 2B) Qwen3.5-0.8B і 2B 16,05 долара США
Viewpoint Orbit LoRA Qwen-Image 2.1 16 доларів США
Doodle-in LoRA Qwen-Image 2.1 24,30 долара США
Agate 4-step (два запуски) Agate Preview 002 37 доларів США
Усього близько 103 доларів США

Це витрати на GPU- та CPU-завдання, зазначені для кожного сеансу.

Створіть власну

ML-intern доступний у HuggingChat. Увімкніть режим ML-intern і вставте промпт. Якщо вам потрібна відправна точка, мої приклади промптів можна вільно копіювати. Почніть із моделі, яка, на вашу думку, мала б існувати, і датасету, який у вас є або який ви можете описати. Дайте їй невеликий бюджет, попросіть базовий результат і димовий тест, а потім прочитайте отримане, перш ніж збільшувати ліміт.

Якщо ви створите щось за його допомогою, поділіться цим у X і позначте @Gradio та @HuggingFace. Ми будемо раді побачити моделі, які ви створите, але які ніхто інший не здогадався б розробити для вас.

Моделі, згадані в цій статті 10

Датасети, згадані в цій статті 7

Простори, згадані в цій статті 8

Спільнота

Завантажуйте зображення, аудіо та відео, перетягуючи їх у поле введення тексту, вставляючи або натискаючи тут.
Торкніться або вставте сюди, щоб завантажити зображення

· Зареєструйтеся або увійдіть, щоб коментувати

Моделі, згадані в цій статті 10

Датасети, згадані в цій статті 7

Простори, згадані в цій статті 8

Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.

Вперше опубліковано виданням Hugging Face

Читати оригінал на Hugging Face ↗

Текст і зображення належать Hugging Face і наводяться тут із зазначенням авторства та посиланням на оригінальну публікацію.

← До новин

Ще новини

Усі останні новини