Sakhanda Wire
NVDA $223.96 +2.27% MSFT $499.99 +0.03% GOOGL $354.30 -0.96% META $592.10 +0.37% AMZN $274.48 +0.82%
← До новин

TutorMoments: Чи знають репетитори зі штучним інтелектом, коли допомогти, а коли не втручатися?

TutorMoments: Чи знають AI-репетитори, коли допомогти, а коли утриматися від допомоги?
Для підприємств Стаття
Опубліковано 7 серпня 2026 року
📄 Технічний звіт: https://tutormoments.allen.ai/static/paper/tutormoments-preview.pdf | 📊 Дані: https://huggingface.co/datasets/allenai/tutormoments-preview | 💻 Код: https://github.com/allenai/tutormoments

Соціальний матеріал TutorMoments — Google Docs-зображення-1 (2)

Сьогодні ми представляємо попередню версію TutorMoments — інструменту для вимірювання того, чи здатні сучасні LLM збалансувати один із найскладніших компромісів в освіті: коли втрутитися й допомогти учневі, а коли утриматися від допомоги та дозволити учневі виконати більшу частину роботи самостійно.

TutorMoments — це оцінювання на основі відтворення, створене на основі реальних індивідуальних занять із математики. Досвідчені вчителі математики переглядають транскрипти, зібрані в американській програмі репетиторства, і позначають моменти, коли репетитор мав обрати між спрощенням завдання, щоб учневі було легше почати, та спонуканням учня самостійно виконати більшу частину міркувань. Потім TutorMoments бере транскрипт до моменту ухвалення рішення, передає його мовній моделі та дозволяє моделі перебрати на себе роль репетитора в симульованому сеансі — учня при цьому грає інша мовна модель, — щоб побачити, як поводиться LLM-репетитор.

Коли моделям дають лише вказівку «добре навчати», ми виявляємо, що вони схильні надмірно допомагати: надають забагато підтримки й рідко спонукають учнів до глибшого мислення. Чітке формулювання в запиті до репетитора компромісу між допомогою та утриманням від допомоги покращує результати, але не усуває розрив із людським репетиторством, яке послідовно відповідає конкретному моменту; крім того, LLM усе ще суттєво відрізняються за надійністю такого вибору.

У межах нашого прагнення до відкритих досліджень ми публікуємо набір даних із деідентифікованими транскриптами занять, код для запуску нашого конвеєра відтворення, а також відтворення ключових моментів, оцінених у цих транскриптах, моделями-репетиторами — для забезпечення відтворюваності. Ми сподіваємося, що TutorMoments дасть педагогам, дослідникам і командам, які створюють AI-репетиторів, точніший спосіб з’ясувати, як модель ухвалює найважливіші педагогічні рішення, і допоможе галузі створювати репетиторів, які адаптуються до кожного учня, а не виконують роботу замість нього.

Що робить репетитора хорошим?

Якщо попросити хорошого репетитора з математики про допомогу, у відповідь ви, ймовірно, почуєте запитання на кшталт: «Що ви знаєте про те, що потрібно зробити в задачі?» Це не є відмовою в допомозі — частина якісного навчання полягає в тому, щоб визначити, що саме учні вже знають, і надати їм потрібну підтримку в конкретний момент. Негайно запропонована допомога позбавила б учня інтелектуальної роботи, яка сприяє навчанню. Іноді підтримка необхідна; в інших випадках найефективнішим є поштовх до закріплення розуміння через пояснення правильної відповіді.

Однак мовні моделі навчені бути корисними, а корисний асистент зазвичай виконує складну частину роботи за вас — пояснює концепцію, розкладає все на кроки та підводить вас до відповіді. Під час заняття це може обірвати продуктивну боротьбу — наполегливе, іноді фруструюче розв’язання задач, яке дослідження навчання вже давно пов’язує з глибшим розумінням.

Більшість бенчмарків для мовних моделей, що працюють як репетитори, не враховують цієї напруги. Вони зазвичай винагороджують одну конкретну поведінку — наприклад, ніколи не повідомляти відповідь на задачу або завжди давати підказку — не зважаючи на те, чи був це правильний крок з огляду на фактичний рівень розуміння учня. Але хороше репетиторство — це не одна фіксована поведінка, яку можна однаково визначити в усіх випадках. Це питання судження: що саме потрібно цьому учневі прямо зараз, для цієї задачі?

Як працює TutorMoments

TutorMoments побудовано на реальних даних про заняття. Набір даних, який ми публікуємо, TutorMoments-Preview, містить 462 деідентифіковані текстові транскрипти реальних індивідуальних занять із математики з учнями 2–7 класів у США, понад 1 500 ключових моментів, анотованих учителями, і кілька тисяч текстових анотацій від 27 учителів-­анотаторів зі США. Транскрипти походять із програми інтенсивного репетиторства, учні якої переважно навчаються у школах Title I; їх було передано відповідно до дослідницького положення, погодженого батьками та опікунами. Усі дані позбавлено ідентифікаційних деталей: спочатку постачальником, а потім за допомогою додаткового математично орієнтованого конвеєра.

Усі анотації надали досвідчені вчителі математики, яких ми попросили прочитати транскрипти та позначити ключові моменти навчання — зазначити, що відбувалося, що робив репетитор і як це сприйняв учень. Кожен ключовий момент є точкою ухвалення рішення, коли репетитор мав зважити підтримувальне структурування (зробити задачу доступнішою) та спонукання до ґрунтовного мислення (заохотити учня до складніших міркувань).

TutorMoments працює, призупиняючи транскрипт в одному з таких ключових моментів і передаючи заняття мовній моделі, яка перебирає на себе роль репетитора на п’ять ходів у взаємодії із симульованим учнем. Кожне з цих продовжень, згенерованих моделлю, ми називаємо відтворенням. Потім конвеєр оцінювання на основі LLM оцінює кожне відтворення за трьома критеріями: чи (1) модель застосувала підтримувальне структурування, коли учневі була потрібна допомога, (2) спонукала до ґрунтовного мислення, коли учень був готовий до складнішого виклику, і (3) уникнула надмірного структурування (зменшення складності більше, ніж вимагав конкретний момент).

Конвеєр оцінювання починається з еталонної оцінки, визначеної вчителями: для кожного ключового моменту встановлюється, чи вимагав він підтримувального структурування, чи спонукання до ґрунтовного мислення. Кожен момент анотували кілька вчителів, і в разі розбіжностей ми використовували мажоритарну оцінку: якщо момент анотували троє вчителів, двоє назвали його таким, що вимагає ґрунтовного мислення, а один — підтримувального структурування, еталонною оцінкою вважалося ґрунтовне мислення. Окремий класифікатор на основі LM, перевірений за анотаціями вчителів, визначає, чи відповідає фактичний крок репетитора тому, чого вимагав момент: «належний» хід означає, що класифікована дія репетитора (структурування, спонукання до ґрунтовного мислення або надмірне структурування) відповідає тому, що, на думку вчителів, вимагав цей момент.

Попередні результати

Ми пропустили сім LLM через TutorMoments, використовуючи два запити: звичайний запит, який не містить конкретних рекомендацій і лише повідомляє моделі, що вона має використати свої знання про хороше репетиторство, щоб відповісти учневі, та орієнтований на оцінювання запит, у якому чітко описано компроміс між підтримувальним структуруванням, надмірним структуруванням і спонуканням до ґрунтовного мислення. Кожну модель оцінювали на ключових моментах, відібраних із транскриптів занять і порівну розподілених між моментами, де правильним підходом було підтримувальне структурування, та моментами, що вимагали ґрунтовного мислення.

Кожне число в таблиці — це оцінка від 0 до 1, тобто частка відповідних моментів, у яких модель зробила належний крок; отже, вища оцінка означає, що модель частіше ухвалювала правильне рішення. Наприклад, 0,50 для належного ґрунтовного мислення означає, що модель спонукала до ґрунтовного мислення в половині моментів, які цього вимагали.

Під час читання оцінок варто пам’ятати про кілька речей:

Людські репетитори — це натуралістичний орієнтир, а не верхня межа. Ми не вважаємо людських репетиторів взірцем ідеальної практики — навіть досвідчені репетитори іноді ухвалюють не найкращі рішення. Оцінені так само й у тих самих точках ухвалення рішень, людські репетитори в наших транскриптах отримують 0,458 (належне підтримувальне структурування), 0,182 (належне ґрунтовне мислення) і 0,496 (уникнення надмірного структурування) — усі показники нижчі за оцінки моделей із запитом, орієнтованим на оцінювання, і приблизно відповідають діапазону оцінок моделей зі звичайним запитом. Але це не твердження, що AI-репетитори перевершують учителів-людей. Анотатори спеціально шукали моменти, коли заняття можна було провести краще, тому набір даних зосереджений на втрачених можливостях, а не на ідеальній практиці.

Оцінки вимірюють поведінку репетитора, а не навчання. У відтвореннях використовується симульований учень-«оракул», тому числа відображають те, як модель діє в точці ухвалення рішення, а не те, чи навчився реальний учень.

Дані про ґрунтовне мислення менш надійні, ніж дані про структурування. Конвеєр оцінювання менш надійно виявляє спонукання до ґрунтовного мислення, а в базових анотаціях менше моментів, що вимагали ґрунтовного мислення (260), ніж моментів, що вимагали підтримувального структурування (738).

Соціальний матеріал TutorMoments — Google Docs-зображення-2 (1)

Найчіткіша закономірність у таблиці — наскільки важливим є запит: кожна модель отримує вищу оцінку за запитом, орієнтованим на оцінювання, ніж за звичайним. Це свідчить, що типової поведінки «корисного асистента» моделі самої по собі недостатньо для якісного репетиторства. Але чітке формулювання компромісу в запиті має обмежений ефект: хоча воно підвищує всі оцінки, моделі все ще суттєво відрізняються за тим, як вони інтерпретують розширений запит, і навіть найкращим моделям є куди вдосконалюватися.

Ми також розклали за категоріями дії, які репетитори виконували в кожному сценарії. Хоча запит спонукає моделі до ґрунтовного мислення, вони використовують менше стратегій, ніж люди, і часто покладаються на прохання до учнів пояснити свої відповіді. Натомість людські репетитори застосовують різноманітніші стратегії й набагато частіше відступають убік, дозволяючи учням працювати самостійно.

Обмеження та подальші кроки

TutorMoments усе ще перебуває на ранньому етапі розвитку й наразі має кілька обмежень. Найбільше з них полягає в тому, що автоматизоване оцінювання дає нам уявлення про поведінку моделі в точці ухвалення рішення, але не може замінити дослідження з реальними учнями та реальними результатами навчання. Набір даних також вузький: він стосується США, переважно математики в початковій і середній школі та анотований однією групою педагогів. Наші висновки можуть не поширюватися на інші предмети, рівні освіти чи умови.

Ми публікуємо цю попередню версію, щоб отримати відгуки в процесі роботи над більшим мультимодальним набором даних, надійнішим конвеєром оцінювання та глибшим аналізом.

Подяки

Цей проєкт став можливим частково завдяки підтримці Gates Foundation і Learning Commons.

Набори даних, згадані в цій статті 1

Спільнота

Завантажуйте зображення, аудіо та відео, перетягуючи їх у текстове поле, вставляючи або натискаючи тут.
Натисніть або вставте сюди, щоб завантажити зображення

· Зареєструйтеся або увійдіть, щоб коментувати

Набори даних, згадані в цій статті 1

Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.

Вперше опубліковано виданням Hugging Face

Читати оригінал на Hugging Face ↗

Текст і зображення належать Hugging Face і наводяться тут із зазначенням авторства та посиланням на оригінальну публікацію.

← До новин

Ще новини

Усі останні новини