Sakhanda Wire
NVDA $223.96 +2.27% MSFT $499.99 +0.03% GOOGL $354.30 -0.96% META $592.10 +0.37% AMZN $274.48 +0.82%
← К новостям

TutorMoments: Знают ли ИИ-репетиторы, когда помогать, а когда не вмешиваться?

TutorMoments: знают ли ИИ-репетиторы, когда нужно помочь, а когда отступить?
Для предприятий Статья
Опубликовано 7 августа 2026 года
📄 Технический отчёт: https://tutormoments.allen.ai/static/paper/tutormoments-preview.pdf | 📊 Данные: https://huggingface.co/datasets/allenai/tutormoments-preview | 💻 Код: https://github.com/allenai/tutormoments

TutorMoments social copy - Google Docs-image-1 (2)

Сегодня мы представляем предварительную версию TutorMoments — платформы для оценки того, могут ли передовые большие языковые модели сбалансировать один из самых сложных компромиссов в образовании: когда нужно вмешаться и помочь ученику, а когда отступить и позволить ему самому выполнить большую часть работы.

TutorMoments — это оценка на основе воспроизведения, созданная на базе реальных индивидуальных занятий по математике. Опытные учителя математики изучают расшифровки занятий, собранные в рамках американской программы репетиторства, и отмечают моменты, когда репетитору приходилось выбирать между тем, чтобы упростить задачу для начала работы, и тем, чтобы побудить ученика самостоятельно выполнить больше рассуждений. Затем TutorMoments берёт расшифровку до момента принятия решения, передаёт её языковой модели и позволяет модели взять на себя роль репетитора в смоделированном занятии, где ученик представлен другой языковой моделью, — чтобы увидеть, что делает репетитор на базе LLM.

Если моделям дают лишь указание «хорошо обучать», мы обнаруживаем, что они склонны чрезмерно помогать, предоставляя слишком много поддержки и редко побуждая учеников к более глубокому мышлению. Явное описание компромисса — когда помогать, а когда отступать — в инструкции для репетитора улучшает результаты, но не устраняет разрыв с человеческим репетиторством, которое последовательно соответствует ситуации; кроме того, LLM по-прежнему сильно различаются по тому, насколько надёжно принимают такие решения.

В рамках нашей приверженности открытому исследованию мы публикуем набор обезличенных расшифровок занятий с репетиторами, код для запуска нашего конвейера воспроизведения, а также воспроизведения ключевых моментов, оценённых в этих расшифровках, созданные моделями-репетиторами, — для обеспечения воспроизводимости. Мы надеемся, что TutorMoments даст педагогам, исследователям и командам, создающим ИИ-репетиторов, более точный способ выяснить, как модель справляется с наиболее важными педагогическими решениями, и поможет отрасли создавать репетиторов, которые адаптируются к каждому ученику, а не выполняют работу за него.

Каким должен быть хороший репетитор?

Если попросить хорошего репетитора по математике о помощи, скорее всего, в ответ вы услышите вопрос вроде: «Что вы знаете о том, что требуется в задаче?» Это не беспомощность — важная часть качественного обучения состоит в том, чтобы понять, что именно ученик знает, и предоставить ему необходимую поддержку в данный момент. Немедленно предложенная помощь лишила бы ученика интеллектуальной работы, которая помогает ему учиться. Иногда поддержка необходима; в других случаях эффективнее подтолкнуть ученика к закреплению понимания, попросив объяснить правильный ответ.

Однако языковые модели обучены быть полезными, а полезный ассистент обычно выполняет сложную часть работы за вас: объясняет концепцию, расписывает шаги и направляет к ответу. На занятии это может преждевременно прервать продуктивное затруднение — требующее усилий, иногда вызывающее раздражение решение задач, которое, как давно показывают исследования в области обучения, связано с более глубоким пониманием.

Большинство бенчмарков для языковых моделей, выступающих в роли репетиторов, не отражают это противоречие. Как правило, они поощряют конкретное поведение — например, никогда не раскрывать ответ на задачу или всегда давать подсказку, — не учитывая, был ли это правильный шаг с учётом текущего уровня понимания ученика. Но хорошее репетиторство — это не единое фиксированное поведение, которое можно одинаково определить во всех случаях. Это вопрос оценки: что нужно этому ученику прямо сейчас, при решении этой задачи?

Как работает TutorMoments

TutorMoments создан на основе реальных данных о занятиях с репетиторами. Публикуемый нами набор данных TutorMoments-Preview содержит 462 обезличенные текстовые расшифровки реальных индивидуальных занятий по математике с учениками 2–7 классов в США, более 1 500 ключевых моментов с разметкой учителей и несколько тысяч текстовых аннотаций от 27 учителей-аннотаторов из США. Расшифровки взяты из программы интенсивного репетиторства, участники которой в основном учатся в школах, получающих финансирование по программе Title I; данные были переданы в соответствии с исследовательским соглашением, одобренным родителями и опекунами. Все данные были очищены от идентифицирующих сведений: сначала поставщиком, а затем с помощью дополнительного конвейера, учитывающего математическую специфику.

Все аннотации подготовили опытные учителя математики. Мы просили их прочитать расшифровки и отметить ключевые моменты обучения, указав, что происходило, что делал репетитор и как это воспринимал ученик. Каждый ключевой момент — это точка принятия решения, в которой репетитору приходилось сопоставлять поддержку (делая задачу более доступной) и поощрение строгости (побуждая ученика выполнять более сложные рассуждения).

TutorMoments работает следующим образом: расшифровка останавливается на одном из таких ключевых моментов и передаётся языковой модели, которая на протяжении пяти ходов выполняет роль репетитора в диалоге с симулированным учеником. Каждое такое продолжение, созданное моделью, мы называем воспроизведением. Затем конвейер оценки на базе LLM оценивает каждое воспроизведение по трём параметрам: (1) оказала ли модель поддержку, когда ученику требовалась помощь, (2) побуждала ли она к более строгому мышлению, когда ученик был готов к дополнительному вызову, и (3) избегала ли чрезмерной поддержки, то есть снижения сложности сильнее, чем требовал данный момент.

Конвейер оценки начинает с эталонной разметки, определённой учителями: для каждого ключевого момента указывается, требовал ли он поддержки или побуждения к более строгому мышлению. Каждый момент размечали несколько учителей; при разногласиях мы выбирали вариант большинства. Если момент оценили три учителя, двое назвали необходимым строгое мышление, а один — поддержку, эталонным считалось строгое мышление. Затем отдельный классификатор на базе LM, проверенный по аннотациям учителей, определяет, соответствует ли фактический шаг репетитора требованиям момента. «Уместным» считается ход, если классифицированное действие репетитора — поддержка, побуждение к строгости или чрезмерная поддержка — соответствует тому, что, по мнению учителей, требовалось в этом моменте.

Предварительные результаты

Мы пропустили через TutorMoments семь LLM, используя два промпта: обычный, который не даёт конкретных указаний и лишь просит модель использовать свои знания о хорошем репетиторстве для ответа ученику, и учитывающий оценивание, в котором подробно описывается компромисс между поддержкой, чрезмерной поддержкой и побуждением к строгому мышлению. Каждую модель оценивали на ключевых моментах, взятых из расшифровок занятий и поровну разделённых между моментами, где правильным подходом была поддержка, и моментами, требовавшими строгости.

Каждое число в таблице — это оценка от 0 до 1, то есть доля соответствующих моментов, в которых модель поступила правильно. Поэтому более высокий балл означает, что модель чаще принимала верное решение. Например, показатель 0,50 для уместной строгости означает, что модель побуждала к строгому мышлению в половине моментов, которые этого требовали.

При чтении оценок следует учитывать несколько моментов:

Люди-репетиторы — это естественный ориентир, а не верхняя граница. Мы не считаем человеческих репетиторов образцом идеальной практики — даже опытные репетиторы в конкретный момент принимают не самые оптимальные решения. При оценке тем же способом и в тех же точках принятия решений человеческие репетиторы из наших расшифровок получают 0,458 за уместную поддержку, 0,182 за уместную строгость и 0,496 за отсутствие чрезмерной поддержки — все эти показатели ниже оценок моделей с учётом оценивания и примерно соответствуют диапазону показателей моделей с обычным промптом. Однако это не утверждение, что ИИ-репетиторы превосходят учителей-людей. Аннотаторы специально искали моменты, в которых репетиторство могло быть более эффективным, поэтому набор данных сосредоточен на упущенных возможностях, а не на идеальной практике.

Оценки измеряют поведение репетитора, а не обучение. Воспроизведения используют симулированного ученика-«оракула», поэтому числа отражают действия модели в точке принятия решения, а не то, научился ли реальный ученик.

Оценка строгости менее надёжна, чем оценка поддержки. Конвейер оценки менее надёжно выявляет побуждение к строгому мышлению, а в исходных аннотациях моментов строгости меньше (260), чем моментов поддержки (738).

TutorMoments social copy - Google Docs-image-2 (1)

Самая очевидная закономерность в таблице — насколько важен промпт: каждая модель получает более высокий результат с промптом, учитывающим оценивание, чем с обычным. Это говорит о том, что стандартного поведения «полезного ассистента» самой по себе недостаточно для качественного репетиторства. Но подробное описание компромисса в промпте помогает лишь до определённой степени: хотя оно повышает все оценки, модели по-прежнему сильно различаются в интерпретации расширенного промпта, и даже у лучших результатов остаётся значительный простор для улучшения.

Мы также разбираем действия репетиторов в каждом сценарии. Хотя промптинг побуждает модели к более строгому мышлению, они используют меньше стратегий, чем люди, часто ограничиваясь просьбами к ученикам объяснить свои ответы. Напротив, человеческие репетиторы применяют более разнообразные стратегии и гораздо чаще отступают, позволяя ученикам работать самостоятельно.

Ограничения и следующие шаги

TutorMoments всё ещё находится на ранней стадии разработки и на этом этапе имеет несколько ограничений. Главное из них заключается в том, что автоматизированная оценка даёт нам информацию о поведении модели в точке принятия решения, но не может заменить исследования с реальными учениками и реальными результатами обучения. Набор данных также узок: он посвящён математике в основном начальной и средней школы в США и размечен одной группой педагогов. Наши выводы могут не распространяться на другие предметы, возрастные группы или условия.

Мы публикуем эту предварительную версию, чтобы собрать отзывы по мере продвижения к более крупному мультимодальному набору данных, более совершенной системе оценки и более глубокому анализу.

Благодарности

Этот проект стал возможен в том числе благодаря поддержке Gates Foundation и Learning Commons.

Наборы данных, упомянутые в этой статье 1

Сообщество

Загружайте изображения, аудио и видео, перетаскивая их в текстовое поле, вставляя или нажимая здесь.
Нажмите или вставьте сюда, чтобы загрузить изображения

· Зарегистрируйтесь или войдите, чтобы оставить комментарий

Наборы данных, упомянутые в этой статье 1

Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.

Впервые опубликовано изданием Hugging Face

Читать оригинал на Hugging Face ↗

Текст и изображения принадлежат Hugging Face и приводятся здесь с указанием авторства и ссылкой на оригинальную публикацию.

← К новостям

Ещё новости

Все последние новости