Профессора насторожили не только цифры. Некоторые решения были написаны необычным способом, который воспроизводил и ChatGPT. Серрано заподозрил массовое использование ИИ и решил устроить довольно жестокий, но показательный эксперимент: финальный экзамен провести очно.
После объявления об этом 18 студентов отказались от курса, ещё девять остались записаны, но на экзамен не пришли. У оставшихся 59 средний результат составил 48,6 балла — самый низкий показатель за историю преподавания этого курса.
На графике, который разошёлся по интернету, это выглядит почти комично. Оранжевые точки — домашний экзамен. Они плотной колонной стоят возле отметки 100. Серые — очный. Они растекаются по всей шкале вплоть до нуля.
Самое очевидное прочтение графика звучит так: студенты списали.
Возможно. По крайней мере, именно это подозревал Серрано, хотя сам разрыв оценок, разумеется, не позволяет установить нарушение каждого конкретного студента.
Но если остановиться на вопросе академической честности, мы пропустим кое-что гораздо интереснее.
Потому что искусственный интеллект создаёт для образования проблему, которой раньше почти не существовало: результат работы всё меньше говорит нам о способностях человека, который эту работу предъявил.
И отсюда возникают сразу два вопроса, на которые современная система образования пока отвечает довольно неуверенно.
Что теперь вообще означает высокий балл?
Посмотрите на верхнюю часть графика.
Один из студентов получил примерно 95 баллов и дома, и на очном экзамене. Вероятно, это один из сильнейших студентов курса: когда внешний инструмент исчез, его результат практически не изменился.
На домашнем экзамене этот человек почти не выделялся.
Рядом стояли десятки результатов 98, 100, 100, 100, 100.
Человек, действительно способный получить 95 баллов самостоятельно, благодаря чужим идеальным результатам превращается практически в середняка.
Есть студент, получивший около 55 баллов дома и около 60 на очном экзамене. В первой системе координат он выглядит почти худшим студентом курса. Во второй внезапно оказывается заметно выше среднего.
Более того, возможно — именно возможно, потому что по одному графику мы не можем знать мотивов конкретного человека, — перед нами один из тех, кто честно выполнял обе работы.
Тогда возникает довольно странная ситуация.
Честность ухудшает его относительное положение.
Он не стал знать предмет хуже. Не потерял способности. Не сделал меньше работы. Просто вокруг него появилось достаточно людей, способных предъявить результат, который гораздо выше их самостоятельного уровня.
И это уже проблема не отдельного экзамена.
Оценка существует не только для того, чтобы сообщить студенту: «вы решили 73 процента заданий». Она выполняет ещё одну социальную функцию — ранжирует людей.
Университеты выдают дипломы с отличием. Компании сравнивают выпускников. Стипендии достаются студентам с более высоким средним баллом. Конкурсные программы отбирают лучших.
Любая такая система предполагает, что различия между результатами хотя бы приблизительно отражают различия между людьми.
ИИ способен разрушить именно это соответствие.
Представьте марафон, на котором части участников разрешили незаметно воспользоваться электровелосипедом. Самое неприятное здесь даже не в том, что велосипедист пересечёт финиш первым. Гораздо интереснее положение настоящего бегуна.
Он не стал бегать медленнее.
Просто его 17-е место больше ничего не говорит о том, насколько хорошо он бегает.
С рейтингами происходит примерно то же самое.
Когда инструмент способен вытянуть большое количество людей к верхней границе шкалы, возникает то, что статистики называют эффектом потолка: результаты сжимаются возле максимального значения, и тест перестаёт различать сильных и очень сильных.
ИИ добавляет сюда ещё одну сложность. Он выравнивает не знания, а наблюдаемые результаты.
Тогда давайте просто заберём компьютеры
Это наиболее естественная реакция.
Хотим узнать, кто действительно знает экономику? Сажаем всех в аудиторию. Убираем телефоны. Отключаем интернет. Раздаём бумагу.
График Серрано прекрасно показывает достоинство такого подхода. Разброс немедленно возвращается. Становится видно, кто что способен сделать самостоятельно.
И всё было бы сравнительно просто, если бы университет проверял людей исключительно ради знания того, что они способны сделать без инструментов.
Но образование претендует на несколько большую задачу. Оно должно хотя бы отчасти готовить человека к деятельности за пределами университета.
А там компьютеры никто не забирает.
Бухгалтер не соревнуется с коллегами в устном счёте. Архитектор не обязан чертить здание без программного обеспечения. Программисту разрешено читать документацию. Руководителю — спрашивать коллег. Исследователю — пользоваться базами данных.
История труда вообще во многом состоит из передачи части человеческих функций инструментам.
Мы не считаем слабым инженера, потому что он не способен перемножать шестизначные числа быстрее калькулятора.
И поэтому простое решение «давайте проверять всех без ИИ» сталкивается со второй проблемой.
А кого именно мы вообще хотим измерять — человека или человека вместе с его инструментами?
Кто из двух студентов лучше подготовлен к жизни?
Представим двух выпускников.
Первый великолепно знает предмет. Без компьютера получает 80 баллов. С искусственным интеллектом — 95.
Второй самостоятельно получает 50. Но прекрасно умеет формулировать запросы, проверять ответы модели, находить ошибки, соединять источники и доводить результат до тех же 95.
Кого должен нанять работодатель?
Ответ уже не настолько очевиден.
В профессии важна не чистота выполнения задачи, а способность её решить.
Человек, который знает меньше, но лучше пользуется инструментами, вполне способен оказаться производительнее человека с более глубокими знаниями.
Это, впрочем, не означает, что базовые знания становятся ненужными.
Чтобы заметить, что искусственный интеллект ошибается, необходимо понимать предмет хотя бы настолько, чтобы распознать ошибку. Чтобы задать хороший вопрос, нужно представлять структуру проблемы. Чтобы выбрать между двумя убедительно звучащими ответами, необходимо иметь критерии выбора.
Поэтому противопоставление «знание или умение пользоваться ИИ» само по себе, вероятно, неверно.
Нам нужен человек, способный делать обе вещи.
Но старая система экзаменов довольно плохо различает эти способности.
Экзамен с неограниченным ИИ может измерять качество конечного продукта, почти ничего не сообщая о том, какая часть интеллектуальной работы принадлежит студенту.
Экзамен без ИИ делает обратное: довольно хорошо показывает самостоятельные знания, но намеренно отнимает у человека инструменты, которыми он, вероятно, будет пользоваться почти каждый рабочий день.
Получается необычная ситуация: оба экзамена могут быть честными — и оба одновременно измерять не совсем то, что нас интересует.
Возможно, проблема вообще не в искусственном интеллекте
ИИ лишь очень быстро сделал заметной давнюю слабость образовательных оценок.
Мы привыкли обращаться с отметкой так, будто это универсальная единица человеческой компетентности.
Но 92 балла никогда не означали «этот человек на 92 процента хороший экономист».
Экзамен всегда измерял способность выполнить конкретный тип задания в конкретных условиях.
Стоило изменить условия — и изменялось значение оценки.
Открытый учебник проверяет одно. Ограниченное время — другое. Устный экзамен — третье. Групповой проект — четвёртое.
Искусственный интеллект довёл различия между этими режимами до такой величины, что игнорировать их стало невозможно.
Возможно, поэтому будущая система оценки будет меньше похожа на одну цифру.
Отдельно придётся проверять, что человек умеет без внешней помощи: понимает ли базовые концепции, способен ли рассуждать, видеть противоречия и объяснять собственное решение.
Отдельно — насколько хорошо он умеет работать с инструментами: искать информацию, пользоваться ИИ, ставить задачи, проверять выводы и обнаруживать галлюцинации модели.
И, вероятно, появится ещё один уровень — способность отвечать за конечный результат независимо от того, сколько технологий участвовало в его создании.
Это уже гораздо ближе к устройству реальной профессиональной деятельности.
Хирургу разрешены современные приборы, но от него всё равно требуется понимание анатомии. Пилот пользуется автопилотом, но должен уметь действовать, когда автоматика перестаёт справляться. Руководитель может получить идеальный аналитический отчёт от ИИ, но решение и его последствия остаются его ответственностью.
Поэтому история курса Серрано интересна не тем, что несколько десятков студентов, возможно, нашли слишком удобный способ выполнить экзамен.
На его графике столкнулись две разные модели человеческой способности.
Какую задачу ты способен решить, используя всё, что тебе доступно?
До появления генеративного ИИ эти два результата часто находились достаточно близко, чтобы образование могло делать вид, будто измеряет одно и то же.
Теперь между ними иногда лежит почти пятьдесят баллов.
И поэтому главный вопрос для университетов уже вряд ли сводится к тому, разрешать ChatGPT на экзамене или запрещать.
Нужно заново решить, что именно означает быть хорошим студентом в мире, где результат человека всё труднее отделить от возможностей его инструментов.
Пока мы этого не сделали, возникает довольно ироничная ситуация.
Экзамен с ИИ способен не заметить, что студент почти ничего не умеет самостоятельно.
А экзамен без ИИ — не заметить, насколько хорошо этот же студент способен работать в мире, в котором искусственный интеллект уже никуда не исчезнет.
И, пожалуй, самое тревожное на графике из Брауновского университета — даже не падение среднего балла с 96 до 48,6.
Это несколько серых точек, расположенных рядом с оранжевыми.
Люди, которые, судя по результатам, действительно могли справиться сами.
Старая система должна была помочь нам их обнаружить.
Но при почти поголовных сотнях она сделала их практически невидимыми.