ПРИКЛАДНЫЕ ИССЛЕДОВАНИЯ

Автоматическая оценка письменных работ по английскому языку с использованием больших языковых моделей

Авторы

  • Алина Дмитриевна Подкопаева Ленинградский государственный университет им. А.С. Пушкина, 196605, Санкт-Петербург, Пушкин, Петербургское шоссе, д. 10

Как цитировать

ГОСТ Подкопаева А. Д. Автоматическая оценка письменных работ по английскому языку с использованием больших языковых моделей // Вопросы природопользования. 2026. Т. 5. № 3. С. 164-174. DOI: 10.25726/j1188-7249-0980-s
APA Подкопаева, А. Д. (2026). Автоматическая оценка письменных работ по английскому языку с использованием больших языковых моделей. Вопросы природопользования, 5(3), 164-174. https://doi.org/10.25726/j1188-7249-0980-s

Аннотация

Расхождение между трудоёмкостью экспертной проверки развёрнутых письменных работ по английскому языку и потребностью в массовом оперативном оценивании порождает запрос на автоматизацию, надёжность которой остаётся предметом спора. Цель работы состоит в количественной оценке согласованности баллов, выставляемых большими языковыми моделями, с экспертной оценкой и в выявлении условий, при которых такое согласие достигает практически приемлемого уровня. Применены имитационное моделирование процедуры оценивания на корпусе из 600 работ уровней A2-C1, сопоставительный анализ пяти автоматических конфигураций и расчёт показателей согласия – взвешенного квадратичного коэффициента каппа, долей точного и смежного совпадения, средней абсолютной ошибки и линейной корреляции. Установлено, что флагманская проприетарная модель достигает квадратичной каппа 0,77 при точном совпадении 54,0% и смежном 89,6%, тогда как открытые модели меньшего масштаба и классический регрессор остаются в интервале 0,58-0,71. Согласие неоднородно по критериям: формальные параметры – орфография, пунктуация, грамматика – воспроизводятся точнее содержательных, к которым относятся выполнение коммуникативной задачи и связность. Дообогащение запроса рубрикой, эталонными образцами, пошаговым рассуждением и агрегацией повторных прогонов повышает каппа с 0,55 до 0,80. Полученные значения остаются ниже межэкспертного предела надёжности 0,86, что определяет автоматическую оценку как инструмент предварительного и вспомогательного ранжирования, а не автономного выставления итогового балла.

Ключевые слова

большие языковые модели автоматическое оценивание письменная речь английский язык взвешенный квадратичный коэффициент каппа согласие с экспертом аналитическая рубрика имитационное моделирование

Библиографические ссылки

Алиева Э.М., Синицын В.Ю. Тестирование эффективности больших языковых моделей при решении задач единого государственного экзамена по обществознанию // Социология искусственного интеллекта: регионы и группы. Материалы Всероссийской конференции с международным участием. Красноярск, 2024. С. 46-54.

Афанасьев Г.И., Доу Л., Филатова А.Е. Нейросетевая модель для изучения английского языка // МИВАР'24. Сборник научных статей. Москва, 2024. С. 328-335.

Бураков И.И., Артеменко О.А. Оценка открытых больших языковых моделей для обнаружения грамматических конструкций // Искусственный интеллект в автоматизированных системах управления и обработки данных. Сборник статей III Всероссийской научной конференции: в 3 томах. Москва, 2025. С. 38-42.

Быканова Н.Н. Использование инструментов ИИ при оценивании и самооценивании иноязычной письменной речи студентов нелингвистических вузов (на примере английского языка) // Актуальные вопросы лингвистики и лингводидактики в контексте межкультурной коммуникации. Материалы V Всероссийской научно-практической конференции. Орёл, 2025. С. 662-669.

Васильев Д.Д., Пятаева А.В. Использование языковых моделей T5 для задачи упрощения текста // Программные продукты и системы. 2023. № 2. С. 228-236.

Ватолин А.С., Герасименко Н.А., Янина А.О., Воронцов К.В. RuSciBench: открытый бенчмарк для оценки семантических векторных представлений научных текстов на русском и английском языках // Доклады Российской академии наук. Математика, информатика, процессы управления. 2024. Т. 520. № S2. С. 284-294.

Виноградова О.И. Автоматизированная оценка лексикона обучающихся при помощи учебного корпуса // Полилингвиальность и транскультурные практики. 2018. Т. 15. № 3. С. 372-380.

Гончаров М.В., Колосов К.А. Особенности использования больших языковых моделей при составлении текстовых рефератов // Научные и технические библиотеки. 2025. № 11. С. 203-214.

Зафиевский Д.Д., Лагутина Н.С., Мельникова О.А., Полетаев А.Ю. Модель текста для автоматической оценки делового письма на заданную тему // Моделирование и анализ информационных систем. 2022. Т. 29. № 4. С. 348-365.

Карпов Д.К. Проверка текстовых заданий с помощью больших языковых моделей // Тенденции развития науки и образования. 2023. № 103-8. С. 150-156.

Козулин Н.Д. Применение языковых моделей на базе искусственного интеллекта в анализе учебных работ по программированию // Гагаринские чтения 2024. Сборник тезисов докладов 50-й Международной молодёжной научной конференции. Москва, 2024. С. 263-264.

Лабинцев А.И., Сорокин В.И., Нарышкин С.О., Сорокина Л.П. Интеллектуальный репетитор для изучения разговорного английского языка с использованием больших языковых моделей // Вестник НИЦ ВА РВСН. 2025. № 9. С. 29-38.

Назаровская В.С., Синицын В.Ю. Тестирование эффективности больших языковых моделей при выполнении заданий единого государственного экзамена по литературе // Социология искусственного интеллекта: регионы и группы. Материалы Всероссийской конференции с международным участием. Красноярск, 2024. С. 34-46.

Сычев О.А., Мамонтов Д.П. Архитектура модулей автоматизированного определения ошибок в вопросах с открытым ответом, использующих языки, описываемые контекстно-свободными грамматиками в СДО Moodle // Известия Волгоградского государственного технического университета. 2013. № 14 (117). С. 95-101.

Фомина И.К., Тарануха С.Н., Фомин В.В. Оценка показателей выявления заимствований в дообученных системах аннотирования // Системы интеллектуального управления и искусственный интеллект: теория и практика. Сборник трудов II национальной научно-практической конференции. Санкт-Петербург, 2024. С. 124-130.

Выпуск

Раздел

ПРИКЛАДНЫЕ ИССЛЕДОВАНИЯ
Хотите опубликоваться?
Подать статью

Машиночитаемые метаданные

Похожие статьи

<< < 3 4 5 6 7 8 9 > >> 

Вы также можете начать расширеннвй поиск похожих статей для этой статьи.