APPLIED RESEARCH

Automated assessment of English written assignments using large language models

Authors

  • Alina D. Podkopaeva Pushkin Leningrad State University, 196605, Saint Petersburg, Pushkin, Peterburgskoye shosse, 10

How to cite

GOST Podkopaeva A. D. Automated assessment of English written assignments using large language models // Environmental Management Issues. 2026. Vol. 5. No. 3. P. 164-174. DOI: 10.25726/j1188-7249-0980-s
APA Podkopaeva, A. D. (2026). Automated assessment of English written assignments using large language models. Environmental Management Issues, 5(3), 164-174. https://doi.org/10.25726/j1188-7249-0980-s

Abstract

The gap between the labour intensity of expert grading of extended written assignments in English and the demand for large-scale, rapid assessment generates a request for automation whose reliability remains contested. The aim of the study is to quantify the agreement between the scores produced by large language models and expert scores and to identify the conditions under which such agreement reaches a practically acceptable level. Simulation modelling of the grading procedure was carried out on a corpus of 600 assignments at CEFR levels A2-C1, together with a comparative analysis of five automatic configurations and the computation of agreement indicators – the quadratic weighted kappa, the shares of exact and adjacent agreement, the mean absolute error and the linear correlation. The flagship proprietary model attains a quadratic kappa of 0.77 with exact agreement of 54,0% and adjacent agreement of 89,6%, whereas smaller open models and the classical regressor remain within the interval 0.58-0.71. Agreement is heterogeneous across criteria: formal parameters – spelling, punctuation, grammar – are reproduced more accurately than content-related ones, namely task achievement and cohesion. Enriching the request with a rubric, reference samples, step-by-step reasoning and aggregation of repeated runs raises the kappa from 0.55 to 0.80. The obtained values stay below the inter-rater reliability ceiling of 0.86, which positions automatic scoring as an instrument of preliminary and auxiliary ranking rather than autonomous assignment of the final mark.

Keywords

large language models automated assessment writing English language quadratic weighted kappa agreement with human raters analytic rubric simulation modeling

References

Алиева Э.М., Синицын В.Ю. Тестирование эффективности больших языковых моделей при решении задач единого государственного экзамена по обществознанию // Социология искусственного интеллекта: регионы и группы. Материалы Всероссийской конференции с международным участием. Красноярск, 2024. С. 46-54.

Афанасьев Г.И., Доу Л., Филатова А.Е. Нейросетевая модель для изучения английского языка // МИВАР'24. Сборник научных статей. Москва, 2024. С. 328-335.

Бураков И.И., Артеменко О.А. Оценка открытых больших языковых моделей для обнаружения грамматических конструкций // Искусственный интеллект в автоматизированных системах управления и обработки данных. Сборник статей III Всероссийской научной конференции: в 3 томах. Москва, 2025. С. 38-42.

Быканова Н.Н. Использование инструментов ИИ при оценивании и самооценивании иноязычной письменной речи студентов нелингвистических вузов (на примере английского языка) // Актуальные вопросы лингвистики и лингводидактики в контексте межкультурной коммуникации. Материалы V Всероссийской научно-практической конференции. Орёл, 2025. С. 662-669.

Васильев Д.Д., Пятаева А.В. Использование языковых моделей T5 для задачи упрощения текста // Программные продукты и системы. 2023. № 2. С. 228-236.

Ватолин А.С., Герасименко Н.А., Янина А.О., Воронцов К.В. RuSciBench: открытый бенчмарк для оценки семантических векторных представлений научных текстов на русском и английском языках // Доклады Российской академии наук. Математика, информатика, процессы управления. 2024. Т. 520. № S2. С. 284-294.

Виноградова О.И. Автоматизированная оценка лексикона обучающихся при помощи учебного корпуса // Полилингвиальность и транскультурные практики. 2018. Т. 15. № 3. С. 372-380.

Гончаров М.В., Колосов К.А. Особенности использования больших языковых моделей при составлении текстовых рефератов // Научные и технические библиотеки. 2025. № 11. С. 203-214.

Зафиевский Д.Д., Лагутина Н.С., Мельникова О.А., Полетаев А.Ю. Модель текста для автоматической оценки делового письма на заданную тему // Моделирование и анализ информационных систем. 2022. Т. 29. № 4. С. 348-365.

Карпов Д.К. Проверка текстовых заданий с помощью больших языковых моделей // Тенденции развития науки и образования. 2023. № 103-8. С. 150-156.

Козулин Н.Д. Применение языковых моделей на базе искусственного интеллекта в анализе учебных работ по программированию // Гагаринские чтения 2024. Сборник тезисов докладов 50-й Международной молодёжной научной конференции. Москва, 2024. С. 263-264.

Лабинцев А.И., Сорокин В.И., Нарышкин С.О., Сорокина Л.П. Интеллектуальный репетитор для изучения разговорного английского языка с использованием больших языковых моделей // Вестник НИЦ ВА РВСН. 2025. № 9. С. 29-38.

Назаровская В.С., Синицын В.Ю. Тестирование эффективности больших языковых моделей при выполнении заданий единого государственного экзамена по литературе // Социология искусственного интеллекта: регионы и группы. Материалы Всероссийской конференции с международным участием. Красноярск, 2024. С. 34-46.

Сычев О.А., Мамонтов Д.П. Архитектура модулей автоматизированного определения ошибок в вопросах с открытым ответом, использующих языки, описываемые контекстно-свободными грамматиками в СДО Moodle // Известия Волгоградского государственного технического университета. 2013. № 14 (117). С. 95-101.

Фомина И.К., Тарануха С.Н., Фомин В.В. Оценка показателей выявления заимствований в дообученных системах аннотирования // Системы интеллектуального управления и искусственный интеллект: теория и практика. Сборник трудов II национальной научно-практической конференции. Санкт-Петербург, 2024. С. 124-130.

Want to publish with us?
Submit an article

Machine-readable metadata

Similar Articles

<< < 1 2 3 4 5 6 7 8 9 > >> 

You may also start an advanced similarity search for this article.