Журнал СФУ. Техника и технологии / Автоматическая классификация причин отключений в сетях 0,4 кВ по текстовым отчетам с применением машинного обучения

Полный текст (.pdf)
Номер
Журнал СФУ. Техника и технологии. 2026 19 (5)
Авторы
Большев, В. Е.; Виноградова, А. В.; Волынец, И. О.
Контактная информация
Большев, В. Е.: Федеральный научный агроинженерный центр ВИМ (Российская Федерация, Москва); Виноградова, А. В.: Федеральный научный агроинженерный центр ВИМ (Российская Федерация, Москва); Волынец, И. О.: ООО «Юзтех Бел» (Беларусь, Минск)
Ключевые слова
автоматическая идентификация причин отключений электроэнергии; электрические сети 0,4 кВ; журнал учета аварийных и плановых отключений; машинное обучение; аварийные отключения; задача многоклассовой классификации; векторное представление текстовых документов; классификация текста; automatic cause identification of power outages; 0.4 kV electrical networks; emergency and planned outage log; machine learning; multi-class classification problem; vector representation of text documents; text classification
Аннотация

В работе представлено исследование, посвященное разработке и оценке алгоритмов машинного обучения для автоматизации идентификации причин отключений электроэнергии в электрических сетях 0,4 кВ. Актуальность задачи обусловлена неточностями в ведении отчетной документации, вызванными нестандартизированными формулировками и ошибками в журнале учета аварийных и плановых отключений, что затрудняет последующий анализ и принятие мер по повышению надежности. Предложенный подход основан на анализе текстовой информации о ходе устранения аварий и их последующей комплексной предобработке, включая нормализацию, лемматизацию и векторизацию с использованием метода взвешивания TF-IDF, что позволяет преобразовать текстовые описания в матрицу «терм-документ». Так как идентификация причин отключений электроэнергии является задачей многоклассовой классификации, были протестированы три алгоритма: логистическая регрессия, случайный лес и градиентный бустинг (LightGBM). Оценка качества моделей проводилась с использованием кросс-валидации со стратифицированным разбиением и на независимой тестовой выборке. Наилучшие результаты показала модель логистической регрессии, достигшая на тестовой выборке точности (Accuracy) 0,864 и F1-меры, с микроусреднением 0,866, что подтверждает высокую практическую применимость предложенного подхода. Анализ ошибок показал, что основными барьерами для повышения точности являются орфографические ошибки в исходных данных и неоднозначность самой системы классификации, когда одно событие можно отнести к нескольким категориям. На основе полученных результатов сформулированы рекомендации по дальнейшему улучшению качества классификации. Они включают как совершенствование данных (увеличение выборки, коррекция ошибок на этапе ввода, улучшение классификатора причин), так и применение более сложных подходов, таких как автоматическая коррекция текста, использование эмбеддингов для учета семантики и применение глубоких нейронных сетей

Страницы
684–695
EDN
BNQMFJ
Статья в архиве электронных ресурсов СФУ
https://elib.sfu-kras.ru/handle/2311/159307

Лицензия Creative Commons Эта работа лицензируется по лицензии Creative Commons Attribution-NonCommercial 4.0 International License (CC BY-NC 4.0).