<?xml version="1.0" encoding="UTF-8"?>
<!DOCTYPE article PUBLIC "-//NLM//DTD JATS (Z39.96) Journal Publishing DTD v1.3 20210610//EN" "JATS-journalpublishing1-3.dtd">
<article article-type="research-article" dtd-version="1.3" xmlns:mml="http://www.w3.org/1998/Math/MathML" xmlns:xlink="http://www.w3.org/1999/xlink" xmlns:xsi="http://www.w3.org/2001/XMLSchema-instance" xml:lang="ru"><front><journal-meta><journal-id journal-id-type="publisher-id">gscience</journal-id><journal-title-group><journal-title xml:lang="ru">Горные науки и технологии</journal-title><trans-title-group xml:lang="en"><trans-title>Mining Science and Technology (Russia)</trans-title></trans-title-group></journal-title-group><issn pub-type="epub">2500-0632</issn><publisher><publisher-name>The National University of Science and Technology MISiIS (NUST MISIS)</publisher-name></publisher></journal-meta><article-meta><article-id pub-id-type="doi">10.17073/2500-0632-2026-01-1070</article-id><article-id custom-type="elpub" pub-id-type="custom">gscience-1070</article-id><article-categories><subj-group subj-group-type="heading"><subject>Research Article</subject></subj-group><subj-group subj-group-type="section-heading" xml:lang="ru"><subject>ЦИФРОВЫЕ ТЕХНОЛОГИИ И ИСКУССТВЕННЫЙ ИНТЕЛЛЕКТ</subject></subj-group><subj-group subj-group-type="section-heading" xml:lang="en"><subject>DIGITAL TECHNOLOGIES AND ARTIFICIAL INTELLIGENCE</subject></subj-group></article-categories><title-group><article-title>Нейросетевые модели краткосрочного прогнозирования электропотребления горнопромышленного предприятия для оптового рынка электроэнергии</article-title><trans-title-group xml:lang="en"><trans-title>Neural network models for short-term electricity consumption forecasting at a mining enterprise participating in the wholesale electricity market</trans-title></trans-title-group></title-group><contrib-group><contrib contrib-type="author" corresp="yes"><contrib-id contrib-id-type="orcid">https://orcid.org/0009-0008-7117-7029</contrib-id><name-alternatives><name name-style="eastern" xml:lang="ru"><surname>Ематин</surname><given-names>Е. А.</given-names></name><name name-style="western" xml:lang="en"><surname>Ematin</surname><given-names>E. A.</given-names></name></name-alternatives><bio xml:lang="ru"><p>Евгений Александрович Ематин – аспирант кафедры энергетики и энергоэффективности горной промышленности</p><p>г. Москва</p><p>Scopus ID 59012304200</p><p>SPIN 2464-1230</p></bio><bio xml:lang="en"><p>Evgenii A. Ematin – PhD-Student, Department of Energy and Energy Efficiency of the Mining Industry</p><p>Moscow</p><p>Scopus ID 59012304200</p><p>SPIN 2464-1230</p></bio><email xlink:type="simple">vjeka@mail.ru</email><xref ref-type="aff" rid="aff-1"/></contrib><contrib contrib-type="author" corresp="yes"><contrib-id contrib-id-type="orcid">https://orcid.org/0000-0002-3469-3648</contrib-id><name-alternatives><name name-style="eastern" xml:lang="ru"><surname>Карпенко</surname><given-names>С. М.</given-names></name><name name-style="western" xml:lang="en"><surname>Karpenko</surname><given-names>S. M.</given-names></name></name-alternatives><bio xml:lang="ru"><p>Сергей Михайлович Карпенко – кандидат технических наук, доцент кафедры энергетики и энергоэффективности горной промышленности</p><p>г. Москва</p><p>Scopus ID 57225144783</p><p>SPIN 3950-0362</p></bio><bio xml:lang="en"><p>Sergey M. Karpenko – Cand. Sci. (Eng.), Associate Professor of the Department of Energy and Energy Efficiency of the Mining Industry</p><p>Moscow</p><p>Scopus ID 57225144783</p><p>SPIN 3950-0362</p></bio><email xlink:type="simple">ksm_62@mail.ru</email><xref ref-type="aff" rid="aff-1"/></contrib></contrib-group><aff-alternatives id="aff-1"><aff xml:lang="ru"><institution>Университет науки и технологий МИСИС</institution><country>Россия</country></aff><aff xml:lang="en"><institution>University of Science and Technology MISIS</institution><country>Russian Federation</country></aff></aff-alternatives><pub-date pub-type="collection"><year>2026</year></pub-date><pub-date pub-type="epub"><day>07</day><month>10</month><year>2026</year></pub-date><volume>0</volume><issue>0</issue><issue-title>Online First</issue-title><elocation-id>1070</elocation-id><permissions><copyright-statement>Copyright &amp;#x00A9; Ематин Е.А., Карпенко С.М., 2026</copyright-statement><copyright-year>2026</copyright-year><copyright-holder xml:lang="ru">Ематин Е.А., Карпенко С.М.</copyright-holder><copyright-holder xml:lang="en">Ematin E.A., Karpenko S.M.</copyright-holder><license license-type="creative-commons-attribution" xlink:href="https://creativecommons.org/licenses/by/4.0/" xlink:type="simple"><license-p>This work is licensed under a Creative Commons Attribution 4.0 License.</license-p></license></permissions><self-uri xlink:href="https://mst.misis.ru/jour/article/view/1070">https://mst.misis.ru/jour/article/view/1070</self-uri><abstract><p>Электропотребление горнопромышленных предприятий характеризуется выраженной нестационарностью из-за повторно-кратковременных режимов оборудования и резкопеременной нагрузки электросталеплавильного производства. Отклонение фактического потребления от плановых заявок на оптовом рынке электроэнергии и мощности (ОРЭМ) влечёт значительные штрафные санкции, что делает традиционные статистические методы недостаточно точными и требует адаптивных нейросетевых подходов.  Разработана и обоснована нейросетевая модель краткосрочного прогнозирования электропотребления для минимизации штрафов ОРЭМ. Проведён сравнительный анализ шести архитектур (RNN, GRU, LSTM, BiLSTM, CNN-LSTM, с механизмом внимания) в двух стратегиях многошагового прогнозирования (прямая Direct и рекурсивная Recursive). Гиперпараметры подобраны методом Hyperband. Исследование выполнено на промышленных данных за 2022–2023 гг. (17 520 почасовых измерений) крупного горно-перерабатывающего предприятия. Результаты показали, что архитектура GRU с прямой стратегией обеспечивает наилучшую точность (MAPE 5,44 %) и максимальную экономию штрафных платежей – 21,25 % относительно сезонной наивной модели, что на тестовом периоде (IV квартал 2023 г.) составляет 38,6 млн руб. квартального эффекта. Выявлен эффект избыточной сложности: простые рекуррентные сети превосходят модели с механизмами внимания на данных ограниченного объёма. Рекурсивная стратегия уступает прямой из-за кумулятивного накопления ошибки и невозможности использования стохастических экзогенных PCA-факторов. Выводы подтверждают целесообразность перехода от экспертно-статистических методов к нейросетевым подходам для горнопромышленных предприятий с резкопеременными нагрузками.</p></abstract><trans-abstract xml:lang="en"><p>Electricity consumption at mining enterprises is markedly nonstationary because of intermittent equipment operation and the rapidly varying loads associated with electric-arc steelmaking. Deviations between actual consumption and day-ahead bids in the Wholesale Electricity and Capacity Market (WECM) entail substantial penalties, making conventional statistical methods insufficiently accurate and creating a need for adaptive neural network approaches. This study developed and evaluated a neural network model for short-term electricity consumption forecasting designed to minimize WECM penalties. Six architectures (RNN, GRU, LSTM, BiLSTM, CNN–LSTM, and attention-based models) were compared under two multi-step forecasting strategies: direct and recursive. Hyperparameters were selected using Hyperband. The study used 2022–2023 industrial data from a large mining and processing enterprise (17,520 hourly measurements). The results showed that the GRU architecture with the direct strategy provided the highest accuracy (MAPE of 5.44%) and the greatest reduction in penalty payments relative to the seasonal naïve model (21.25%), equivalent to RUB 38.6 million in quarterly savings during the test period (Q4 2023). Evidence of excessive model complexity was observed: simpler recurrent networks outperformed attention-based models on a limited dataset. The recursive strategy was inferior to the direct strategy because of cumulative error propagation and the inability to use stochastic exogenous PCA factors. The findings support the transition from expert judgment and conventional statistical methods to neural network approaches at mining enterprises with rapidly varying loads.</p></trans-abstract><kwd-group xml:lang="ru"><kwd>горнопромышленное предприятие</kwd><kwd>прогнозирование электропотребления</kwd><kwd>резкопеременные нагрузки</kwd><kwd>многошаговое прогнозирование</kwd><kwd>глубокое обучение</kwd><kwd>рекуррентные нейронные сети</kwd><kwd>GRU (управляемый рекуррентный блок)</kwd><kwd>LSTM (долгая краткосрочная память)</kwd><kwd>снижение штрафных платежей</kwd></kwd-group><kwd-group xml:lang="en"><kwd>mining enterprise</kwd><kwd>electricity consumption forecasting</kwd><kwd>rapidly varying loads</kwd><kwd>multi-step forecasting</kwd><kwd>deep learning</kwd><kwd>recurrent neural networks</kwd><kwd>gated recurrent unit (GRU)</kwd><kwd>long short-term memory (LSTM)</kwd><kwd>reduction in penalty payments</kwd></kwd-group></article-meta></front><body><sec><title>Нейросетевые модели краткосрочного прогнозирования электропотребления горнопромышленного предприятия для оптового рынка электроэнергии</title></sec><sec><title>Введение</title><p>Краткосрочное прогнозирование электропотребления промышленных предприятий является важной задачей для участия в оптовом рынке электроэнергии и мощности (ОРЭМ). Согласно действующим правилам рынка1 участники обязаны предоставлять почасовые заявки на планируемое потребление на сутки вперед. Отклонение фактического потребления от заявленного влечет штрафные санкции, масштаб которых определяется объемом небаланса и ценой электроэнергии в соответствующий час.</p><p>Электропотребление горноперерабатывающих предприятий характеризуется выраженной нестационарностью, обусловленной составом и режимами работы технологического оборудования. Электроприёмники таких предприятий разделяются на длительные режимы (нагревательные печи, насосы, вентиляторы, компрессоры) и повторно-кратковременные режимы (прокатное, электросталеплавильное, сварочное, подъёмно-транспортное оборудование), при этом большая часть электропотребления имеет циклический характер при круглосуточном непрерывном основном производстве. Особую роль в формировании резкопеременного характера нагрузки и нестационарности временных рядов играет электросталеплавильное производство: процесс электроплавки сопровождается нелинейностью сопротивления электрической дуги, что вызывает скачки потребления и провалы нагрузки на коротких интервалах [<xref ref-type="bibr" rid="cit1">1</xref>]. Совместное действие повторно-кратковременных режимов и нелинейности дуги электросталеплавильных печей формирует ряды нагрузки. По характеру переключений эти ряды отличаются от профилей агрегированных энергосистем. Данные особенности затрудняют применение традиционных методов прогнозирования и обусловливают актуальность поиска адаптивных подходов.</p><p>Классические статистические методы прогнозирования временных рядов – авторегрессионные модели (ARIMA), модели с распределенными лагами (ADL), экспоненциальное сглаживание (Holt-Winters) – основаны на предположениях о стационарности и линейности процессов [<xref ref-type="bibr" rid="cit2">2</xref>]. Для агрегированных региональных энергосистем со сглаженными профилями нагрузки и высокой инерционностью данные методы обеспечивают высокую точность (MAPE 1,5–2,0 %). Однако на уровне отдельного промышленного предприятия, где преобладают резкие переключения режимов и событийная динамика, ошибка классических методов возрастает до 4–7 %, что неприемлемо для минимизации штрафных платежей ОРЭМ.</p><p>Методы глубокого обучения, в частности рекуррентные нейронные сети (RNN), способны аппроксимировать сложные нелинейные зависимости без явного задания физических уравнений. Архитектуры LSTM (Long Short-Term Memory) [<xref ref-type="bibr" rid="cit3">3</xref>] и GRU (Gated Recurrent Unit) [<xref ref-type="bibr" rid="cit4">4</xref>] решают проблему исчезающего градиента классических RNN [<xref ref-type="bibr" rid="cit5">5</xref>]. Они эффективно моделируют долгосрочные зависимости во временных рядах. Исследования на данных региональных энергосистем показывают, что LSTM достигает MAPE 0,3–0,7 % на горизонте 1–7 дней, превосходя методы градиентного бустинга на длинных горизонтах [<xref ref-type="bibr" rid="cit1">1</xref>].</p><p>Альтернативным направлением являются архитектуры на основе механизма внимания (Attention) [<xref ref-type="bibr" rid="cit6">6</xref>], включая Temporal Fusion Transformer [<xref ref-type="bibr" rid="cit7">7</xref>] и специализированные модификации (Informer [<xref ref-type="bibr" rid="cit8">8</xref>], Autoformer [<xref ref-type="bibr" rid="cit9">9</xref>]). Теоретически механизм внимания позволяет модели учитывать информацию из всей входной последовательности, присваивая различные веса элементам в зависимости от их релевантности. Однако практическое применение трансформеров ограничено высокими требованиями к объему обучающих данных: на выборках менее 3–5 лет часовых измерений наблюдается склонность к переобучению [<xref ref-type="bibr" rid="cit10">10</xref>].</p><p>Существующие сравнительные исследования, как правило, выполнены на агрегированных данных энергосистем [<xref ref-type="bibr" rid="cit11">11</xref>] и не учитывают специфику резкопеременных нагрузок ГПП [<xref ref-type="bibr" rid="cit1">1</xref>].</p><p>В прогнозировании электропотребления крупных непрерывных горноперерабатывающих предприятий сохраняется ряд пробелов. Во-первых, сравнительные исследования архитектур, как правило, выполнены на агрегированных данных энергосистем и не учитывают стохастический характер композитных PCA-факторов, описывающих производственные переменные. Во-вторых, сопоставления стратегий многошагового прогнозирования в литературе ограничены преимущественно парой Direct vs Recursive [12, 13] и опираются на теоретическую базу [14, 15] и анализ экспозиционного смещения в рекурсивных RNN [<xref ref-type="bibr" rid="cit16">16</xref>], тогда как стратегии MIMO (одна модель с многомерным выходом, соответствует Direct Multi-Output из подраздела 1.3) и DirRec (гибрид Direct и Recursive [<xref ref-type="bibr" rid="cit17">17</xref>]) рассмотрены вне сочетания с экзогенными PCA-факторами. В-третьих, резкопеременные нагрузки металлургического класса с круглосуточным непрерывным режимом основного производства не охвачены систематическим сравнением: имеющиеся работы либо ограничены отдельными переделами (электросталеплавильные печи [<xref ref-type="bibr" rid="cit13">13</xref>]), либо не доводят сравнение стратегий до операционных метрик ОРЭМ.</p><p>Вклад настоящей работы – адаптация набора рекуррентных архитектур к классу крупных непрерывных горноперерабатывающих предприятий и эмпирическое обоснование выбора стратегии многошагового прогноза при стохастических экзогенных PCA-факторах. Целевая область применения результатов – задачи планирования на ОРЭМ, а не сопоставление на агрегированных бенчмарках.</p><p>Целью настоящей работы является разработка и экспериментальное обоснование нейросетевой модели краткосрочного прогнозирования электропотребления горнопромышленного предприятия, обеспечивающей минимизацию штрафных санкций на ОРЭМ.</p><p>Для достижения поставленной цели в работе решены следующие задачи, последовательно раскрываемые в разделе 1 «Методы» (задачи 1–3) и разделе 2 «Результаты» (задача 4):</p><p>В разделе 1 описаны исходные данные, методология разработки модели и метрики оценки качества. Раздел 2 содержит результаты экспериментального сравнения архитектур. В разделе 3 обсуждаются полученные результаты и ограничения исследования.</p><p>1 Постановление Правительства РФ от 27.12.2010 № 1172 «О правилах оптового рынка электрической энергии и мощности» (с изменениями и дополнениями). URL: http://pravo.gov.ru/proxy/ips/?docbody=&amp;nd=102144342</p></sec><sec><title>1. Методы</title></sec><sec><title>1.1. Исходные данные</title><p>Исследование выполнено на данных крупного горнопромышленного предприятия (ГПП). Информационная база включает почасовые измерения электропотребления за период с января 2022 г. по декабрь 2023 г., что составляет 17 520 временных точек. Целевая переменная – агрегированный баланс электропотребления производственных цехов и собственной генерации электроэнергии, полученный из автоматизированной системы коммерческого учета электроэнергии (АСКУЭ) предприятия.</p><p>Объект исследования – крупное горноперерабатывающее предприятие металлургического профиля. Состав основных переделов включает (на уровне типов производств) коксохимический, агломерационный, доменный, электросталеплавильный, конвертерный сталеплавильный и листопрокатные переделы, а также установки собственной генерации электроэнергии, частично покрывающие потребление за счёт внутренних источников (теплоэлектроцентрали, утилизационные установки). Основное производство ведётся в круглосуточном непрерывном режиме, в связи с чем в почасовом профиле электропотребления отсутствует выраженная сезонная составляющая. По характеру нагрузки электропотребители разделяются на работающие в длительных режимах (нагревательные печи, насосы, вентиляторы, компрессоры) и в повторно-кратковременных режимах (прокатное, электросталеплавильное, сварочное, подъёмно-транспортное оборудование). Основным источником нестационарности результирующего ряда электропотребления служит электросталеплавильное производство: режим электроплавки сопровождается нелинейностью сопротивления электрической дуги и резкопеременной нагрузкой печей. Идентифицирующие параметры предприятия в настоящей работе не приводятся.</p><p>Состав входных признаков моделей прямой стратегии прогнозирования (Direct, см. подраздел 1.3) включает шесть каналов. Целевая переменная – историческое почасовое электропотребление предприятия. К экзогенным признакам отнесены композитный фактор простоев оборудования (первая главная компонента 4 индикаторов простоев, доля объяснённой дисперсии 86,35 %), композитный фактор внутренней генерации (четвёртая компонента 4 узлов собственной генерации, 15,05 % дисперсии, корреляция с целевой 0,34), температура наружного воздуха, композитный календарный фактор (пятая компонента 7 календарных признаков, 14,22 % дисперсии, корреляция с целевой −0,35) и бинарный индикатор государственного выходного дня. Рыночные показатели ОРЭМ и нагрузка отдельных переделов (включая электросталеплавильный цех) на этапе формирования признаков были признаны малоинформативными по абсолютной корреляции с целевой переменной и в финальный набор экзогенных признаков моделей не вошли.</p><p>Композитные PCA-факторы рассчитывались по единой процедуре. Исходные признаки каждой группы предварительно стандартизованы методом z-score с центрированием по среднему и нормировкой по стандартному отклонению. Декомпозиция выполнена методом главных компонент на основе сингулярного разложения матрицы признаков. Вращение факторов (Varimax, Promax и пр.) и отбеливание компонент не применялись. Итоговая компонента в каждой группе выбиралась по максимуму абсолютной корреляции с целевой переменной из числа вариантов с одной, двумя или автоматически подобранным числом компонент по уровню объяснённой дисперсии 95 %. В финальный набор экзогенных признаков модели вошли три PCA-фактора: Equipment Downtime – 4 индикатора простоев оборудования, выбрана компонента 1, доля объяснённой дисперсии 86,35 %; Generation Output – 4 узла внутренней генерации, выбрана компонента 4, доля 15,05 % (корреляция с целевой 0,34); Time – 7 календарных признаков, выбрана компонента 5, доля 14,22 % (корреляция с целевой −0,35). Выбор последних компонент в группах Generation Output и Time обусловлен правилом отбора по максимуму |corr| с целевой переменной, а не по доле дисперсии.</p><p>Обработка пропусков распределена по этапам подготовки данных в соответствии с природой источника. На этапе свода с журналом технологических простоев применяется протяжка дат предшествующим значением. Агрегаты простоев (суммарная длительность и число инцидентов) заполняются нулями, что отражает семантику отсутствия события. На этапе обработки метеорологического ряда выполняется ресемплирование на часовой шаг с временной интерполяцией пропусков. На этапе формирования признаков выбросы целевой переменной, выявленные по правилу превышения трёх стандартных отклонений, заменяются полусуммой ближайших валидных соседних значений или медианой ряда при их недоступности. При расчёте главных компонент в группе используются строки без пропусков с последующим выравниванием по часовой сетке. При оценке мультиколлинеарности через коэффициенты вздутия дисперсии применяется заполнение медианой признака. На входе модели применяется страховочная процедура последовательной протяжки оставшихся пропусков вперёд и назад по времени, обеспечивающая непрерывность итогового почасового ряда за период 2022-01-01 – 2023-12-31 (17 520 наблюдений).</p><p>Разбиение выборки выполнено по времени без перемешивания: общий часовой ряд за период 2022-01-01 – 2023-12-31 (17 520 наблюдений) разделён на обучающую часть (2022-01-01 – 2023-06-30, 13 104 наблюдения), валидационную часть (2023-07-01 – 2023-09-30, 2208 наблюдений) и тестовую часть (2023-10-01 – 2023-12-31, 2208 наблюдений) при долях около 74,8/12,6/12,6 %. С учётом контекстного окна 168 ч (семь суток истории) и горизонта прогноза 24 ч итоговое число обучающих, валидационных и тестовых окон для конфигураций с прямой стратегией составляет 12 913/2017/2017; для конфигураций с рекурсивной стратегией (одношаговое обучение, тестирование на 24 шагах) – 12 936/2040/2017.</p></sec><sec><title>1.2. Архитектура нейросетевой модели</title><p>В качестве базовой архитектуры выбраны управляемые рекуррентные блоки (Gated Recurrent Unit, GRU) [<xref ref-type="bibr" rid="cit4">4</xref>]. Архитектура GRU – упрощённая версия LSTM [<xref ref-type="bibr" rid="cit18">18</xref>], объединяющая вентили забывания и входа в единый вентиль обновления. Математическая модель GRU-ячейки описывается следующей системой уравнений:</p><p>                                                         zt = σ(Wz ∙ [ht – 1, xt] + bz),</p><p>                                                         rt = σ(Wr ∙ [ht – 1, xt] + br),</p><p>                                                         h̃t = tanh (Wh ∙ [rt ⊙ ht – 1, xt] + bh),</p><p>                                                         ht = (1 − zt) ⊙ ht – 1 + zt ⊙ h̃t,</p><p>где zt – вентиль обновления (update gate); rt – вентиль сброса (reset gate); ht – скрытое состояние; ⊙ – поэлементное умножение.</p><p>Рис. 1. Топология нейросетевой модели GRU (Direct). Числа в блоках – количество нейронов; d – коэффициент Dropout; r – Recurrent Dropout</p><p>Топология разработанной модели (рис. 1) включает следующие слои:</p><p>Размерность входа (Batch, 168, 6) соответствует контекстному окну 168 ч (одна неделя) и шести входным каналам, перечисленным в подразделе 1.1 (целевая переменная и пять экзогенных признаков). Конфигурации с рекурсивной стратегией (см. подраздел 1.3) используют отдельный univariate-вход формы (N, 168, 1) – только историю целевой переменной без экзогенных признаков.</p><p>Число обучаемых параметров модели (табл. 1) является соразмерным имеющемуся объёму данных и обеспечивает баланс между точностью аппроксимации и обобщающей способностью.</p><p>Таблица 1</p><p>Сводные результаты экспериментального сравнения моделей</p><p>*Для нейросетевых моделей приведено общее число обучаемых параметров сети. Для остальных конфигураций (регуляризованные авторегрессии Ridge AR и Ridge ADL, сезонные наивные модели S-Naive и действующий план предприятия) число обучаемых параметров не приведено: у Ridge-моделей – линейные коэффициенты, не сопоставимые по смыслу с весами нейросети; у наивных моделей и действующего плана – обучаемых параметров не имеется. В соответствующих ячейках проставлен прочерк.</p></sec><sec><title>1.3. Обоснование стратегии многошагового прогнозирования</title><p>Задача краткосрочного прогнозирования формулируется как построение отображения, которое на основании исторических данных за период L = 168 ч (контекстное окно, соответствующее одной неделе) формирует вектор прогноза на горизонт H = 24 ч вперед.</p><p>Для многошагового прогнозирования рассматривались две стратегии [<xref ref-type="bibr" rid="cit19">19</xref>]: прямая (Direct Multi-Output, или MIMO [<xref ref-type="bibr" rid="cit17">17</xref>]) и рекурсивная (Recursive [17, 20]). Далее «Direct», «прямая стратегия» и «прямой метод» используются как эквиваленты Direct Multi-Output, а «рекурсивная схема», «рекурсивная конфигурация» и «рекурсивный метод» – как эквиваленты Recursive. Прямая стратегия генерирует весь вектор прогнозов за один проход нейронной сети, используя выходной слой размерности 24. Рекурсивная стратегия формирует прогноз итеративно: каждое следующее значение вычисляется на основе предыдущего прогноза, который подаётся на вход модели вместо фактического значения. Особенностью предметной области, влияющей на выбор стратегии, является стохастический характер PCA-факторов (простои оборудования, режим собственной генерации): для рекурсивной схемы их значения на каждом будущем шаге прогноза недоступны как детерминированные величины и требовали бы отдельной модели экстраполяции экзогенных факторов.</p><p>В связи с этим конфигурации Direct и Recursive в настоящем сравнении различаются по структуре входа: прямая стратегия использует окно длиной 168 ч одновременно по целевой переменной и PCA-факторам и генерирует 24-часовой прогноз за один проход, тогда как рекурсивная конфигурация в табл. 1 реализована в univariate-режиме (вход – только окно прошлых значений целевой переменной, форма N × 168 × 1) с целью изолированной оценки накопления ошибки на горизонте 24 ч. Цифры по Recursive в табл. 1 предоставляют ориентир для случая, когда экзогенная информация на будущем горизонте недоступна, и используются при анализе вклада рекурсивной схемы в накопление ошибки (раздел 3).</p><p>Для выбора стратегии проведен сравнительный анализ на исторических данных (см. раздел 2).</p></sec><sec><title>1.4. Методика подбора гиперпараметров</title><p>Подбор гиперпараметров выполнен с использованием алгоритма Hyperband [<xref ref-type="bibr" rid="cit21">21</xref>], реализующего адаптивное распределение вычислительных ресурсов между конкурирующими конфигурациями. Алгоритм основан на принципе последовательного сокращения (successive halving): конфигурации с низкой производительностью отсеиваются на ранних стадиях обучения, что позволяет сократить общее время поиска в 5–10 раз по сравнению со стандартным случайным поиском [<xref ref-type="bibr" rid="cit22">22</xref>].</p><p>Пространство поиска гиперпараметров включало: архитектуру сети (RNN, LSTM, GRU, BiLSTM, CNN-LSTM, модели с механизмом внимания), количество рекуррентных слоев (1–3), размерность скрытых слоев (32–192 нейрона), коэффициент Dropout (0,1–0,3), скорость обучения (10−4–10−2, логарифмическая шкала), размер батча (32, 64, 128).</p><p>Обучение проводилось с использованием оптимизатора Adam со скоростью обучения 2 × 10−3 и динамическим снижением при выходе на плато (ReduceLROnPlateau). В качестве функции потерь использовалась среднеквадратичная ошибка (MSE). Применялась ранняя остановка при отсутствии улучшения метрики на валидационной выборке в течение 10 эпох. Итоговая модель достигла сходимости на 38-й эпохе из 50 максимальных.</p><p>Динамика обучения модели GRU представлена на рис. 2.</p><p>Рис. 2. Кривые обучения модели GRU (Direct): динамика MSE на обучающей и валидационной выборках. Лучшая эпоха – 25</p></sec><sec><title>1.5. Метрики оценки качества</title><p>Оценка качества моделей проводилась на тестовой выборке (IV квартал 2023 г., 85 сут, 2208 ч) в режиме ежедневного прогнозирования. Использовались следующие метрики:</p><p>Сезонная наивная модель (S-Naive Daily) используется как методический базис оценки экономии штрафных платежей: она фиксирует нижнюю планку точности нетривиальной модели [2, 19].</p><p>2 Постановление Правительства РФ от 27.12.2010 № 1172 «О правилах оптового рынка электрической энергии и мощности» (с изменениями и дополнениями). URL: http://pravo.gov.ru/proxy/ips/?docbody=&amp;nd=102144342</p></sec><sec><title>2. Результаты</title></sec><sec><title>2.1. Сводные результаты экспериментального сравнения</title><p>В ходе исследования проведено сравнение 17 конфигураций, образующих полный факторный план: 12 нейросетевых конфигураций (шесть архитектур – RNN, GRU, LSTM, BiLSTM, CNN-LSTM [23, 24], модель с механизмом внимания – в двух стратегиях многошагового прогнозирования: прямой Direct Multi-Output и рекурсивной Recursive), две регуляризованные авторегрессии (Ridge AR, Ridge ADL), две сезонные наивные модели (S-Naive Daily, S-Naive Weekly) и действующий план предприятия как опорный ориентир. Результаты тестирования на выборке IV квартала 2023 г. представлены в табл. 1.</p><p>Экспериментальный план настоящего исследования организован как полный факторный набор из 17 конфигураций, что позволяет раздельно оценить вклад выбора архитектуры, стратегии многошагового прогнозирования и линейности отображения.</p></sec><sec><title>2.2. Анализ лидирующей модели</title><p>Результаты экспериментов однозначно демонстрируют лидерство модели GRU с прямой стратегией прогнозирования. Данная конфигурация обеспечила наилучшую точность (MAPE 5,44 %) и максимальный экономический эффект (экономия 21,25 %), значительно превосходя как наивные базисы, так и более сложные архитектуры с механизмами внимания.</p><p>Отношение дисперсий модели GRU с прямой стратегией составило 0,402, что свидетельствует о способности модели воспроизводить около 40 % естественной волатильности процесса электропотребления. Это выше, чем у моделей с рекурсивной стратегией (0,179–0,247), которые демонстрируют выраженный эффект сглаживания прогноза из-за накопления ошибки.</p><p>Архитектура GRU превзошла более сложную LSTM (MAPE 6,49 %) при меньшем количестве обучаемых параметров.</p><p>Способность модели адаптироваться к резким изменениям нагрузки проиллюстрирована на рис. 3 на примере провала нагрузки 30.10–01.11.2023. На горизонте 48 ч прогноза MAPE модели GRU (Direct) составила 17,22 %, тогда как линейная многофакторная модель Ridge ADL (168,6) с тем же шестиканальным входом – 43,70 %. Доверительные интервалы (95 %), показанные на рисунке, рассчитаны как ±1,96·σ̂ от эмпирического стандартного отклонения ошибки по каждому часу горизонта на тестовой выборке.</p><p>Рис. 3. Сравнение прогнозов моделей GRU (Direct) и Ridge ADL (168,6) при резком снижении нагрузки (30.10–01.11.2023). На основном графике показаны фактическое потребление, точечные прогнозы обеих моделей и 95 %-ные доверительные интервалы по эмпирической оценке  ошибки на тестовой выборке; в области каждого дня прогноза вынесены значения MAPE по соответствующему 24-часовому участку. Нижняя панель – почасовая абсолютная процентная ошибка APE с горизонтальными линиями средних MAPE на горизонте 48 ч: GRU (Direct) 17,22 % / Ridge ADL(168,6) 43,70 %</p></sec><sec><title>2.3. Сравнение со статистическими baseline-моделями</title><p>Чтобы оценить вклад нелинейных зависимостей в точность прогноза, проведено сравнение с регуляризованными статистическими моделями. Ridge AR (168) – одномерная модель глубиной 168 ч – показала MAPE 6,78 %, Ridge ADL(168,6) с шестиканальным входом – MAPE 6,82 %. Ridge AR (168) использован как одномерный линейный якорь, отделяющий вклад нелинейности от вклада экзогенных факторов. Ridge ADL (168,6) показан на рис. 3 (см. раздел 2.2) как линейная модель с тем же шестиканальным входом, что и GRU.</p><p>Преимущество нейросетевой модели GRU перед Ridge AR составляет 1,34 пп по MAPE и 14,3 % по экономии штрафных платежей. Данный разрыв количественно характеризует вклад нелинейных эффектов: согласно работе [<xref ref-type="bibr" rid="cit11">11</xref>] учёт нелинейной сезонности и тренда нейросетевыми моделями повышает точность по сравнению с линейными аналогами, что и подтверждается рекуррентной архитектурой GRU.</p><p>Сравнение отношений дисперсий прогнозов различных моделей представлено на рис. 4.</p><p>Рис. 4. Отношение дисперсий (VR) прогнозов моделей: VR = 1,0 соответствует полному сохранению дисперсии исходного ряда</p></sec><sec><title>2.4. Экономическая эффективность</title><p>Экономический эффект оценивался через снижение штрафных санкций на оптовом рынке электроэнергии и мощности (ОРЭМ). Штраф рассчитывается как произведение абсолютной ошибки прогноза на почасовую цену электроэнергии согласно действующим правилам рынка2.</p><p>При переходе от лучшего наивного ориентира – сезонной наивной модели (S-Naive) – к модели GRU с прямой стратегией снижение абсолютной ошибки составило 1,91 пп (с 7,35 до 5,44 %). На тестовом периоде (IV квартал 2023 г.) экономия штрафных платежей составила 38,6 млн руб., что эквивалентно снижению на 21,25 %. Аналогичный расчёт может быть выполнен на последующих периодах при сохранении режима эксплуатации.</p><p>2 Постановление Правительства РФ от 27.12.2010 № 1172 «О правилах оптового рынка электрической энергии и мощности» (с изменениями и дополнениями). URL: http://pravo.gov.ru/proxy/ips/?docbody=&amp;nd=102144342</p></sec><sec><title>3. Обсуждение</title></sec><sec><title>3.1. Эффект избыточной сложности архитектуры</title><p>Одним из эмпирических наблюдений исследования является «парадокс сложности»: более простая архитектура GRU превзошла модели с механизмами внимания (Attention-GRU, LSTM-Attention), несмотря на теоретические преимущества последних. Данный результат согласуется с выводами критического обзора [<xref ref-type="bibr" rid="cit10">10</xref>], показавшего, что на выборках малого и среднего объема (менее 3–5 лет почасовых данных) трансформерные модели склонны к переобучению.</p><p>На выборках малого и среднего объёма промышленного класса параметрическая ёмкость механизма внимания не насыщается обучающим сигналом, что повышает чувствительность к шуму и проявляется в подавлении волатильности прогноза вплоть до фактического воспроизведения сглаженного среднего профиля; результаты на промышленных данных ограниченного объёма согласуются с выводами обзора рекуррентных и трансформерных моделей [<xref ref-type="bibr" rid="cit10">10</xref>] (см. табл. 1).</p><p>Архитектура GRU использует два управляющих вентиля (обновления и сброса) вместо трёх в LSTM (входной, забывания, выходной), что соответственно сокращает число обучаемых параметров на единицу скрытого состояния. На промышленных рядах с регулярными пропусками и выбросами это снижает склонность к переобучению и повышает устойчивость к выбросам и пропускам данных, что и наблюдается в сводных результатах (см. табл. 1).</p></sec><sec><title>3.2. Критический анализ рекурсивной стратегии</title><p>Сравнение стратегий выявило преимущество прямого метода (Direct) над рекурсивным (Recursive) по MAPE и отношению дисперсий для всех исследованных архитектур (численные расхождения приведены в табл. 1).</p><p>Причина деградации точности рекурсивной стратегии заключается в кумулятивном накоплении ошибки: прогнозное значение на шаге k содержит ошибку, которая передаётся на вход при прогнозировании шага k + 1. На горизонте 24 ч этот эффект приводит к систематическому занижению волатильности прогноза, что отражается в значениях отношения дисперсий по конфигурациям с рекурсивной стратегией (см. табл. 1).</p><p>Дополнительным ограничением рекурсивной стратегии в контексте настоящей задачи является невозможность использования экзогенных PCA-факторов, отражающих стохастические технологические режимы. Прямая стратегия позволяет учитывать многофакторную природу электропотребления без необходимости прогнозирования самих факторов.</p></sec><sec><title>3.3. Сопоставление с действующей системой планирования</title><p>Действующий план предприятия формируется по принятой на предприятии процедуре подготовки плановых заявок на ОРЭМ. Его числовые показатели приведены в табл. 1 в качестве опорного ориентира; качественные оценки текущей системы планирования в настоящей работе не приводятся.</p></sec><sec><title>3.4. Ограничения исследования и направления развития</title><p>Следует отметить ограничения проведенного исследования. Во-первых, модель разработана и валидирована на данных одного предприятия, что требует дополнительной проверки переносимости результатов на другие объекты горнопромышленной отрасли. Объём обучающей выборки составляет около 13 000 почасовых наблюдений (см. раздел 1.1) и относится к единственному объекту, что ограничивает возможности обобщения и не позволяет в рамках настоящего исследования провести сопоставительный анализ между несколькими предприятиями. Во-вторых, модель формирует детерминированный точечный прогноз и не обеспечивает оценку неопределенности, что ограничивает возможности управления рисками на балансирующем рынке.</p><p>Перспективными направлениями развития являются расширение исследования на кластер предприятий с различными технологическими циклами, разработка вероятностной версии модели на основе архитектуры DeepAR [<xref ref-type="bibr" rid="cit25">25</xref>] для генерации доверительных интервалов и интеграция модели в автоматизированную систему формирования заявок на ОРЭМ.</p></sec><sec><title>Выводы</title><p>Сравнение шести рекуррентных и гибридных архитектур на данных горноперерабатывающего предприятия с непрерывным основным производством показало, что наилучшую точность прогноза электропотребления среди рассмотренных моделей даёт GRU. Архитектуры с механизмами внимания на выборках ограниченного объёма уступают простым рекуррентным моделям, наихудший результат – у LSTM-Attention с подавлением волатильности прогноза до сглаженного среднего профиля (см. табл. 1). Прямая стратегия многошагового прогнозирования обоснована как единственно применимая при использовании стохастических композитных PCA-факторов, не имеющих детерминированного будущего. Она сохраняет естественную волатильность процесса: отношение дисперсий модели GRU превышает соответствующее значение для действующего плана предприятия (см. табл. 1). Сравнение с регуляризованной авторегрессией Ridge AR подтверждает значимость нелинейных зависимостей в структуре данных. Гиперпараметры подобраны методом Hyperband, валидация выполнена на промышленных данных 2022–2023 гг. (~17 500 почасовых измерений). На тестовом периоде (IV квартал 2023 г.) разработанная модель даёт экономический эффект 38,6 млн руб. – снижение штрафных платежей на 21,25 % относительно базиса S-Naive Daily.</p></sec></body><back><ref-list><title>References</title><ref id="cit1"><label>1</label><citation-alternatives><mixed-citation xml:lang="ru">Klyuev R. V., Bosikov I. I., Gavrina O. A. et al. Improving the energy efficiency of technological equipment at mining enterprises. Advances in Intelligent Systems and Computing. 2021;1258:262–271. https://doi.org/10.1007/978-3-030-57450-5_24</mixed-citation><mixed-citation xml:lang="en">Klyuev R. V., Bosikov I. I., Gavrina O. A. et al. Improving the energy efficiency of technological equipment at mining enterprises. Advances in Intelligent Systems and Computing. 2021;1258:262–271. https://doi.org/10.1007/978-3-030-57450-5_24</mixed-citation></citation-alternatives></ref><ref id="cit2"><label>2</label><citation-alternatives><mixed-citation xml:lang="ru">Hyndman R. J., Koehler A. B. Another look at measures of forecast accuracy. International Journal of Forecasting. 2006;22(4):679–688. https://doi.org/10.1016/j.ijforecast.2006.03.001</mixed-citation><mixed-citation xml:lang="en">Hyndman R. J., Koehler A. B. Another look at measures of forecast accuracy. International Journal of Forecasting. 2006;22(4):679–688. https://doi.org/10.1016/j.ijforecast.2006.03.001</mixed-citation></citation-alternatives></ref><ref id="cit3"><label>3</label><citation-alternatives><mixed-citation xml:lang="ru">Hochreiter S., Schmidhuber J. Long short-term memory. Neural Computation. 1997;9(8):1735–1780. https://doi.org/10.1162/neco.1997.9.8.1735</mixed-citation><mixed-citation xml:lang="en">Hochreiter S., Schmidhuber J. Long short-term memory. Neural Computation. 1997;9(8):1735–1780. https://doi.org/10.1162/neco.1997.9.8.1735</mixed-citation></citation-alternatives></ref><ref id="cit4"><label>4</label><citation-alternatives><mixed-citation xml:lang="ru">Cho K., van Merrienboer B., Gulcehre C. et al. Learning phrase representations using RNN encoder-decoder for statistical machine translation. In: Proceedings of the Conference on Empirical Methods in Natural Language Processing (EMNLP). Doha: ACL; 2014. Pp. 1724–1734. https://doi.org/10.3115/v1/D14-1179</mixed-citation><mixed-citation xml:lang="en">Cho K., van Merrienboer B., Gulcehre C. et al. Learning phrase representations using RNN encoder-decoder for statistical machine translation. In: Proceedings of the Conference on Empirical Methods in Natural Language Processing (EMNLP). Doha: ACL; 2014. Pp. 1724–1734. https://doi.org/10.3115/v1/D14-1179</mixed-citation></citation-alternatives></ref><ref id="cit5"><label>5</label><citation-alternatives><mixed-citation xml:lang="ru">Bengio Y., Simard P., Frasconi P. Learning long-term dependencies with gradient descent is difficult. IEEE Transactions on Neural Networks. 1994;5(2):157–166. https://doi.org/10.1109/72.279181</mixed-citation><mixed-citation xml:lang="en">Bengio Y., Simard P., Frasconi P. Learning long-term dependencies with gradient descent is difficult. IEEE Transactions on Neural Networks. 1994;5(2):157–166. https://doi.org/10.1109/72.279181</mixed-citation></citation-alternatives></ref><ref id="cit6"><label>6</label><citation-alternatives><mixed-citation xml:lang="ru">Vaswani A., Shazeer N., Parmar N. et al. Attention is all you need. In: Advances in Neural Information Processing Systems. 2017;30:5998–6008. https://doi.org/10.48550/arXiv.1706.03762</mixed-citation><mixed-citation xml:lang="en">Vaswani A., Shazeer N., Parmar N. et al. Attention is all you need. In: Advances in Neural Information Processing Systems. 2017;30:5998–6008. https://doi.org/10.48550/arXiv.1706.03762</mixed-citation></citation-alternatives></ref><ref id="cit7"><label>7</label><citation-alternatives><mixed-citation xml:lang="ru">Lim B., Arik S. O., Loeff N., Pfister T. Temporal Fusion Transformers for interpretable multi-horizon time series forecasting. International Journal of Forecasting. 2021;37(4):1748–1764. https://doi.org/10.1016/j.ijforecast.2021.03.012</mixed-citation><mixed-citation xml:lang="en">Lim B., Arik S. O., Loeff N., Pfister T. Temporal Fusion Transformers for interpretable multi-horizon time series forecasting. International Journal of Forecasting. 2021;37(4):1748–1764. https://doi.org/10.1016/j.ijforecast.2021.03.012</mixed-citation></citation-alternatives></ref><ref id="cit8"><label>8</label><citation-alternatives><mixed-citation xml:lang="ru">Zhou H., Zhang S., Peng J. et al. Informer: Beyond efficient transformer for long sequence time-series forecasting. In: Proceedings of the AAAI Conference on Artificial Intelligence. 2021;35(12):11106–11115. https://doi.org/10.1609/aaai.v35i12.17325</mixed-citation><mixed-citation xml:lang="en">Zhou H., Zhang S., Peng J. et al. Informer: Beyond efficient transformer for long sequence time-series forecasting. In: Proceedings of the AAAI Conference on Artificial Intelligence. 2021;35(12):11106–11115. https://doi.org/10.1609/aaai.v35i12.17325</mixed-citation></citation-alternatives></ref><ref id="cit9"><label>9</label><citation-alternatives><mixed-citation xml:lang="ru">Wu H., Xu J., Wang J., Long M. Autoformer: Decomposition transformers with auto-correlation for long-term series forecasting. In: Advances in Neural Information Processing Systems. 2021;34:22419–22430. https://doi.org/10.48550/arXiv.2106.13008</mixed-citation><mixed-citation xml:lang="en">Wu H., Xu J., Wang J., Long M. Autoformer: Decomposition transformers with auto-correlation for long-term series forecasting. In: Advances in Neural Information Processing Systems. 2021;34:22419–22430. https://doi.org/10.48550/arXiv.2106.13008</mixed-citation></citation-alternatives></ref><ref id="cit10"><label>10</label><citation-alternatives><mixed-citation xml:lang="ru">Zeng A., Chen M., Zhang L., Xu Q. Are transformers effective for time series forecasting? In: Proceedings of the AAAI Conference on Artificial Intelligence. 2023;37(9):11121–11128. https://doi.org/10.1609/aaai.v37i9.26317</mixed-citation><mixed-citation xml:lang="en">Zeng A., Chen M., Zhang L., Xu Q. Are transformers effective for time series forecasting? In: Proceedings of the AAAI Conference on Artificial Intelligence. 2023;37(9):11121–11128. https://doi.org/10.1609/aaai.v37i9.26317</mixed-citation></citation-alternatives></ref><ref id="cit11"><label>11</label><citation-alternatives><mixed-citation xml:lang="ru">Zhang G. P., Qi M. Neural network forecasting for seasonal and trend time series. European Journal of Operational Research. 2005;160(2):501–514. https://doi.org/10.1016/j.ejor.2003.08.037</mixed-citation><mixed-citation xml:lang="en">Zhang G. P., Qi M. Neural network forecasting for seasonal and trend time series. European Journal of Operational Research. 2005;160(2):501–514. https://doi.org/10.1016/j.ejor.2003.08.037</mixed-citation></citation-alternatives></ref><ref id="cit12"><label>12</label><citation-alternatives><mixed-citation xml:lang="ru">Ben Taieb S., Atiya A. F. A bias and variance analysis for multistep-ahead time series forecasting. IEEE Transactions on Neural Networks and Learning Systems. 2016;27(1):62–76. https://doi.org/10.1109/TNNLS.2015.2411629</mixed-citation><mixed-citation xml:lang="en">Ben Taieb S., Atiya A. F. A bias and variance analysis for multistep-ahead time series forecasting. IEEE Transactions on Neural Networks and Learning Systems. 2016;27(1):62–76. https://doi.org/10.1109/TNNLS.2015.2411629</mixed-citation></citation-alternatives></ref><ref id="cit13"><label>13</label><citation-alternatives><mixed-citation xml:lang="ru">Карпенко С. М., Карпенко Н. В., Безгинов Г. Ю. Прогнозирование электропотребления на горнопромышленных предприятиях с использованием статистических методов. Горная промышленность. 2022;(1):82–88. https://doi.org/10.30686/1609-9192-2022-1-82-88</mixed-citation><mixed-citation xml:lang="en">Karpenko S. M., Karpenko N. V., Bezginov G. Y. Forecasting of power consumption at mining enterprises using statistical methods. Russian Mining Industry. 2022;(1):82–88. (In Russ.) https://doi.org/10.30686/1609-9192-2022-1-82-88</mixed-citation></citation-alternatives></ref><ref id="cit14"><label>14</label><citation-alternatives><mixed-citation xml:lang="ru">Hewamalage H., Bergmeir C., Bandara K. Recurrent neural networks for time series forecasting: current status and future directions. International Journal of Forecasting. 2021;37(1):388–427. https://doi.org/10.1016/j.ijforecast.2020.06.008</mixed-citation><mixed-citation xml:lang="en">Hewamalage H., Bergmeir C., Bandara K. Recurrent neural networks for time series forecasting: current status and future directions. International Journal of Forecasting. 2021;37(1):388–427. https://doi.org/10.1016/j.ijforecast.2020.06.008</mixed-citation></citation-alternatives></ref><ref id="cit15"><label>15</label><citation-alternatives><mixed-citation xml:lang="ru">Sangiorgio M., Dercole F. Robustness of LSTM neural networks for multi-step forecasting of chaotic time series. Chaos, Solitons &amp; Fractals. 2020;139:110045. https://doi.org/10.1016/j.chaos.2020.110045</mixed-citation><mixed-citation xml:lang="en">Sangiorgio M., Dercole F. Robustness of LSTM neural networks for multi-step forecasting of chaotic time series. Chaos, Solitons &amp; Fractals. 2020;139:110045. https://doi.org/10.1016/j.chaos.2020.110045</mixed-citation></citation-alternatives></ref><ref id="cit16"><label>16</label><citation-alternatives><mixed-citation xml:lang="ru">Zawodnik V., Schwaiger F., Sorger M., Kienberger T. Tackling uncertainty: forecasting the energy consumption and demand of an electric arc furnace with limited knowledge on process parameters. Energies. 2024;17(6):1326. https://doi.org/10.3390/en17061326</mixed-citation><mixed-citation xml:lang="en">Zawodnik V., Schwaiger F., Sorger M., Kienberger T. Tackling uncertainty: forecasting the energy consumption and demand of an electric arc furnace with limited knowledge on process parameters. Energies. 2024;17(6):1326. https://doi.org/10.3390/en17061326</mixed-citation></citation-alternatives></ref><ref id="cit17"><label>17</label><citation-alternatives><mixed-citation xml:lang="ru">Ben Taieb S., Bontempi G., Atiya A. F., Sorjamaa A. A review and comparison of strategies for multi-step ahead time series forecasting based on the NN5 forecasting competition. Expert Systems with Applications. 2012;39(8):7067–7083. https://doi.org/10.1016/j.eswa.2012.01.039</mixed-citation><mixed-citation xml:lang="en">Ben Taieb S., Bontempi G., Atiya A. F., Sorjamaa A. A review and comparison of strategies for multi-step ahead time series forecasting based on the NN5 forecasting competition. Expert Systems with Applications. 2012;39(8):7067–7083. https://doi.org/10.1016/j.eswa.2012.01.039</mixed-citation></citation-alternatives></ref><ref id="cit18"><label>18</label><citation-alternatives><mixed-citation xml:lang="ru">Li H., Li S., Wu Y. et al. Short-term power load forecasting for integrated energy system based on a residual and attentive LSTM-TCN hybrid network. Frontiers in Energy Research. 2024;12:1384142. https://doi.org/10.3389/fenrg.2024.1384142</mixed-citation><mixed-citation xml:lang="en">Li H., Li S., Wu Y. et al. Short-term power load forecasting for integrated energy system based on a residual and attentive LSTM-TCN hybrid network. Frontiers in Energy Research. 2024;12:1384142. https://doi.org/10.3389/fenrg.2024.1384142</mixed-citation></citation-alternatives></ref><ref id="cit19"><label>19</label><citation-alternatives><mixed-citation xml:lang="ru">Bergstra J., Bengio Y. Random search for hyper-parameter optimization. Journal of Machine Learning Research. 2012;13(1):281–305. URL: https://www.jmlr.org/papers/v13/bergstra12a.html</mixed-citation><mixed-citation xml:lang="en">Bergstra J., Bengio Y. Random search for hyper-parameter optimization. Journal of Machine Learning Research. 2012;13(1):281–305. URL: https://www.jmlr.org/papers/v13/bergstra12a.html</mixed-citation></citation-alternatives></ref><ref id="cit20"><label>20</label><citation-alternatives><mixed-citation xml:lang="ru">Marcellino M., Stock J. H., Watson M. W. A comparison of direct and iterated multistep AR methods for forecasting macroeconomic time series. Journal of Econometrics. 2006;135(1–2):499–526. https://doi.org/10.1016/j.jeconom.2005.07.020</mixed-citation><mixed-citation xml:lang="en">Marcellino M., Stock J. H., Watson M. W. A comparison of direct and iterated multistep AR methods for forecasting macroeconomic time series. Journal of Econometrics. 2006;135(1–2):499–526. https://doi.org/10.1016/j.jeconom.2005.07.020</mixed-citation></citation-alternatives></ref><ref id="cit21"><label>21</label><citation-alternatives><mixed-citation xml:lang="ru">Li L., Jamieson K., DeSalvo G., Rostamizadeh A., Talwalkar A. Hyperband: A novel bandit-based approach to hyperparameter optimization. Journal of Machine Learning Research. 2018;18(185):1–52. https://doi.org/10.48550/arXiv.1603.06560</mixed-citation><mixed-citation xml:lang="en">Li L., Jamieson K., DeSalvo G., Rostamizadeh A., Talwalkar A. Hyperband: A novel bandit-based approach to hyperparameter optimization. Journal of Machine Learning Research. 2018;18(185):1–52. https://doi.org/10.48550/arXiv.1603.06560</mixed-citation></citation-alternatives></ref><ref id="cit22"><label>22</label><citation-alternatives><mixed-citation xml:lang="ru">Chung J., Gulcehre C., Cho K., Bengio Y. Empirical evaluation of gated recurrent neural networks on sequence modeling. In: NIPS 2014 Workshop on Deep Learning. 2014. https://doi.org/10.48550/arXiv.1412.3555</mixed-citation><mixed-citation xml:lang="en">Chung J., Gulcehre C., Cho K., Bengio Y. Empirical evaluation of gated recurrent neural networks on sequence modeling. In: NIPS 2014 Workshop on Deep Learning. 2014. https://doi.org/10.48550/arXiv.1412.3555</mixed-citation></citation-alternatives></ref><ref id="cit23"><label>23</label><citation-alternatives><mixed-citation xml:lang="ru">Bai S., Kolter J. Z., Koltun V. An empirical evaluation of generic convolutional and recurrent networks for sequence modeling. arXiv preprint: 1803.01271. 2018. https://doi.org/10.48550/arXiv.1803.01271</mixed-citation><mixed-citation xml:lang="en">Bai S., Kolter J. Z., Koltun V. An empirical evaluation of generic convolutional and recurrent networks for sequence modeling. arXiv preprint: 1803.01271. 2018. https://doi.org/10.48550/arXiv.1803.01271</mixed-citation></citation-alternatives></ref><ref id="cit24"><label>24</label><citation-alternatives><mixed-citation xml:lang="ru">Alhussein M., Aurangzeb K., Haider S. I. Hybrid CNN-LSTM model for short-term individual household load forecasting. IEEE Access. 2020;8:180544–180557. https://doi.org/10.1109/ACCESS.2020.3028281</mixed-citation><mixed-citation xml:lang="en">Alhussein M., Aurangzeb K., Haider S. I. Hybrid CNN-LSTM model for short-term individual household load forecasting. IEEE Access. 2020;8:180544–180557. https://doi.org/10.1109/ACCESS.2020.3028281</mixed-citation></citation-alternatives></ref><ref id="cit25"><label>25</label><citation-alternatives><mixed-citation xml:lang="ru">Salinas D., Flunkert V., Gasthaus J., Januschowski T. DeepAR: Probabilistic forecasting with autoregressive recurrent networks. International Journal of Forecasting. 2020;36(3):1181–1191. https://doi.org/10.1016/j.ijforecast.2019.07.001</mixed-citation><mixed-citation xml:lang="en">Salinas D., Flunkert V., Gasthaus J., Januschowski T. DeepAR: Probabilistic forecasting with autoregressive recurrent networks. International Journal of Forecasting. 2020;36(3):1181–1191. https://doi.org/10.1016/j.ijforecast.2019.07.001</mixed-citation></citation-alternatives></ref></ref-list><fn-group><fn fn-type="conflict"><p>The authors declare that there are no conflicts of interest present.</p></fn></fn-group></back></article>
