All issues
- 2026 Vol. 18
- 2025 Vol. 17
- 2024 Vol. 16
- 2023 Vol. 15
- 2022 Vol. 14
- 2021 Vol. 13
- 2020 Vol. 12
- 2019 Vol. 11
- 2018 Vol. 10
- 2017 Vol. 9
- 2016 Vol. 8
- 2015 Vol. 7
- 2014 Vol. 6
- 2013 Vol. 5
- 2012 Vol. 4
- 2011 Vol. 3
- 2010 Vol. 2
- 2009 Vol. 1
-
QUBO-формализация двухэшелонной задачи маршрутизации транспорта с опциональной активацией промежуточных узлов: диагностика штрафного ландшафта и гибридный алгоритм
Компьютерные исследования и моделирование, 2026, т. 18, № 4, с. 765-791Вывозка лесоматериалов из удаленных лесозаготовительных районов Сибири характеризуется высоким уровнем транспортных издержек. Наличие протяженных участков грунтовых лесовозных дорог, сезонные ограничения (весенняя распутица, зимники) и значительные расстояния от лесосек до магистральных транспортных узлов (50–200 км) обусловливают необходимость систематического решения задачи рационального планирования маршрутов вывозки.
В настоящей работе предложена математическая модель двухэшелонной маршрутизации транспортных средств (2E-VRP), адаптированная к условиям вывозки лесоматериалов в макрорегионе Урала и Сибири. Модель учитывает переменные транспортные затраты (пробег лесовозов), фиксированные затраты на задействование каждой единицы техники ($c_{fix}$ = 30 000 руб./рейс) и ограничения грузоподъемности. Задача приведена к форме QUBO — квадратичной безусловной бинарной оптимизации; емкостные ограничения интегрированы посредством штрафного коэффициента $\lambda_{cap} = 500$. Такое представление обеспечивает совместимость модели с современными специализированными решателями (квантовыми отжигателями и цифровыми аннилерами).
Апробация модели выполнена на реальной географии Уральского и Сибирского федеральных округов: 207 узлов логистической сети, 65 предприятий-потребителей, 8 магистральных транспортных узлов. Предложенный трехстадийный алгоритм «Допустимость прежде всего» формирует допустимый маршрутный план за 1,7 с и обеспечивает снижение суммарных транспортных затрат на 69% относительно базового генетического алгоритма. Последующая оптимизация методом имитации отжига дополнительно улучшает значение целевой функции QUBO на 55%.
Ключевые слова: вывозка древесины, лесная логистика, лесовозные дороги, двухэшелонная маршрутизация, оптимизация маршрутов лесовозов, QUBO, Уральский федеральный округ, Сибирский федеральный округ, математическое моделирование лесозаготовки.
QUBO formulation of a two-echelon vehicle routing problem with optional activation of intermediate nodes: penalty landscape diagnostics and a hybrid algorithm
Computer Research and Modeling, 2026, v. 18, no. 4, pp. 765-791The haulage of timber from remote logging areas of Siberia is characterized by high transportation costs. Long stretches of unpaved logging roads, seasonal constraints (spring thaw and winter roads), and considerable distances from cutting areas to main transport hubs (50–200 km) make systematic route planning essential.
This paper proposes a mathematical model of the two-echelon vehicle routing problem (2E-VRP) adapted to timber haulage in the macro-region of the Urals and Siberia. The model incorporates variable transportation costs (truck mileage), fixed costs of using each vehicle ($c_{fix}$ = 30 000 RUB per trip), and vehicle-capacity constraints. The problem is transformed into a QUBO (quadratic unconstrained binary optimization) formulation; capacity constraints are integrated through the penalty coefficient $\lambda_{cap}$ = 500. This representation makes the model compatible with modern specialized solvers, including quantum annealers and digital annealers.
The model is tested on the real geography of the Ural and Siberian Federal Districts: 207 nodes in the logistics network, 65 customer enterprises, and 8 main transport hubs. The proposed three-stage “Feasible-First” algorithm constructs a feasible routing plan in 1.7 s and reduces total transportation costs by 69% relative to a baseline genetic algorithm. Subsequent simulated annealing further improves the QUBO objective value by 55%.
-
Применение алгоритма QUBO для отбора траекторий обучения с подкреплением методом Монте-Карло
Компьютерные исследования и моделирование, 2026, т. 18, № 2, с. 273-288Метод Монте-Карло (Monte Carlo, MC) в обучении с подкреплением показывает низкую эффективность при высокой сложности обучающей выборки — в средах с редким вознаграждением, большим пространством состояний и коррелирующими траекториями. Эти ограничения приводят к повышенной вариативности оценок возврата и существенно замедляют процесс сходимости, особенно в задачах, где требуется выделить наиболее информативные эпизоды из большого множества доступных данных. При прямом использовании всех траекторий возникает избыток информации, что ухудшает качество итоговых оценок и увеличивает вычислительную нагрузку. В данной работе мы предлагаем подход, позволяющий преодолеть указанные проблемы за счет оптимизации отбора обучающих данных и структурирования выборки перед применением классического метода Монте-Карло. Задача отбора обучающих траекторий формулируется как квадратичная неограниченная бинарная оптимизация (Quadratic Unconstrained Binary Optimization, QUBO) и решается с помощью алгоритма квантового отжига. Предлагаемый метод MC+QUBO интегрирует комбинаторный фильтрующий шаг в стандартную процедуру оценки: из множества потенциальных траекторий выбирается поднабор, максимизирующий суммарное вознаграждение, обеспечивая при этом достаточное покрытие пространства состояний и снижение взаимной корреляции эпизодов. В QUBO-формулировке линейные члены поощряют включение эпизодов с высоким значением возврата, тогда как квадратичные члены регулируют разнообразие и баланс траекторий, уменьшая риск переобучения на узком подмножестве данных. В качестве решателей из категории «черного ящика» используются алгоритмы симуляции квантового отжига (Simulated Quantum Annealing, SQA) и симулированная бифуркация (Simulated Bifurcation, SB), что позволяет эффективно решать задачи с большим числом потенциальных эпизодов и быстро находить приближенные оптимальные решения. Эксперименты в среде GridWorld показывают, что MC+QUBO превосходит классический метод Монте-Карло по скорости сходимости, устойчивости оценок и качеству итогового обучения, демонстрируя потенциал квантовой оптимизации как инструмента повышения эффективности принятия решений в задачах обучения с подкреплением.
Ключевые слова: метод Монте-Карло, квантовый отжиг, квантовые вычисления, обучение с подкреплением, QUBO.
Quantum-inspired episode selection for Monte Carlo reinforcement learning via QUBO optimization
Computer Research and Modeling, 2026, v. 18, no. 2, pp. 273-288Monte Carlo (MC) reinforcement learning suffers from high sample complexity, especially in environments with sparse rewards, large state spaces, and strongly correlated trajectories that reduce the statistical efficiency of return estimation. These well-known limitations often lead to slow convergence and unstable learning dynamics, particularly in settings where only a small fraction of collected trajectories is actually informative for policy improvement. A key challenge is therefore to identify a compact yet diverse subset of episodes that contributes most to the accuracy of value estimates while preserving sufficient exploration of the environment. To address this challenge, we reformulate episode selection as a Quadratic Unconstrained Binary Optimization (QUBO) problem and solve it using quantum-inspired sampling techniques. Our method, MC+ QUBO, inserts a combinatorial filtering step into the standard MC policy-evaluation pipeline: given a batch of trajectories, it selects a subset that maximizes cumulative reward and encourages broad state-space coverage. This selection procedure is expressed as a QUBO model, where linear terms favor high-return episodes, quadratic terms penalize redundancy between trajectories, and additional coupling terms can be used to enforce coverage-related constraints or promote structural diversity. Within this framework, we investigate two black-box QUBO solvers: Simulated Quantum Annealing (SQA), which emulates tunneling-based exploration of the search landscape, and Simulated Bifurcation (SB), a dynamical-systems-based iterative optimization method. Both solvers demonstrate the ability to efficiently navigate the combinatorial structure of the trajectory-selection problem and to handle batch sizes that are otherwise computationally expensive for exhaustive or deterministic search. Experiments in a finite-horizon GridWorld environment show that MC+QUBO consistently outperforms vanilla MC in convergence speed, stability of return estimates, and final policy quality. These results highlight the promise of quantum-inspired optimization as a practical decision-making subroutine within reinforcement-learning algorithms, offering a scalable way to improve sample efficiency without modifying the underlying learning paradigm.
Indexed in Scopus
Full-text version of the journal is also available on the web site of the scientific electronic library eLIBRARY.RU
The journal is included in the Russian Science Citation Index
The journal is included in the RSCI
International Interdisciplinary Conference "Mathematics. Computing. Education"




