Decathlon перевела прогноз попиту на Chronos-2
Ритейлер щотижня прогнозує продажі до 25 000 товарів у кожній зоні постачання: на 12 тижнів для закупівель і на 52 — для запасів та потужностей. Chronos-2 обрали після тесту на 101 часовому зрізі за майже два роки й 39 000 товарних рядах. Модель вкладалася у дві хвилини інференсу на 25 000 товарів.
У режимі zero-shot Chronos-2 зрівнялася або перевершила стару систему, яку перенавчали щотижня. Після донавчання вона дала найнижчу похибку на обох горизонтах; тепер LoRA-адаптацію запускають раз на шість місяців, а пакетні прогнози — щотижня на AWS.
Як перевіряти модель на власному попиті
Глобальний рейтинг придатний лише для короткого списку. У Decathlon моделі, що були вище у загальних рейтингах, гірше працювали на розподілах роздрібних продажів. Тому кандидатів порівнювали з чинною виробничою системою на ковзних зрізах, двох горизонтах і десятках тисяч товарних рядів.
- Окремо оцініть горизонт поповнення і горизонт планування запасів та потужностей.
- Основну метрику доповніть RMSE, зміщенням прогнозу та часткою попарних перемог. Середня похибка не покаже, на скількох товарах інша модель краща.
- Перевірте час пакетного прогнозу на реальному обсязі, а не на демонстраційній вибірці.
Порівняй кандидатів із виробничою моделлю на ковзних історичних зрізах. Для кожного горизонту покажи WAPE, RMSE, bias, попарну частку перемог і час інференсу на повному наборі товарів.
Дві робочі ситуації, яких не видно із середньої метрики
Перша ситуація — товари з різною сезонністю. Сигнал для лижних рукавичок принципово відрізняється від сигналу для дошки для серфінгу. Один підсумковий WAPE може приховати, що модель добре працює для одного типу рядів і програє для іншого. Саме тому Decathlon тестувала багато товарів і дивилася попарні перемоги, а не лише загальний бал.
Друга ситуація — запуск у новій зоні постачання. Раніше масштабування на новий регіон вимагало додаткової інженерної роботи. З Chronos-2 команда донавчає модель на локальній історії без переробки архітектури; моделі, гіперпараметри та версії ведуть окремо для кожної зони. Це не означає, що результат однієї зони можна автоматично перенести на іншу.
Покажи результат окремо за групами з різною сезонністю та за зонами постачання. Познач групи, де кандидат програє чинній моделі, навіть якщо загальний WAPE нижчий.
Як скласти виробничий процес
У Decathlon PySpark готує часові ряди. Раз на шість місяців AutoGluon адаптує Chronos-2 методом LoRA на свіжих даних, після чого MLflow реєструє версію моделі для відповідної зони. У проміжні тижні донавчання пропускають: пакетний процес забирає останню зареєстровану модель, формує прогноз, а інший PySpark-процес передає його споживачам. Завдання запускають через Databricks, оркестрацію виконує Airflow, інференс працює на EC2.
- Спочатку запустіть одну донавчену модель без ускладнення набором зовнішніх ознак.
- Після стабільного виробничого запуску додавайте коваріати. Chronos-2 може нативно враховувати пов’язані ряди через групову увагу.
- Розділіть рідкісну адаптацію моделі та щотижневий інференс.
- Зберігайте версію і гіперпараметри окремо для кожної зони, щоб прогноз можна було відтворити.
Де підхід має межі та що перевіряє людина
Zero-shot придатний для перевірки життєздатності, але в цьому кейсі найкращий результат дало донавчання. Загальний лідер також не перемагає на кожному товарі: інші моделі були кращими приблизно для 40% товарів, тому Decathlon планує ансамбль Mixture of Experts. Для нових товарів окремо досліджують cold start, а ціну й погоду ще лише планують додати як коваріати.
Типові помилки: обрати модель за глобальним рейтингом; перевірити один зріз або один горизонт; перенести висновки між регіонами; дивитися лише на точність; одразу ускладнити систему коваріатами. Виправлення випливають із процесу Decathlon: локальний бенчмарк, кілька метрик, окремі моделі за зонами, контроль часу інференсу та поетапне розширення.
- Чи стабільні WAPE, RMSE і bias на обох горизонтах?
- На яких товарах стара або інша модель перемагає?
- Чи відповідає зареєстрована версія моделі потрібній зоні?
- Чи підтверджений ефект там, де модель вже працює? Наведені виробничі результати отримані для Південно-Східної Азії та Латинської Америки, а розгортання в інших зонах ще триває.