Tata Elxsi виявляє ризики на заводі за секунди
Компанія побудувала на AWS платформу IRIS для аналізу відео з промислових камер у реальному часі. Раніше оператор control-room помічав небезпечну ситуацію за 15–45 хвилин, а ручні обходи охоплювали лише 2–3 перевірки за зміну. IRIS фільтрує кадри прямо на edge-серверах (NVIDIA Jetson через AWS IoT Greengrass), тому в хмару йде на 70–80% менше даних. Далі події обробляють моделі на Amazon SageMaker AI — YOLOv8 для контролю касок і жилетів, геозонування для заборонених зон, розпізнавання дій для небезпечних поз — із затримкою до 300 мс. Шар кореляції на Lambda і DynamoDB відсіює 40–50% хибних тривог.
Шлях кадру: від камери до тривоги за секунди
Система не передає в хмару відео як таке. На кожному об'єкті стоїть окремий сервер з GPU (NVIDIA Jetson), підключений до камер. Він бере 2–5 кадрів на секунду, відсіює нерухомі сцени та лишає лише ті кадри, де є люди, техніка чи обладнання. Такий кадр зберігається в хмарному сховищі (Amazon S3), а в потік подій летить не сам кадр, а посилання на нього плюс мінімальний опис: номер камери, майданчик, зона, точний час. Це утримує кожну подію під 1 КБ.
Потік подій обробляє сервіс Amazon Kinesis Data Streams, розрахований саме на такий формат — багато дрібних структурованих записів, а не відео. Він масштабується автоматично, без ручного налаштування, і витримує 2000–5000 подій на секунду з пікових навантаженням до 15 000; затримка на прийом події — до 200 мс.
Чотири моделі одночасно — і фільтр хибних тривог
Розпізнавання розбите на окремі моделі, кожна працює незалежно й масштабується сама: YOLOv8 перевіряє каски й жилети, окрема модель стежить за геозонами і фіксує перетин заборонених меж, ще одна аналізує пози й рухи людини (для небезпечних дій), четверта відстежує відстань між технікою і людьми. Кожна модель обробляє кадри пачками по 4–8 штук, щоб ефективніше використати GPU; одна обчислювальна одиниця витримує 40–60 запитів на секунду із затримкою до 300 мс.
Окрема тривога від однієї камери рідко варта негайної реакції — людина могла на секунду переступити межу. Тому перед сповіщенням спрацьовує шар кореляції: він тримає короткострокову «пам'ять» подій (від 30 секунд до 5 хвилин) і враховує критичність зони, частоту й тривалість порушень, історію поведінки на цій ділянці. Це відсіює 40–50% сповіщень, які не варті уваги диспетчера.
Ті тривоги, що пройшли кореляцію, класифікуються за рівнем: критичні надсилаються за 5 секунд і ескалуються, якщо ніхто не підтвердив за 2 хвилини; високі — за 10 секунд з ескалацією через 5 хвилин; середні збираються в дайджест; низькі просто логуються для аналізу трендів без миттєвого сповіщення. Ескалація автоматично піднімається від майстра зміни до керівника майданчика й далі до директора з безпеки, якщо тривогу ніхто не опрацював.
Зберігання даних і безпека
Кожна подія, включно з доказами для розслідувань, зберігається за політикою термінів: перші 30 днів — у «гарячому» доступі, до 90 днів — у дешевшому архіві з повільнішим доступом, до року — у холодному сховищі з відновленням за мілісекунди (для аудитів), далі — у довгостроковому архіві. Кадри без порушень видаляються вже через 7 днів, а прив'язані до підтверджених інцидентів зберігаються рік.
Дані шифруються ключами, якими керує сама компанія, обмін між сервісами йде захищеним каналом (TLS 1.2+), а доступ співробітників прив'язаний до їхньої ролі. Обчислення працюють у ізольованій мережі без виходу в публічний інтернет, усі звернення до API логуються, а аномальний доступ відстежується автоматично.
Донавчання моделі та типові помилки при впровадженні
Точність моделі не фіксована — вона донавчається на реальних даних із виробництва (80% реальних розмічених прикладів і 20% синтетичних для рідкісних випадків на кшталт нетипового освітлення чи незвичного ракурсу камери). Перенавчання запускається за трьома тригерами: за розкладом раз на квартал, коли моніторинг фіксує падіння точності нижче порогу, або коли накопичується достатньо нових розмічених прикладів. Оновлена модель заступає на роботу лише якщо показує результат не гірший за поточний — це перевіряють на відкладеному наборі даних перед розгортанням.
На виробничих даних точність розпізнавання каски й жилета — 94,2% (влучність) і 91,8% (повнота), для порушення заборонених зон — 96,1% і 93,4% відповідно, а частка хибних тривог після кореляції — менше 3%.
- Не передавати відео в хмару цілком — це і дорого, і повільно; фільтрувати треба на місці, ще до передавання даних.
- Не пропускати шар кореляції — без нього сирі спрацювання моделей завалюють диспетчера шумом, і команда перестає довіряти системі та ігнорує тривоги.
- Закладати перенавчання моделі одразу, а не як доопрацювання «колись потім» — точність падає, коли на майданчику змінюється освітлення, кут камер чи типи обладнання.
- Питання анонімізації облич, термінів зберігання відео і хто має доступ до записів — вирішувати на етапі проєктування, а не після запуску.
Вартість впровадження та терміни розгортання такої платформи в матеріалі не наводяться.