Досвід з ШІ-агентами: код за хвилини, перевірка — за дні, прискорення від 1.2x до 200x
Досвід спільноти — не наша перевірка
Один із коментаторів написав книгу за допомогою Claude як експеримент: справу було зроблено, і, за його словами, це був «дивовижний інструмент і чудовий досвід». Але результатом стала книга, де кожен рядок треба переписувати, є логічні нестиковки по всьому тексту, а стиль настільки поганий, що текст простіше викинути, ніж редагувати. Ту саму думку про розрив між часом на генерацію і часом на перевірку кількоро коментаторів повторили окремо, цитуючи рядки з допису про завдання на 20 хвилин, яке агент виконав за 5 хвилин, але перевірка зайняла 2 дні.
Досвід команд теж розійшовся. Одна команда влітку спробувала агентне кодування «на повну»: шестеро людей одночасно вели по два і більше проєктів. За словами учасника, невдовзі накопичився незавершений обсяг роботи, тікети рухалися швидко, а бюджет на токени зростав, але доводити проєкти до стану, коли замовники задоволені результатом, не виходило. Команда повернулася до жорстких лімітів на паралельну роботу і вимоги працювати парами над нетривіальними проєктами — темп генерації коду і витрати на токени впали, а затор на етапі інтеграції поступово почав розчищатися. Інший коментатор розповів про протилежний результат: його команда, за оцінкою одного з колег, працює вже у 200 разів швидше, ніж два роки тому, тоді як паралельна команда, що не змогла перебудувати архітектуру під ШІ, отримала приріст лише в 1.2 рази.
Кілька учасників поскаржилися на конкретні помилки інструментів. Один описав сесію, під час якої Claude тричі помилявся поспіль: прочитав файл не з тієї директорії через однакову назву, неправильно порахував кількість викликів функції (20 замість 17 за пошуком в IDE) і послався на змінну, якої немає в коді, а потім щоразу вибачався. Ще один коментатор із багаторічним досвідом програмування розповів, що за півроку пробував Claude, ChatGPT, Grok і Gemini: згенерований ними код або взагалі не працював, або був настільки заплутаним, що простіше було переписати самому, тож зрештою він почав використовувати ці інструменти переважно як пошукову систему.
Були й голоси на захист поточного підходу. Один коментатор написав, що не втратив контроль над кодом: замість ревʼю рядок за рядком він активно тестує результат (QA), просить ШІ спрощувати рішення і відхиляє зайву обробку крайових випадків, а описи pull request-ів пише сам, вважаючи вставляння згенерованого ШІ тексту в опис неповагою до тих, хто його читатиме. Інший учасник назвав найкориснішим застосуванням не написання коду, а розбір складних продакшн-інцидентів — зведення даних і логів із кількох джерел, — що, за його словами, помітно скоротило час на розслідування.
«Книга, де кожен рядок треба переписувати, скрізь логічні нестиковки, а стиль настільки поганий, що її варто просто викинути, а не переписувати.»
«Стільки вибачень. Саме такі дрібниці постійно нагадують мені, наскільки мало я можу довіряти штучному «інтелекту».»
Читати в ТелеграміПрактика ШІ в бізнесі — щодня, без хайпу«Один консервативний колега оцінив, що зараз ми працюємо у 200 разів швидше, ніж два роки тому. Паралельна команда бачить приріст лише 1.2x.»