AI Фактор

Extended thinking: коли вмикати, а коли — ні

Практика 09.08.2026
Extended thinking: коли вмикати, а коли — ні

Критерій конкретний: якщо помилка ШІ коштує грошей або рішення впливає на подальший процес — вмикайте сильнішу модель з Effort Max. Приклад: юрист завантажує договір постачання і просить знайти ризики щодо оплати, строків, відповідальності та даних, які потрібно уточнити перед підписанням.

Якщо ви щодня пишете короткий лист боржнику, зводите підсумок зустрічі, порівнюєте два файли чи готуєте чернетку HR-повідомлення — Extended thinking не вмикайте. Sonnet чи Haiku з Effort Medium впораються швидше і не витратять ліміти даремно.

Для рутинних задач тут нічого змінювати не потрібно — глибший режим тільки сповільнить роботу.

Перемикач Extended thinking живе не в окремому налаштуванні, а прямо в полі вводу чату — на моделях, які його підтримують. Поруч із ним — Effort, рівень «глибини мислення»: Low, Medium, High, Max. За замовчуванням стоїть High. Це означає, що навіть без свідомого вибору Claude вже працює в підсиленому режимі — і саме тому варто розуміти, коли знижувати рівень, а не тільки коли підвищувати.

Effort — не бінарний перемикач

Крім самого Extended thinking, є ще один шар контролю — Effort. Для простих запитів достатньо Medium: лист боржнику чи чернетка HR-повідомлення не потребують ні розширеного мислення, ні High-рівня зусиль. Для складного аналізу — Max. Це дає проміжний варіант між «вимкнено повністю» і «увімкнено на повну»: можна тримати Extended thinking активним, але притримати Effort на Medium для задач середньої складності, і піднімати до Max лише тоді, коли ціна помилки справді висока.

Модель вирішує не менше, ніж Effort

Рівень зусиль варто вибирати разом із моделлю, а не окремо від неї. Для важких задач — аналізу, роботи агентів, договорів — призначена Opus. Коли потрібна швидкість — Sonnet. Haiku — найшвидша й найдешевша модель для простих масових задач. Поєднання «слабка модель + Max Effort» чи «Opus + Low Effort» рідко має сенс: сила моделі й глибина мислення повинні відповідати одна одній під конкретну задачу.

Чому глибший режим коштує ліміту, а не тільки часу

Користування Claude вимірюється у двох вікнах: 5-годинна сесія (рахунок стартує з першого повідомлення й скидається через 5 годин) і тижневий ліміт. Обидва вікна спільні для Chat, Cowork і Code — окремих кошиків немає. Швидше за все ліміт з'їдають: важча модель (Opus витрачає більше, ніж Sonnet, а той — більше, ніж Haiku), довгі файли та довга історія чату, конектори й веб-пошук, побудова дашбордів-артефактів і задачі за розкладом, де кожен запуск — це повноцінна нова сесія.

Звідси типова помилка — тримати Extended thinking й High/Max Effort увімкненими «про всяк випадок» для всього підряд. На простому запиті це не покращує відповідь, а просто витрачає той самий ліміт, який знадобиться пізніше на справді складний договір чи аналіз.

Як економити ліміт, не жертвуючи якістю

  • Довідкові файли тримайте в папці чи Project — вони кешуються, і повторне звернення до них не витрачає ліміт заново.
  • Відкривайте новий чат під кожну нову тему, щоб не тягти зайву історію в кожен запит.
  • Кілька питань ставте одним повідомленням, а не серією окремих.
  • Просте питання — у звичайний Chat, не в Cowork: Cowork щоразу піднімає окрему сесію з віртуальною машиною, і це дорожче по квоті. Спочатку дослідіть питання в Chat, а тоді попросіть склади мені промпт для Cowork і лише після цього переходьте до роботи з файлами.

Anthropic не публікує жорстких цифр по промптах і токенах і час від часу їх змінює, тож орієнтуватися варто не на пам'ять про «скільки зазвичай вистачає», а на актуальний стан у Settings → Usage — особливо перед тим, як планувати задачі за розкладом, які помітно з'їдають квоту.

Читати в ТелеграміПрактика ШІ в бізнесі — щодня, без хайпу