AI ФАКТОР

ШІ-тексти оцінюють вище — поки знають автора

Новина 09.08.2026
ШІ-тексти оцінюють вище — поки знають автора

У трьох експериментах із понад 2 500 учасниками читачі не змогли надійно відрізнити короткі оповідання ChatGPT від людських. У першому тесті 1 682 людини читали один із шести текстів приблизно на 1 000 слів: три з літературних журналів і збірок, три — згенеровані ChatGPT 4.0 за темою, стилем і перспективою оригіналів.

AI-оповідання отримали вищі середні оцінки за якість — 1,54 проти 0,97, і за занурення — 1,42 проти 1,00 на шкалі від -3 до +3. Але коли учасникам казали, що автор — ChatGPT, оцінки залежали від ставлення до ШІ: прихильники піднімали бали, скептики знижували.

Як був побудований тест

У першому експерименті учасникам не просто показали тексти й попросили вгадати автора. Дослідниці Сідні Сірс і Діна Скольнік Вайсберг також керували очікуваннями читачів: половині казали, що оповідання написала людина, іншій половині — що його створив ChatGPT. Але ця інформація була правильною лише для половини людей у кожній групі.

Це важлива деталь: дослідження перевіряло не тільки якість розпізнавання, а й те, як ярлик автора змінює оцінку тексту. Саме тому результат не зводиться до питання, чи може читач упізнати ШІ. Він показує, що саме знання або припущення про автора впливає на сприйняття якості.

  • дослідження опубліковане в журналі Judgment and Decision Making;
  • у першому експерименті було шість оповідань приблизно по 1 000 слів;
  • три тексти взяли з відомих літературних журналів і збірок;
  • три тексти згенерували в ChatGPT 4.0 за темою, стилем і перспективою людських оригіналів.

Що сталося в двох наступних експериментах

У двох додаткових експериментах завдання зробили жорсткішим. Учасникам уже не давали один текст із підказкою про автора. Кожна людина читала пару: одне людське оповідання й одне згенероване ШІ, після чого мала визначити, яке з них яке.

Навіть у такому прямому порівнянні учасники не впоралися краще, ніж випадкове вгадування. Загалом у цих двох експериментах було 905 учасників. Це підсилює головний висновок джерела: проблема не лише в окремому форматі першого тесту, а в ширшій складності розрізнення короткої художньої прози людини й ChatGPT.

Водночас дослідниці зафіксували різницю між типами досвіду. Самооцінений досвід роботи із системами ШІ позитивно корелював зі здатністю правильно визначити походження тексту. А от самооцінений досвід читання художньої літератури не допомагав відрізняти людські й згенеровані оповідання.

Чому вищі оцінки не дорівнюють кращій літературі

Автори дослідження окремо застерігають: вищі оцінки не обов’язково означають, що ШІ написав кращу літературу. За їхнім поясненням, згенеровані тексти часто є гладшими, легшими для читання й емоційно позитивнішими. Такі властивості можуть підвищувати оцінки, бо людям зазвичай більше подобається матеріал, який простіше обробити.

Натомість якісна літературна проза може бути навмисно складною, вимагати від читача роботи зі змістом і не завжди давати швидке відчуття занурення. Тому якість і залученість у цьому дослідженні не варто читати як одне й те саме. Оповідання може бути сильним, але не дуже легким для сприйняття; і навпаки — дуже зручним для читання, але не обов’язково кращим у літературному сенсі.

Формат короткого оповідання також, за джерелом, імовірно працює на користь ШІ. Зв’язно розповісти історію на 1 000 слів — інше завдання, ніж утримувати сюжет, стиль і розвиток персонажів на сотнях сторінок.

Що це означає для бізнесу і що ще невідомо

Практичний висновок для бізнес-аудиторії обмежений, але важливий: читачі можуть оцінювати текст не лише за змістом, а й за уявленням про автора. Якщо людина вважає, що текст написав ШІ, її ставлення до технології може вплинути на оцінку незалежно від реального походження матеріалу. Для комунікацій, HR, юридичних і фінансових текстів це радше сигнал про ризик сприйняття, а не готова інструкція з використання генеративного ШІ.

У джерелі також згадується попередня робота про ШІ-вірші та дослідження Stony Brook University і Columbia Law School за жовтень минулого року. Там професійні читачі віддавали перевагу людським текстам за простих промптів, але коли моделі спеціально тренували на стилях окремих авторів, експерти частіше обирали ШІ-тексти: у вісім разів частіше для імітації стилю і вдвічі частіше для якості письма.

  • усі дані й матеріали дослідження доступні безкоштовно на Open Science Framework;
  • джерело не дає вартості, умов комерційного доступу чи інструкцій для впровадження;
  • невідомо, чи такі самі результати будуть для довгих книжок, ділових документів або спеціалізованих професійних текстів;
  • невідомо, як зміниться оцінка, якщо читачі знатимуть не лише автора, а й спосіб створення або редагування тексту.
Джерело · Деталі · #новини