ШІ-тексти оцінюють вище — поки знають автора
У трьох експериментах із понад 2 500 учасниками читачі не змогли надійно відрізнити короткі оповідання ChatGPT від людських. У першому тесті 1 682 людини читали один із шести текстів приблизно на 1 000 слів: три з літературних журналів і збірок, три — згенеровані ChatGPT 4.0 за темою, стилем і перспективою оригіналів.
AI-оповідання отримали вищі середні оцінки за якість — 1,54 проти 0,97, і за занурення — 1,42 проти 1,00 на шкалі від -3 до +3. Але коли учасникам казали, що автор — ChatGPT, оцінки залежали від ставлення до ШІ: прихильники піднімали бали, скептики знижували.
Як був побудований тест
У першому експерименті учасникам не просто показали тексти й попросили вгадати автора. Дослідниці Сідні Сірс і Діна Скольнік Вайсберг також керували очікуваннями читачів: половині казали, що оповідання написала людина, іншій половині — що його створив ChatGPT. Але ця інформація була правильною лише для половини людей у кожній групі.
Це важлива деталь: дослідження перевіряло не тільки якість розпізнавання, а й те, як ярлик автора змінює оцінку тексту. Саме тому результат не зводиться до питання, чи може читач упізнати ШІ. Він показує, що саме знання або припущення про автора впливає на сприйняття якості.
- дослідження опубліковане в журналі Judgment and Decision Making;
- у першому експерименті було шість оповідань приблизно по 1 000 слів;
- три тексти взяли з відомих літературних журналів і збірок;
- три тексти згенерували в
ChatGPT 4.0за темою, стилем і перспективою людських оригіналів.
Що сталося в двох наступних експериментах
У двох додаткових експериментах завдання зробили жорсткішим. Учасникам уже не давали один текст із підказкою про автора. Кожна людина читала пару: одне людське оповідання й одне згенероване ШІ, після чого мала визначити, яке з них яке.
Навіть у такому прямому порівнянні учасники не впоралися краще, ніж випадкове вгадування. Загалом у цих двох експериментах було 905 учасників. Це підсилює головний висновок джерела: проблема не лише в окремому форматі першого тесту, а в ширшій складності розрізнення короткої художньої прози людини й ChatGPT.
Водночас дослідниці зафіксували різницю між типами досвіду. Самооцінений досвід роботи із системами ШІ позитивно корелював зі здатністю правильно визначити походження тексту. А от самооцінений досвід читання художньої літератури не допомагав відрізняти людські й згенеровані оповідання.
Чому вищі оцінки не дорівнюють кращій літературі
Автори дослідження окремо застерігають: вищі оцінки не обов’язково означають, що ШІ написав кращу літературу. За їхнім поясненням, згенеровані тексти часто є гладшими, легшими для читання й емоційно позитивнішими. Такі властивості можуть підвищувати оцінки, бо людям зазвичай більше подобається матеріал, який простіше обробити.
Натомість якісна літературна проза може бути навмисно складною, вимагати від читача роботи зі змістом і не завжди давати швидке відчуття занурення. Тому якість і залученість у цьому дослідженні не варто читати як одне й те саме. Оповідання може бути сильним, але не дуже легким для сприйняття; і навпаки — дуже зручним для читання, але не обов’язково кращим у літературному сенсі.
Формат короткого оповідання також, за джерелом, імовірно працює на користь ШІ. Зв’язно розповісти історію на 1 000 слів — інше завдання, ніж утримувати сюжет, стиль і розвиток персонажів на сотнях сторінок.
Що це означає для бізнесу і що ще невідомо
Практичний висновок для бізнес-аудиторії обмежений, але важливий: читачі можуть оцінювати текст не лише за змістом, а й за уявленням про автора. Якщо людина вважає, що текст написав ШІ, її ставлення до технології може вплинути на оцінку незалежно від реального походження матеріалу. Для комунікацій, HR, юридичних і фінансових текстів це радше сигнал про ризик сприйняття, а не готова інструкція з використання генеративного ШІ.
У джерелі також згадується попередня робота про ШІ-вірші та дослідження Stony Brook University і Columbia Law School за жовтень минулого року. Там професійні читачі віддавали перевагу людським текстам за простих промптів, але коли моделі спеціально тренували на стилях окремих авторів, експерти частіше обирали ШІ-тексти: у вісім разів частіше для імітації стилю і вдвічі частіше для якості письма.
- усі дані й матеріали дослідження доступні безкоштовно на Open Science Framework;
- джерело не дає вартості, умов комерційного доступу чи інструкцій для впровадження;
- невідомо, чи такі самі результати будуть для довгих книжок, ділових документів або спеціалізованих професійних текстів;
- невідомо, як зміниться оцінка, якщо читачі знатимуть не лише автора, а й спосіб створення або редагування тексту.