Спільнота тестує Kolibri: хвалять відкритість звіту, сперечаються про бенчмарки
Досвід спільноти — не наша перевірка
Один із коментаторів звернув увагу на технічний звіт Kolibri: за його словами, документ пояснює буквально все, аж до того, як саме формувався датасет, і це перший випадок, коли він бачить такий рівень відкритості. Інший учасник процитував заяву розробників про те, що модель тренували на даних для утримання від відповіді (abstention data) за протоколом Merlin-Arthur, щоб вона казала "не знаю", коли відповіді немає в контексті.
Один із учасників спробував модель на своєму обладнанні RTX Pro 6000 і помітив, що вона витрачає забагато токенів на надмірні роздуми навіть тоді, коли знаходить правильний підхід; водночас швидкість його влаштувала — близько 170 токенів за секунду у fp8 при 3B активних параметрах. Інший перевірив модель на практичному юридичному запитанні про те, що писати на сторінці контактів за німецьким законодавством, і отримав посилання на застарілий закон (Telemediengesetz) замість чинного DDG — хоча, за його спостереженням, модель знає про DDG, але не згадує його, якщо про це окремо не попросити.
Щодо порівнянь з іншими моделями думки розійшлися: один коментатор навів дані, що Qwen3.8 27B випереджає Kolibri за німецькомовним бенчмарком самого Kolibri — 79,9 проти 70,8. Інший зауважив, що в матеріалах немає порівняння з Qwen3.8 Flash, зіставною MoE-моделлю з невеликою кількістю активних параметрів, натомість Kolibri порівнюють зі значно старішою Qwen3-Next 80B-A3B.
У обговоренні підняли питання суверенності: один з учасників зазначив, що компанію планують об'єднати з Cohere, канадською компанією. Інший коментатор запитав, чи зможуть і далі називати модель суверенною, коли поглинання Cohere завершиться, адже вона буде на 90% у власності й на 100% працюватиме з Торонто. Окремо хтось зауважив, що модель підтримує лише німецьку та англійську мови, що на його думку виглядає обмежено порівняно з багатомовними датасетами фронтирних моделей.
«Це перший раз, коли я бачу такий рівень відкритості.»
«Модель витрачає забагато токенів на надмірні роздуми, навіть коли знаходить правильний підхід.»
Читати в ТелеграміПрактика ШІ в бізнесі — щодня, без хайпу«Qwen3.8 27B обходить Kolibri — 79,9 проти 70,8 — німецькою мовою, за методикою й бенчмарком самого Kolibri.»