AI Digest · Листопад: Warner Music уклав угоду з Suno, GPT став «людяним», а Карпати навчив нейромережі дебатувати
Листопад вже завершився, а це значить, що настав час щомісячних АІ-апдейтів! Коротко про головне: Warner Music укладав угоду з Suno, OpenAI зробила ChatGPT більш «людяним», а імениті розробники показали, що майбутнє за колективним розумом нейромереж.
В цьому випуску про 7 найцікавіших оновлень індустрії: які ідеї стоять за цими оновленнями, і що вони можуть означати для бізнесу в найближчі місяці.
1. Suno + Warner Music: угода, що принесла більше обмежень
Warner Music Group врегулювала позов проти Suno і уклала партнерство. Вперше один із «великої трійки» музичних лейблів офіційно працює з AI-генератором музики. Влітку вони називали це «масштабною крадіжкою», восени – потиснули руки.
Які ж умови цієї угоди?
-
1
Suno отримує легальний доступ до каталогу Warner для навчання своєї моделі
-
2
Користувачі зможуть генерувати треки з голосами артистів Warner (якщо артисти погодяться)
-
3
Старі моделі Suno поступово зникнуть
-
4
Завантажувати треки зможуть тільки на платній основі, і то з обмеженнями
-
5
Warner також прихопила у Suno платформу для пошуку концертів Songkick
З одного боку, легітимація AI в музиці. З іншого – жорсткі обмеження на завантаження згенерованої з АІ музики, щоб Spotify не потонув в AI-творчості. Стратегія зрозуміла: якщо музику може генерувати кожен школяр, справжньою цінністю стають живі виступи і прямий зв'язок з артистами.
Однак голова Music Artists Coalition, Ірвінг Азофф, висловив не надто позитивний відгук: «Всі говорять про «партнерство», а артисти отримують крихти». Фінансові деталі закриті, тому незрозуміло, скільки коштів реально перейде на рахунок музикантам.
При цьому Suno щойно закрила раунд перемовин на $250 мільйонів з оцінкою $2,45 мільярда. Інвестори голосують грошима, тож майбутнє музики точно включає AI.
2. LLM Council або як Карпати навчив моделі влаштовувати дебати
Андрій Карпати запустив LLM Council – систему, де GPT-5.1, Gemini 3.0 Pro, Claude Sonnet 4.5 і Grok 4 відповідають на одне питання, потім анонімно оцінюють відповіді один одного, і один з них формує фінальну, найякіснішу відповідь.
Як це працює на практиці:
Раунд 1: Всі відповідають незалежно. Питання надсилається до всіх чотирьох моделей одночасно. Кожна думає своєю головою.
Раунд 2: Анонімна критика. Моделі отримують відповіді конкурентів без імен і оцінюють їх чесно. Карпати помітив наступне: моделі «дивно готові визнати, що інша LLM відповіла краще».
Раунд 3: Кращий з кращих. Gemini 3 Pro (зазвичай він «голова») дивиться на всі відповіді та оцінки, синтезує єдиний якісний результат.
У сліпому режимі, де вони не знають, де чия відповідь, GPT-5.1 стабільно отримувала найвищі оцінки, а ось Claude вважали аутсайдером в дебатах.
Сам Карпати не згоден: для нього GPT-5.1 «занадто багатослівна», а Gemini видає «стислу і оброблену» відповідь. Ба більше, цей проєкт він називає «vibe-кодинг на 99%» – прототип, який він накидав за допомогою AI за кілька вечорів.
Тепер замість того, щоб “намертво” прив'язатися до однієї моделі і працювати з її косяками, ви поєднуєте кілька і берете найкраще від кожної. Для критичних завдань, таких як юридичний аналіз, медичні консультації, стратегічне планування – це може бути досить корисно.
Підписуйтеся на наші соцмережі
3. GPT-5.1 – OpenAI визнала помилку і виправила її за два місяці
Вересневий реліз отримав хейт. Користувачі скаржилися: модель зовсім «беземоційна». OpenAI тоді видалила доступ до старих моделей без попередження. Через два місяці компанія випустила GPT-5.1, і цього разу вони прислухалися до аудиторії.
Найпопулярніша модель ChatGPT стала «теплішою за замовчуванням і балакучішою». Головним трюком є адаптивне мислення: якщо питання складне, модель вмикає режим «мислення», якщо просте – відповідає миттєво.
Просунута версія з глибоким мисленням тепер динамічно варіює час роздумів: прості завдання – удвічі швидше, складні – удвічі довше. Відповіді стали зрозумілішими, менше жаргону і води. Також, тут доступні пресети: Default, Friendly, Efficient, Professional, Candid, Quirky (плюс Cynical і Nerdy).
Для розробників є не менш чудові новини:
- Кешування промптів до 24 годин.
- Нові інструменти: apply_patch для редагування коду і shell для команд.
- Режим «без мислення» для сценаріїв, де латентність є критичною.
- Покращена робота з паралельними викликами інструментів.
GPT-5.1 вирішує головну проблему використання AI – баланс між розумом і прийнятністю в спілкуванні. CEO Applications OpenAI Фіджі Сімо сказала прямо: «Суть – поєднувати IQ з EQ». Для клієнтського сервісу, внутрішніх помічників, автоматизації – це одне з головних завдань, яке вже (на щастя) вирішено.
4. FLUX 2 – генератор зображень, з яким картинки виглядають набагато якісніше
Нарешті ми дочекалися цього релізу від творців Stable Diffusion.
Раніше всі генератори зображень страждали від однієї проблеми: текст на картинках виходив кривим, нечитабельним, з помилками. FLUX 2 це виправив, тож маркетологи та дизайнери можуть радіти.
Фотореалізм на рівні. До 4 мегапікселів без того самого «AI-вигляду», який видає зображення від штучного інтелекту навіть не приглядаючись. Модель розуміє реальне освітлення і фізику, так що результат не відрізниш від фото.
Всього доступно до 10 референсів. Завантажуєш до 10 зображень-прикладів, і модель зберігає стиль, персонажів, продукти однаковими у всій серії. Найкращий показник на ринку. Для брендованого контенту — це справжня знахідка.
Модель доступна в 4 версіях:
- FLUX 2 Pro,
- FLUX 2 Flex,
- FLUX 2 Dev,
- FLUX 2 Klein.
Mistral AI вже впровадила цю новинку в Le Chat, Adobe готується вбудувати її для Photoshop, а NVIDIA включила в базові моделі Blackwell.
Наразі E-commerce може генерувати картки товарів серіями, маркетинг – банери та креативи під різні сегменти, а дизайн-студії – швидкі ітерації для клієнтів. І все це з читабельним текстом та консистентним стилем.
5. Grok 4.1 – xAI навчила модель не брехати і співчувати
Цього місяця емоції нас не полишають… Через два місяці після Grok 4 Fast, xAI Ілона Маска випустила Grok 4.1. І це не просто патч – повноцінний апгрейд з фокусом на три речі: швидкість, точність, людяність.
Галюцинації впали втричі, з 12,09% до 4,22%. FActScore з 9,89% до 2,97%. На тлі того, що всі топові моделі не завжди надають правдиву інформацію – це справжній прорив.
Grok 4.1 Thinking посів перше місце в LMArena Text Arena з 1483 Elo – відрив у 31 пункт від найближчого конкурента. Grok 4.1 без мислення – друге місце з 1465 Elo, обганяючи всі інші моделі навіть з їх режимом мислення.
xAI протестувала Grok 4.1 на EQ-Bench3 – тест на емпатію, проникливість, міжособистісні навички через 45 складних сценаріїв. На питання про втрату вихованця Grok 4.1 відповідає не формально: «Мені дуже шкода, що ти через це проходиш. Втрата вихованця може відчуватися як втрата частини твого серця, і цей біль абсолютно реальний. [...] Боляче тому, що любов була (і залишається) настільки великою».
Технічні зміни суттєві:
- Контекст до 256K токенів, до 2M у Fast-режимі
- Латентність знижена на 28%
- Паралельне виконання інструментів
- Покращена робота з зображеннями та відео
6. Енергетичний голод дата-центрів: AI росте швидше, ніж інфраструктура встигає за ним
Поки ми обговорюємо, наскільки “розумнішими” стають гаджети, у тіні розгортається менш глянцева, але дуже показова історія. Data-центри, які живлять усі ці AI-моделі, починають поглинати світову енергію темпами, з якими людство не стика́лося з часів появи інтернету. За новими прогнозами аналітиків, до 2035 року глобальне споживання електрики дата-центрами може підскочити майже утричі. Якщо зараз вони “тягнуть” близько 35 ГВт, то вже за 10 років цифра може сягнути 106 ГВт. І так, це рівень невеликої країни.
Поки уряди сваряться щодо зелених квот, технологічні компанії спокійно нарощують обчислювальну міць. Чому? Тому що майбутнє AI-інтерфейсів – це не просто “розумний” телефон чи навушники, які розуміють контекст. Це екосистема, де кожна взаємодія з пристроєм, від голосових команд до мультимодальних сценаріїв, проходить через моделі, що працюють 24/7.
І чим більше АІ вчиться “розуміти тебе”, тим більше мегават він хоче з’їсти.
7. Nvidia показала VLM-модель для автономного водіння
В той час, як одні моделі змагаються в балакучості, Nvidia мовчки зробила крок, що може перезапустити всю індустрію автономного водіння. Компанія показала свою нову VLM-модель Alpamayo-R1 – це система, яка поєднує бачення та мовні патерни так, щоб машина могла не просто розпізнати світлофор чи велосипедиста, а зрозуміти, чому той велосипедист поводиться саме так і що може статися далі.
Модель працює як своєрідний “внутрішній коментатор”: дивиться на сцену, аналізує її та формує покрокові рішення. Тобто, замість того щоб реагувати лише на факти (“переді мною людина”), автомобіль отримує можливість міркувати (“ця людина коливається на краю тротуару, є ризик, що вона вийде на дорогу”).
Alpamayo-R1 – це прототип того, в якому напрямку рухається весь ринок: від простої комп’ютерної зорової системи до “мислячого” інтерфейсу між машиною та реальністю. І так, це той самий місток, який згодом з’явиться і в домашніх роботах, і в AR-окулярах, і в наших персональних AI-помічниках.
Що ж буде далі?
Листопад показав зрілість АІ-індустрії. Музичні лейбли вчаться співпрацювати з технологіями, розробники створюють колективний інтелект моделей, а генеративні системи стають більш людяними. В майбутньому на нас очікує досить цікавий напрямок – гуманізація АІ: емпатія, персоналізація та чесність. Ну а поки насолоджуємося новими відкриттями і використовуємо їх потенціал на максимум!
Грудень обіцяє бути не менш багатим на технологічні новинки. Тож стежте за моїми свіжими оновленнями і не забудьте підписатися, адже попереду ще багато новин!