Mistral випустила ШІ-модель Large 4: у чому вона обходить Claude й GPT-6
Mistral випустила публічну версію Large 4 — модель на 1 трлн параметрів, яка вже обходить закриті системи Claude Opus 5.5 і GPT-6 Astra у тестах з пошуку вразливостей, повідомляє Mistral.
Що вміє Mistral Large 4
- Mistral Large 4, яку всередині команди називають Le Chonk, — найбільша модель штучного інтелекту компанії: 1 трлн параметрів загалом і 49 млрд активних, що задіюються одночасно при обробці запиту. Архітектура залишається mixture-of-experts, тому реальне споживання обчислень нижче, ніж здається.
- На Artificial Analysis Cyber Index, незалежному тесті здатності ШІ-моделей знаходити і закривати вразливості в реальному коді, ML4 потрапила у топ-5 систем світу і випередила всі відкриті моделі, створені поза Китаєм, за даними компанії.
- В одному із завдань індексу, де потрібно відтворити реальну вразливість у відкритому софті й одразу її виправити, модель набрала 82%, це найвищий результат серед усіх протестованих систем.
- Для порівняння, Claude Opus 5.5 і GPT-6 Astra на цьому ж тесті показали результат, близький до нуля: моделі відмовляються виконувати завдання, яке виглядає як створення експлойта, навіть якщо мета — захист софту.
- ML4 також вирішила 93% завдань Cybench, набору з 40 вправ зі змагань з кібербезпеки, і в тестах показала здатність аналізувати шкідливий код та пріоритизувати вразливості поза межами того, для чого її безпосередньо тренували.
Підписуйтеся на наші соцмережі
Де і як навчали Mistral Large 4
Модель навчали з нуля на інфраструктурі, яку компанія контролює повністю. ML4 тренували на 3800 графічних процесорах Nvidia Grace Blackwell у власних датацентрах Mistral у Європі.
Прев'ю-версія працює на тій самій інфраструктурі, без залучення сторонніх хмарних провайдерів. Європейське розгортання функціонуватиме під юрисдикцією ЄС, незалежно від інших постачальників цифрових сервісів.
Тренувальні дані охоплювали понад 160 мов, включно з усіма офіційними мовами Євросоюзу.
У агентному кодингу ML4 набрала 61,7% на DeepSWE v1.1 та 59,4% на SWE-Atlas-QnA, випередивши DeepSeek V4 Pro 0813 і Qwen3.8 Max за сукупним Coding Agent Index (49,8%), за даними Mistral.
На AutomationBench, наборі з 657 бізнес-сценаріїв у Gmail, Google Sheets, Slack і Salesforce, модель показала 59,9%, обійшовши Kimi K3 і MiMo-V2.6-Pro.
У сліпому оцінюванні якості коду, проведеному разом із Surge AI, де професійні анотатори оцінювали відповіді без розкриття назв моделей, ML4 посіла друге місце серед п'яти систем із середньою оцінкою 3,74 бала з 5, поступившись лише Claude Opus 5 (4,22).
Для чого українцям Mistral Large 4
- Mistral Large 4 дає українським компаніям можливість розгортати модель на власних серверах без залежності від американських хмарних провайдерів.
- Для українських служб кібербезпеки та державного сектора це доступ до інструменту, здатного аналізувати шкідливий код і пріоритизувати кібервразливості без обмежень, які закладають у комерційні API закриті постачальники на кшталт Anthropic чи OpenAI.
- Mistral заявляє, що до публічного релізу модель проходить red-teaming разом із фахівцями з кібербезпеки, перевіреними партнерами та представниками державних органів, яким надають доступ до версії зі зниженою модерацією і розширеними кібер-можливостями, за даними компанії.