Проверять контент с помощью ИИ становится всё сложнее. Не потому, что моделей не хватает, а потому, что у каждой платформы свои правила. То, что допустимо в одном сервисе, может быть запрещено в другом. Обычно такие изменения требуют дообучения модели, а это занимает время и стоит недёшево. В Mistral решили попробовать другой подход.

Компания представила Shieldstral — мультимодальную модель с открытыми весами на 3 млрд параметров, созданную для проверки текста и изображений. Вместо заранее прописанных категорий модерации ей достаточно объяснить правила обычным человеческим языком. После этого модель оценивает, нарушает ли контент заданную политику, и показывает вероятность такого нарушения. Получается, менять критерии проверки можно буквально на ходу, без нового обучения.

Несмотря на сравнительно небольшой размер, в Mistral утверждают, что Shieldstral работает не хуже, а в некоторых задачах даже лучше специализированных открытых моделей, которые значительно крупнее. При этом ей хватает одной видеокарты NVIDIA с 16 ГБ памяти. Модель поддерживает текст, изображения и их сочетание, а распространяется по открытой лицензии Apache 2.0.

По данным разработчиков, Shieldstral уже показала хорошие результаты при модерации текста и изображений, проверке ответов ИИ и быстрой адаптации к новым требованиям безопасности. Если такой подход приживётся, компаниям станет проще менять правила модерации под свои задачи, не тратя время и ресурсы на постоянное переобучение моделей.