Cohere Labs решила доказать, что мультимодальной модели не обязательно быть гигантской. Компания представила North Micro — VLM на 2,4 млрд параметров для документов, таблиц, графиков.

Главная особенность — работа с изображениями в оригинальном разрешении. Обычно картинку уменьшают, из-за чего теряются мелкий текст и границы таблиц. Здесь детали сохраняются, что полезно для OCR, но высокое разрешение увеличивает расход памяти и задержку.

Около 400 млн параметров приходятся на vision encoder на базе SigLIP 2 SO400M, ещё примерно 2 млрд — на North Micro LLM. В языковой части чередуются sliding-window и глобальное attention, локальное внимание использует RoPE. Признаки разных уровней энкодера поступают в ранние слои языка — подход DeepStack.

Cohere выпустила модель с открытыми весами под лицензией Apache 2.0. Модель предназначена для прототипирования и дообучения под OCR, visual question answering, анализ графиков и таблиц, visual grounding и извлечение структурированных данных. Поддерживаются несколько изображений и мультиязычный ввод.

Универсальной заменой крупным VLM она не станет: reasoning не является её задачей, а математика и программирование даются ограниченно. Зато по данным Cohere, модель получила 0,921 на DocVQA, 0,808 на ChartQA, 0,775 на AI2D и 0,732 на RefCOCO, тогда как на MMMU результаты слабее.

Cohere делает ставку на специализацию. Для бизнеса это может упростить локальную обработку документов и создание моделей под данные.