Иногда проблема OCR не в том, чтобы распознать текст, а в том, чтобы понять, где он вообще находится. Именно на таких случаях Mistral сосредоточилась при обновлении OCR 4 до версии 4.1.

Это не новая модель с другой архитектурой, а точечная доработка. Скорость работы, идентификатор в прайс-листе и эндпоинты остались прежними, зато модель лучше справляется со страницами, где одновременно много текста, изображений и подписей.

Главное изменение заметно в структуре документа. OCR 4.1 точнее разделяет колонки и отдаёт каждую из них как отдельную текстовую область, сохраняя исходное расположение элементов. Раньше при плотной вёрстке такие блоки было проще перепутать или объединить.

Лучше стала и работа с графикой. По данным Mistral, модель точнее определяет границы объектов, поэтому изображения реже накладываются друг на друга, а сложные технические диаграммы меньше теряют отдельные блоки. Сноски теперь также распознаются как самостоятельные элементы, а не превращаются в единый текстовый массив.

Обновление особенно пригодится там, где документы выглядят скорее как техническая схема, чем как обычная страница. При этом цена стандартного OCR для документов с рукописными заметками и выделениями составляет $4 за 1000 страниц.

Есть и приятная деталь для разработчиков: алиас mistral-ocr-latest автоматически переводит существующие интеграции на новую версию, поэтому менять настройки вручную не потребуется. Попробовать обновлённый OCR можно в Mistral Studio.

Для бизнеса это означает меньше ручной корректировки после распознавания сложных документов. А для разработчиков — редкий случай, когда качество обработки растёт без изменения скорости и существующих интеграций.