El 23 de junio, Mistral lanzó OCR 4, un modelo de inteligencia de documentos que se despliega en un contenedor dentro de tu propia infraestructura. El documento no sale de tu red. Acepta PDF, DOC, PPT y OpenDocument. Soporta 170 idiomas en 10 familias lingüísticas, incluyendo idiomas especializados y de bajo recurso.

Lo que lo diferencia de servicios como AWS Textract o Azure Document Intelligence: cada bloque de texto extraído lleva una clasificación de tipo —título, tabla, firma, ecuación, código— y un score de confianza a nivel de página y de palabra. Los bloques con confianza baja van a revisión humana. Los de confianza alta se procesan automáticamente. Es un flujo human-in-the-loop por diseño, sin tener que programarlo.

El precio es de 4 dólares por 1.000 páginas vía API, con descuento del 50% a través de la API batch (2 dólares). Disponible directamente en Mistral Studio, Amazon SageMaker y Microsoft Foundry. Soporte para Snowflake Parse Document próximamente.

El caso de uso más directo: empresas de servicios jurídicos, financieros o sanitarios que procesan contratos, facturas o historiales clínicos y están sujetas a obligaciones de residencia de datos. No pueden enviar documentos a APIs externas de jurisdicción estadounidense. OCR 4 resuelve eso en un contenedor interno sin integración compleja con el resto del stack.

Lo que el anuncio no menciona: el self-hosting requiere gestión del contenedor, actualizaciones de seguridad y capacidad de DevOps mínima. El coste real incluye infraestructura interna además del precio por página. Para una empresa sin equipo técnico propio, el modelo en cloud seguirá siendo más accesible, aunque no cumpla requisitos de soberanía de datos.