1. La prima de precio de Mistral OCR 4 no se traduce en calidad. A $4/1000 (2× OCR 3, 4× naktor-extractor), OCR 4 empata en texto (0.090 vs 0.089), pierde 15 puntos de TEDS en tablas y dobla la distancia en fórmulas. Su fortaleza real es la latencia por página vía API (2.2s p50) y la fidelidad percibida por el segundo juez (83.6, la más alta) — para flujos interactivos de pocas páginas es un buen producto; para digitalización masiva su precio no se sostiene frente a la frontera on-prem.
2. El caso Unlimited-OCR: el hype no sobrevive al harness. El lanzamiento de Baidu presume de batir el estado del arte en OmniDocBench. En nuestra muestra dura, con su receta vLLM oficial, pierde o empata con naktor-extractor en texto, tablas y fórmulas, y solo gana con claridad en manuscrito (0.22 vs 0.34) — mérito real pero lejos de «mejor en todo». Su arquitectura (3B MoE, KV constante) sí lo hace barato de autohospedar ($0.74/1000).
3. Las métricas también mienten si no se auditan: un artefacto que casi publicamos. OCR 3 parecía mejor que OCR 4 en inglés (0.033 vs 0.073); el 93% de la brecha era UNA página —un índice de libro que OCR 4 renderizó como tabla y el GT anota como texto plano; la distancia de edición castiga el markup, no la lectura. Sin esa página, empate (0.034 vs 0.037). Lo publicamos porque un benchmark que no muestra sus falsos positivos no merece confianza.
4. El serving es parte del modelo. PaddleOCR-VL pasa de 0.197/TEDS 0.0 (VLM a pelo con prompt genérico) a 0.066/TEDS 84.7 (pipeline oficial con layout + prompts por elemento): el mismo checkpoint, 3× mejor texto y de inutilizable a segundo puesto en tablas. Los números de cualquier comparativa dependen de decisiones de serving que casi nunca se documentan.
5. La frontera calidad-precio es on-prem. Ningún API cloud domina a naktor-extractor en calidad-por-euro. Y hay un segundo eje que el precio no captura: gobernanza — todo lo enviado a Mistral sale de tu infraestructura, lo que para banca, sanidad o administración puede ser un descarte directo antes de mirar precio. naktor-extractor se despliega en tu infra, a $0.99/1000, con calidad de cabeza; y en documentos con capa de texto nativa (la mayoría reales) el coste baja mucho más — algo que este corpus, 100% escaneado, no ejercita.
6. (Post-benchmark) El benchmark nos auditó a nosotros. Al analizar página a página dónde perdíamos, la brecha entera de texto se concentraba en ~5 páginas cuyos títulos de tabla, pies de figura y sub-preguntas faltaban en nuestro markdown: se extraían bien, pero nuestro render los descartaba. Re-render A/B sin ruido (mismas salidas, solo cambia el render): texto 0.088 → 0.064 (chino −36%), orden de lectura 0.176 → 0.152. El mayor retorno de construir un benchmark reproducible fue poder auditar nuestro propio producto con él; el fix está commiteado con sus tests.