Mistral AI ha lanzado Leanstral 1.5, su modelo más avanzado para verificación formal en Lean 4, marcando un hito en la accesibilidad de las matemáticas formales y la verificación de código. A diferencia de los modelos de frontera típicos que persiguen benchmarks de chat, Leanstral 1.5 está especializado en una sola cosa: escribir y verificar pruebas matemáticas formales que el compilador Lean acepta sin objeciones.

🎯 Benchmarks que Importan: miniF2F Saturado, PutnamBench Dominado

Los números hablan por sí solos. Leanstral 1.5 alcanza 100% en miniF2F (validación y test), el benchmark cruzado de matemáticas formales que abarca desde problemas elementales hasta nivel IMO. En PutnamBench —672 problemas de la competencia matemática Putnam— resuelve 587 de 672, superando a Seed-Prover 1.5 por 7 problemas mientras opera a ~$4 por problema frente a los $300+ estimados de la competencia. En benchmarks de álgebra abstracta de nivel doctorado, logra 87% en FATE-H y 34% en FATE-X, nuevos récords open-source.

BenchmarkLeanstral 1.5Seed-Prover 1.5 (high)Aleph Prover
miniF2F (test)100%96.7%100%
PutnamBench (672 prob.)587580~620*
FATE-H (grad level)87%79%N/A
FATE-X (PhD level)34%28%N/A
Coste/problema Putnam$4$300+$54–68

*Aleph Prover opera bajo condiciones distintas (guía en lenguaje natural, coste superior).

🔬 Escalado en Tiempo de Prueba: Best-of-N + Refinamiento Iterativo

Leanstral 1.5 introduce una estrategia de inferencia en dos fases que explica su eficiencia: Best-of-N sampling (N=64) genera candidatos diversos, seguido de refinamiento iterativo guiado por verificación donde el compilador Lean actúa como oráculo de verdad. Cada iteración alimenta errores de tipo de vuelta al modelo, que corrige y re-verifica hasta que el código compila. Esto elimina la necesidad de supervisión humana costosa y permite escalar el cómputo en tiempo de prueba de forma predecible.

🔍 Impacto Real: 5 Bugs Reales Descubiertos en 57 Repos Open-Source

Más allá de benchmarks académicos, Mistral ejecutó Leanstral 1.5 sobre 57 repositorios Lean 4 reales (mathlib4, proyectos de investigación, librerías de verificación de software). El modelo descubrió 5 bugs genuinos nunca reportados — desde casos borde en inducción sobre tipos inductivos mutuos hasta precondiciones faltantes en lemas de álgebra lineal. Todos los bugs fueron confirmados por los mantenedores y parcheados upstream. Esto demuestra que la verificación formal asistida por IA ya no es teórica: encuentra defectos reales en código que humanos usan en producción.

📦 Disponibilidad Inmediata: Apache 2.0, API Gratis, Pesos Abiertos

Leanstral 1.5 se libera bajo licencia Apache 2.0 — libre para uso comercial, modificación y distribución. Disponible hoy en tres vías: API gratuita en Mistral Labs (labs.mistral.ai, sin límite de tasa en beta), pesos en Hugging Face (mistralai/Leanstral-1.5, 119B MoE cuantizado a 8-bit ~70GB), y demo interactiva en el blog de Mistral. Para equipos que necesiten auto-hosting, la arquitectura MoE con solo 6B parámetros activos por token permite inferencia en una sola A100 80GB o 2× H100 con vLLM, abriendo la puerta a verificación formal on-premise sin depender de APIs externas.

💡 Implicaciones Estratégicas: Verificación Formal Commoditizada

Leanstral 1.5 marca un punto de inflexión: la verificación formal rigurosa —históricamente dominio de laboratorios millonarios (DeepMind, Microsoft Research, AWS) con clusters dedicados y años de ingeniería de prompts— se democratiza a un modelo open-source que corre en hardware accesible y cuesta centavos por problema. Para industrias reguladas (aeroespacial, automotriz, fintech, cripto), esto reduce la barrera de entrada a pruebas formales de meses-hombre a horas-máquina. La pregunta ya no es \"¿podemos permitirnos verificación formal?\" sino \"¿por qué no la estamos usando ya?\".

Fuentes: Mistral AI Blog (2 Jul 2026) — \"Leanstral 1.5: Formal Verification at Scale\", Paper arXiv:2606.25041, Mistral Labs API Docs, Hugging Face Model Card, Entrevistas a investigadores de verificación formal (INRIA, CMU, ETH Zürich).