Comparativas de modelos · 2026-09-28
MiniMax M3.1 frente a M3: cuál usar y cuándo
Compara MiniMax M3.1 y M3 tal como se ofrecen en LLMTR: precio, contexto, límite de salida, tipos de entrada, razonamiento, llamada a herramientas y el cambio tras el periodo gratuito.
Respuesta corta: M3.1 es la nueva versión preliminar y M3 el modelo de producción
La documentación de la API de MiniMax muestra los dos modelos juntos: MiniMax-M3 y MiniMax-M3.1-Flash-Preview. Ambos tienen una ventana de contexto de 1.000.000 de tokens. La documentación describe M3.1 como un modelo de programación con profundidad de razonamiento ajustable, y MiniMax solo lo ofrece por ahora a través de Token Plan y MiniMax Code. M3 es el modelo con precio publicado en la API general de MiniMax.
En LLMTR, M3.1 es gratuito con el identificador minimax/minimax-m3.1-free hasta el 30 de septiembre de 2026 a las 23:59, hora de Turquía. M3 se factura por uso con el identificador minimax/minimax-m3. Este artículo compara lo que ofrecen hoy las dos fichas en LLMTR. No repite los resultados internos de MiniMax y no sustituye una prueba con tu propia tarea.
Comparación de las dos fichas de LLMTR
La diferencia principal es el precio y la duración. La ficha de M3.1 es gratuita durante un periodo corto de evaluación; M3 es permanente y de pago. La segunda diferencia es el límite de salida: la ficha de M3.1 devuelve como máximo 32.768 tokens por respuesta, mientras que el límite de M3 es mucho mayor. La tercera son los tipos de entrada: el vídeo solo se ofrece en la ficha de M3.
No repetimos aquí los precios porque pueden cambiar; consulta el valor actual en la página de precios y en la ficha del modelo. La ficha de M3 admite caché de prompts, lo que puede reducir bastante el coste en flujos que envían una y otra vez el mismo prefijo largo.
| Característica | M3.1 (gratis) | M3 |
|---|---|---|
| Identificador | minimax/minimax-m3.1-free | minimax/minimax-m3 |
| Precio | Gratis hasta el 30 de septiembre de 2026, 23:59 | De pago por uso |
| Ventana de contexto | 1.000.000 tokens | 1.000.000 tokens |
| Salida máxima por respuesta | 32.768 tokens | 524.288 tokens |
| Entrada | Texto, imágenes | Texto, imágenes, vídeo |
| Razonamiento | Activo en cada respuesta | Se puede desactivar |
| Caché de prompts | No disponible | Compatible |
| Modo JSON y salida con esquema | Funciona | No figura en su ficha |
El razonamiento es la diferencia más práctica
Según la documentación de MiniMax, M3.1 siempre razona y una petición para desactivarlo devuelve un error. En la ficha de LLMTR el razonamiento también está activo en cada respuesta y sus tokens cuentan para el límite de salida. Si usas un max_tokens bajo en M3.1, la respuesta puede cortarse antes de que termine el razonamiento. En M3 el razonamiento se puede desactivar; en clasificaciones simples o resúmenes cortos eso reduce la latencia y el consumo de tokens.
En revisión de código, depuración y llamadas a herramientas de varios pasos, el razonamiento suele ayudar. En trabajos cortos y repetitivos, un modelo que razona antes de cada respuesta puede gastar tokens innecesarios. Puedes ver qué comportamiento te conviene ejecutando la misma tarea en ambos modelos y comparando los valores de usage.
Prueba la misma tarea con herramientas en los dos modelos
Ambos modelos admiten llamada a herramientas. Envía primero el cuerpo siguiente con M3.1 y repítelo cambiando solo el campo model a minimax/minimax-m3. Comprueba que finish_reason sea tool_calls y que el campo arguments contenga JSON válido. Después devuelve el resultado de la herramienta con el rol tool y observa cómo construye el modelo la respuesta final.
Al comparar, no te fijes solo en la fluidez. Anota si se eligió la herramienta correcta, si los parámetros están completos y si el modelo llama a una herramienta cuando no hace falta. Ejecuta el mismo prompt varias veces; un único buen resultado no demuestra que el comportamiento sea constante.
Prueba de llamada a herramientas para POST /v1/chat/completions
{
"model": "minimax/minimax-m3.1-free",
"messages": [
{
"role": "user",
"content": "¿Qué tiempo hace en Ankara?"
}
],
"tools": [
{
"type": "function",
"function": {
"name": "get_weather",
"description": "Devuelve el tiempo actual de una ciudad",
"parameters": {
"type": "object",
"properties": {
"city": {
"type": "string"
}
},
"required": [
"city"
]
}
}
}
],
"tool_choice": "auto",
"max_tokens": 2000
}
Cuál elegir para cada trabajo
La ficha de M3.1 sirve para evaluar gratis la nueva versión, observar su comportamiento en un asistente de código o en un flujo de agentes y compararla con M3. Los modelos gratuitos tienen una cuota diaria y el proveedor puede registrar los prompts, así que no envíes datos confidenciales ni pongas tráfico de producción en esta ficha.
M3 es la opción adecuada para trabajos que deben funcionar sin interrupciones, entrada de vídeo, salidas muy largas y flujos repetitivos que aprovechan la caché de prompts. Como es de pago, fija un límite de gasto en tu clave de API y empieza con tareas pequeñas.
El cambio después del periodo gratuito
Desde el 1 de octubre de 2026, el identificador minimax/minimax-m3.1-free responde 410 model_retired y la respuesta sugiere minimax/minimax-m3. El cambio no es automático: ninguna solicitud llega al modelo de pago y no se cobra nada hasta que tú cambies el identificador. Tu aplicación no debe reintentar un 410 como si fuera un error pasajero.
Para facilitar el cambio, guarda el identificador del modelo en la configuración y no en el código. Ejecuta con M3 los prompts que preparaste para M3.1 usando un conjunto pequeño de ejemplos, y revisa max_tokens y el ajuste de razonamiento para M3. Como M3 es la versión anterior a M3.1, los resultados pueden no ser idénticos.
Frequently asked questions
¿MiniMax M3.1 sustituye a M3?
La documentación de MiniMax presenta M3.1 como versión preliminar y sigue incluyendo M3. En LLMTR, M3.1 es gratuito hasta el 30 de septiembre de 2026 y M3 sigue disponible como modelo de pago.
¿Puedo desactivar el razonamiento en M3.1?
No. M3.1 razona antes de cada respuesta. Usa M3 para trabajos en los que el razonamiento deba estar desactivado.
¿Los dos modelos tienen la misma ventana de contexto?
Sí, ambos tienen 1.000.000 de tokens. La diferencia está en la salida máxima por respuesta: 32.768 tokens en la ficha de M3.1 y 524.288 en M3.