· Por Poul Lorca
CPS · octubre 2026
6 modelos evaluados · Costos: suma por tarea
Veredicto del mes
Para responder correos de clientes, contestar consultas sobre políticas y tarifas, y pasar facturas a datos, GPT-6 Luna (medium) es la opción más barata que cumple: unos USD 0.0010 por solución, cerca de USD 1 cada 1.000. Para armar el reporte mensual de ventas conviene DeepSeek V4.1 Flash (high), que resolvió los 10 casos a USD 0.0047 por solución. Gemma 4 31B no sirve para ese reporte: falló los 10 casos por totales mal sumados. Qwen3.8 27B, Muse Spark 1.3 y Grok 4.6 aciertan casi todo, pero cuestan entre 3 y 25 veces más sin una diferencia real de calidad. El rango del mes va de USD 0.0010 a USD 0.0248 por solución.
Más cerca del centro = más barato por solución · escala logarítmica
Resultados
| Modelo | Aciertos | %OK | Completadas | Costo total (USD) | CPS (USD) | Tiempo por tarea (s) |
|---|---|---|---|---|---|---|
| GPT-6 Luna (medium) | 36/40 | 90 % | 40/40 | 0.0350 | 0.0010 | 2.4 |
| Gemma 4 31B | 28/40 | 70 % | 40/40 | 0.0341 | 0.0012 | 5.0 |
| DeepSeek V4.1 Flash (high) | 38/40 | 95 % | 40/40 | 0.1552 | 0.0041 | 4.3 |
| Qwen3.8 27B (medium) | 40/40 | 100 % | 40/40 | 0.4532 | 0.0113 | 44.5 |
| Muse Spark 1.3 (medium) | 40/40 | 100 % | 40/40 | 0.5427 | 0.0136 | 7.0 |
| Grok 4.6 (medium) | 39/40 | 97.5 % | 40/40 | 0.9667 | 0.0248 | 22.3 |
Costo por solución en cada flujo
| Modelo | F1 %OK | F1 CPS | F2 %OK | F2 CPS | F3 %OK | F3 CPS | F4 %OK | F4 CPS |
|---|---|---|---|---|---|---|---|---|
| GPT-6 Luna (medium) | 100 % | 0.0009 | 100 % | 0.0008 | 70 % | 0.0014 | 90 % | 0.0010 |
| Gemma 4 31B | 90 % | 0.0009 | 100 % | 0.0008 | 0 % | sin aciertos | 90 % | 0.0010 |
| DeepSeek V4.1 Flash (high) | 90 % | 0.0047 | 90 % | 0.0031 | 100 % | 0.0047 | 100 % | 0.0037 |
| Qwen3.8 27B (medium) | 100 % | 0.0129 | 100 % | 0.0076 | 100 % | 0.0153 | 100 % | 0.0096 |
| Muse Spark 1.3 (medium) | 100 % | 0.0128 | 100 % | 0.0118 | 100 % | 0.0165 | 100 % | 0.0132 |
| Grok 4.6 (medium) | 100 % | 0.0229 | 90 % | 0.0235 | 100 % | 0.0304 | 100 % | 0.0222 |
Recomendación por modelo
GPT-6 Luna (medium) · CPS USD 0.0010
- Úsalo para: responder correos de clientes, consultas sobre políticas y tarifas, y pasar facturas a datos. Es el más barato del mes en esas tareas (menos de USD 1 cada 1.000 soluciones) y el más rápido, con 2.4 s por tarea.
- Con supervisión: el reporte mensual de ventas. Revisa los totales netos y que no queden dentro filas de fuera del mes.
Gemma 4 31B · CPS USD 0.0012
- Úsalo para: correos, consultas y facturas, con un costo prácticamente igual al de GPT-6 Luna. Entre ambos, GPT-6 Luna sale apenas más barato.
- No lo uses para: el reporte mensual de ventas. Sumó mal los totales en los 10 casos, incluidos los sencillos.
DeepSeek V4.1 Flash (high) · CPS USD 0.0041
- Úsalo para: las cuatro tareas, y en particular el reporte mensual de ventas, donde es la opción utilizable más barata (USD 0.0047 por solución, unos USD 4.70 cada 1.000). Para correos, consultas y facturas cumple igual, pero cuesta de 4 a 5 veces más que GPT-6 Luna.
Qwen3.8 27B (medium) · CPS USD 0.0113
- Úsalo para: las cuatro tareas, sin fallos en el mes. Frente a DeepSeek V4.1 Flash cuesta casi 3 veces más por solución y tarda unos 45 s por tarea, así que solo se justifica si ya lo tienes en uso.
Muse Spark 1.3 (medium) · CPS USD 0.0136
- Úsalo para: las cuatro tareas, sin fallos en el mes y con respuestas rápidas (7 s). Su costo por solución es más de 3 veces el de DeepSeek V4.1 Flash sin una diferencia de calidad medible.
Grok 4.6 (medium) · CPS USD 0.0248
- Úsalo para: las cuatro tareas; su único fallo se debió a un caso ambiguo. Es el más caro del mes, unas 6 veces DeepSeek V4.1 Flash y 25 veces GPT-6 Luna por solución.
Fallos que vale la pena conocer
- Gemma 4 31B, responder correos de clientes (error del juez): pidió reenviar la planilla que no venía adjunta, que era una de las dos salidas válidas, y el juez la castigó por no ofrecer también la otra.
- DeepSeek V4.1 Flash (high), responder consultas sobre tarifas (error del juez): declaró bien que el servicio pedido está suspendido y, a modo de referencia, mencionó la tarifa de otra ciudad donde sí se presta; el juez lo leyó como si cotizara el servicio suspendido.
- Grok 4.6 (medium), responder consultas sobre tarifas (defecto del caso): la consulta nombra la ciudad del cliente pero no dice explícitamente el destino del envío; el modelo lo interpretó como origen y se negó a cotizar sin destino, una lectura razonable.
- GPT-6 Luna (medium) y Gemma 4 31B, pasar facturas a datos (error del modelo): ambos transcribieron bien una factura cuyas líneas no suman el subtotal impreso, pero no lo detectaron ni pidieron revisión. Es el tipo de fallo silencioso que termina en un pago indebido.
Notas de la corrida
Tres fallos no son del modelo: dos errores del juez (Gemma 4 31B en correos y DeepSeek V4.1 Flash en consultas) y un defecto del caso (Grok 4.6 en consultas). Hay además un cuarto fallo dudoso, de DeepSeek V4.1 Flash en correos: agregó al flete de un camión completo el cargo por retiro en la dirección del cliente, algo que el caso admite leer así porque el envío sale de la planta del cliente. Las cifras se publican sin corregir. Si se descontaran, Gemma 4 31B quedaría en 100 % en correos, y DeepSeek V4.1 Flash y Grok 4.6 en 40 de 40; ningún veredicto por tarea cambia. Los casos afectados se revisarán para la próxima versión del dataset.
Método
40 casos administrativos en español (correos, consultas sobre documentación interna, reportes mensuales y extracción de documentos) sobre una empresa ficticia, 10 por flujo. Un juez califica cada respuesta con una rúbrica de todo o nada.
CPS = costo de API de todas las tareas / tareas resueltas. Ejecutado en Optima (Artificial Analysis), con una repetición por caso. Con 10 casos por flujo.