Playbook / 070

Compara dos modelos en un cuarto de hora

originalpara: tuttiduración: 15 minnecesita: Un assistente AI con accesso a due modelli · tre o quattro casi di prova rappresentativi del tuo compito · un foglio di calcolo o un editor di testo per registrare i risultati
CUÁNDO USARLO

Quando devi scegliere quale modello usare per un compito reale e i benchmark generici non ti bastano.

Cuándo usarlo

Los benchmarks públicos te dicen cómo se comporta un modelo en pruebas académicas. Pero tú trabajas con emails reales, transcripciones de tu sector, reportes con un formato específico. Usas este playbook cuando necesitas elegir qué modelo mantener en producción para una tarea específica: responder a clientes, resumir llamadas, extraer datos de facturas. Lo haces con tus casos, no con los de otros.

La señal concreta: identificaste dos o tres modelos candidatos (quizás uno más económico, uno más potente, uno local) y quieres saber cuál funciona mejor con tu material antes de invertir tiempo o dinero.

Qué necesitas

  • Un asistente IA con acceso a dos o más modelos. ChatGPT Plus, Claude Pro, o un entorno como OpenRouter donde llamas modelos diferentes con la misma API.
  • De tres a cinco casos de prueba representativos. Deben cubrir situaciones típicas de tu tarea: un caso fácil, uno medio, uno difícil o ambiguo. Si trabajas con emails de clientes, toma tres emails reales (anonimizados). Si resumes llamadas, tres transcripciones breves.
  • Una cuadrícula para registrar resultados. Una hoja de cálculo con una fila por caso y una columna por modelo, o un documento de texto con encabezados claros.
  • Los criterios de evaluación escritos de antemano. Dos o tres cosas concretas que el output debe hacer: «debe citar el número de pedido», «no debe inventar información que no está presente», «debe tener menos de 150 palabras». Los usas para evaluar cada respuesta de forma coherente.

Los pasos

1. Prepara los casos de prueba y los criterios.

Elige tres casos reales que usas cada semana. Para cada uno, escribe el input exacto (el email, la transcripción, el CSV) y los criterios de evaluación que aplicarás a cada modelo. Los criterios deben ser objetivos: «la respuesta contiene el nombre del producto», «el resumen tiene menos de 200 palabras», «sin datos inventados».

Si no tienes tus propios casos, usa los materiales del curso: /materiales/email-clienti.txt (emails de soporte), /materiales/riunione-trascrizione.txt (transcripción de llamada), /materiales/fatture.csv (datos con anomalías documentadas).

2. Escribe el prompt una sola vez.

El prompt debe ser idéntico para todos los modelos, de lo contrario no estás comparando modelos sino prompts. Escribe un prompt claro que funcione sin personalizaciones por modelo:

Eres un asistente que responde emails de clientes de forma profesional y concisa.

Email del cliente: “”“ [INSERTA AQUÍ EL EMAIL] “”“

Escribe una respuesta que:

  • Responda la pregunta principal
  • Cite números de pedido o referencias presentes en el email
  • Tenga menos de 150 palabras
  • No invente información que no esté en el email

Respuesta:

Reemplaza [INSERTA AQUÍ EL EMAIL] con el primer caso y guarda el prompt: lo usarás igual para todos los modelos.

3. Ejecuta el prompt en ambos modelos.

Si usas ChatGPT, abre un hilo nuevo, selecciona GPT-4o, pega el prompt con el primer caso. Copia la respuesta en la columna GPT-4o de tu hoja. Luego abre otro hilo, selecciona o1-mini, pega el mismo prompt. Copia la respuesta en la columna o1-mini.

Si usas OpenRouter o una interfaz que te permite llamar múltiples modelos, ejecuta el prompt una vez por modelo manteniendo registro de qué respuesta viene de dónde.

Repite para todos los casos de prueba. Al final tienes una cuadrícula: cada fila un caso, cada columna un modelo, cada celda la respuesta de ese modelo a ese caso.

4. Evalúa con los criterios que escribiste.

Para cada celda de la cuadrícula, verifica los criterios uno por uno: «¿Contiene el número de pedido? Sí/No. ¿Tiene menos de 150 palabras? Sí/No. ¿Inventa algo? Sí/No.» Marca un puntaje simple: 1 punto por cada criterio cumplido.

Haz esta operación sin saber qué modelo dio qué respuesta, o haz que otra persona evalúe. El objetivo es reducir el sesgo: si sabes que una respuesta viene del modelo costoso, tiendes a darle más crédito.

Al final suma los puntos por modelo. El modelo con el puntaje más alto funciona mejor con tus casos.

5. Busca patrones, no solo el total.

Un modelo puede ganar en total pero fallar sistemáticamente en un tipo de caso (los ambiguos, los con números). Mira dónde falla: si el caso difícil es frecuente en tu trabajo, un modelo que lo falla siempre no sirve aunque gane en los otros.

Mira también los tipos de errores: un modelo que inventa información es más peligroso que uno que responde de forma genérica. Estos detalles importan más que el puntaje agregado.

Un ejemplo completo

Trabajo en una agencia web (Lumen) y debo responder emails de clientes que piden actualizaciones de proyectos. Tengo dos candidatos: GPT-4o (más caro) y GPT-4o-mini (más económico). Quiero saber si el mini funciona, porque respondo 30 emails a la semana.

Casos de prueba: tomo tres emails de /materiales/email-clienti.txt:

  1. Cliente pregunta cuándo sale el nuevo sitio (fácil: fecha clara en el proyecto).
  2. Cliente pregunta por qué el formulario de contacto no funciona (medio: debo saber si es un bug conocido).
  3. Cliente pide descuento retroactivo en una factura ya pagada (difícil: solicitud delicada, debo ser firme pero cortés).

Criterios:

  • La respuesta contiene la referencia del proyecto o número de factura si está en el email.
  • No inventa información que no esté en el email o datos del proyecto.
  • Tono profesional, nada de lenguaje muy informal.
  • Menos de 150 palabras.

Ejecución:

Prueba con GPT-4o: abro ChatGPT, selecciono GPT-4o, pego el prompt con el primer email. La respuesta cita la fecha de lanzamiento prevista, son 120 palabras, tono correcto. Anoto 4/4.

Prueba con GPT-4o-mini: hilo nuevo, mismo prompt. La respuesta cita la fecha, 110 palabras, tono correcto. Anoto 4/4.

Caso 2 (bug): GPT-4o me da una respuesta sugiriendo revisar la configuración del navegador, no inventa solución técnica. 4/4. GPT-4o-mini hace lo mismo, pero añade un párrafo genérico sobre «verificar la conexión» que no viene al caso: 3/4 (respuesta más larga de lo necesario y algo vaga).

Caso 3 (descuento retroactivo): GPT-4o responde con firmeza educada, explica la política, propone alternativa. 4/4. GPT-4o-mini es menos claro en la política, parece dejar la puerta abierta cuando no debería: 2/4.

Resultado:

  • GPT-4o: 12/12
  • GPT-4o-mini: 9/12

GPT-4o gana. Pero miro el patrón: el mini falla en los casos delicados (caso 3). Si la mayoría de mis emails son actualizaciones de rutina (caso 1), el mini podría servir para esas, dejando los casos complejos para 4o. Esto me ahorra: uso el mini como primer filtro y 4o solo cuando es necesario.

Los errores típicos

Cambiar el prompt entre modelos. Es la tentación más fuerte: «este modelo necesita instrucciones más detalladas». Si lo haces, estás comparando tus prompts, no los modelos. Usa el mismo prompt idéntico.

Juzgar a simple vista sin criterios escritos. Sin criterios objetivos tiendes a preferir el modelo que ya conocías o el que cuesta más. Escribe los criterios antes de ver las respuestas.

Muy pocos casos. Un caso solo no basta: podría ser la excepción. Tres casos cubren uno fácil, uno medio, uno difícil. Cinco son mejores si la tarea es variada.

La variante en equipo

Si la comparación es para un equipo (grupo de asistentes de cliente, equipo editorial), haz que dos personas diferentes evalúen las respuestas sin saber qué modelo dio qué. Comparen sus juicios: si están de acuerdo, el ganador es claro. Si divergen, encontraron un caso ambiguo donde el modelo no es suficiente: necesitas un proceso humano para esos casos.

Un miembro del equipo prepara los casos y criterios, otro ejecuta la comparación, un tercero evalúa a ciegas. Así el sesgo individual cuenta menos y la decisión se sostiene mejor cuando la explicas al resto de la estructura.

Escribe para buscar en curso, playbooks, skills, papers…