El Caso Air Canada: Cuando una Corazonada se Vuelve Política
¡Hola Devs! 👋 En 2024, un cliente de Air Canada le preguntó al chatbot sobre tarifas por duelo. El bot citó con total confianza una política de reembolso que no existía. La aerolínea se negó a honrarla. Un tribunal le dio la razón al cliente.
El bot no decidió nada. Predijo texto plausible. Pero la interfaz presentó esa predicción con la misma seguridad que un documento oficial — sin advertencias, sin fallback a humano, sin incertidumbre visible. El usuario leyó confianza como compromiso. Legalmente, el tribunal también.
Este es el riesgo central de poner IA en producción hoy: sistemas probabilísticos envueltos en interfaces determinísticas.
Estamos cableados para pensar de forma determinística. Lanza una moneda 999 veces y sale cara siempre — la mente determinística asume que la moneda está cargada. La mente probabilística acepta que el lanzamiento 1000 todavía puede salir cruz. Esa segunda cabeza es la que los equipos de producto necesitan ahora.
Esta guía es sobre usar IA para afinar el juicio — no para tercerizarlo. El argumento completo está en el deep dive de Smashing Magazine sobre diseño con incertidumbre.

Pensamiento Probabilístico: Trata las Salidas de IA como Señales, No como Veredictos
La mayoría de las preguntas que le hacemos a la IA no tienen respuesta binaria. Pregunta "¿existen los aliens?" y vas a recibir algo entre plausible e incierto. La respuesta no resuelve la pregunta — la enmarca como probabilidad.
Netflix no sabe que te va a gustar Superstore porque viste The Office. Estima la probabilidad y te pone el título al frente. La interfaz responde a una predicción.
Las decisiones de diseño pueden seguir la misma lógica. Imagínate un escenario donde analytics marcan 60% vs. 90% de confianza de que el usuario complete la compra:
- Al 60%: el diseño tiene que hacer trabajo persuasivo — testimonios, comparaciones, señales de seguridad.
- Al 90%: el usuario ya está motivado — quita fricción para que la acción ocurra rápido.
Misma pantalla. Problemas de diseño totalmente distintos. 🎯
Evaluando Diseños con Prompts Estructurados
Cuando no tienes acceso directo al grupo objetivo, los prompts estructurados pueden simular la evaluación. Checa este template para analizar un diseño desde la perspectiva de usuarios neurodivergentes:
Evalúa [archivo de diseño o URL] en usabilidad, accesibilidad
y relevancia de contenido desde la perspectiva de usuarios
neurodivergentes (ej.: espectro autista, TDAH, dificultades
de aprendizaje).
Criterios:
- ¿El layout y la navegación son intuitivos para este grupo?
- ¿El lenguaje y contenido son apropiados y atractivos?
- ¿Hay barreras técnicas, cognitivas o sensoriales?
- ¿Qué tan bien cumple el sitio con sus objetivos específicos?
Salida: análisis SWOT + score de probabilidad de uso
exitoso + recomendaciones concretas.
Trátalo como punto de partida de conversación con tu equipo — no como veredicto. Y ojo: las simulaciones no reemplazan la experimentación. Los modelos entrenados con datos históricos reflejan el comportamiento pasado más de lo que predicen cambios futuros.
El Problema del Zurdo
Pídele a un modelo de imágenes que genere a alguien escribiendo con la mano izquierda y puede que igual te devuelva a un diestro. La razón es estadística: la mayoría es diestra, y los datos de entrenamiento lo reflejan. Lo que recibes no es verdad — es la salida estadísticamente más probable dado el dataset.
Este es exactamente el modo de falla que hundió la herramienta experimental de reclutamiento de Amazon. Entrenada con casi una década de datos sesgados, el modelo aprendió a castigar currículums que contenían la palabra "women's" — tipo "women's chess club captain". El sistema no era intencionalmente sesgado. Los datos sí. Amazon habría cancelado el proyecto tras no poder garantizar que el sesgo no reapareciera de otras formas.

Human-in-the-Loop es Motor de Refinamiento, No Red de Seguridad
La IA debe aumentar el juicio humano, no reemplazarlo. Los sistemas más confiables están diseñados con momentos claros donde las personas pueden revisar, cuestionar, corregir o sobrescribir las sugerencias de la máquina.
Cómo se Ve HITL en la Práctica
GitHub Copilot ofrece sugerencias inline que los devs aceptan con Tab, editan o ignoran. El sistema nunca commitea código en nombre del usuario. Cada aceptación, rechazo o edición es feedback implícito de qué sugerencias fueron útiles.
Smart Compose de Gmail presenta texto predicho como opcional, manteniendo tono e intención en manos del usuario.
En contextos de mayor riesgo, HITL se vuelve explícito. Los sistemas antifraude usan scores de probabilidad para enrutar decisiones:
| Nivel de Riesgo | Acción |
|---|---|
| Bajo | Procede automáticamente |
| Medio | Dispara verificación adicional |
| Alto | Escala a revisor humano |
Combinando Patrones de Interacción con Nivel de Riesgo
| Tipo de Usuario | Riesgo | Objetivo del Diseño |
|---|---|---|
| Confía demasiado | Actúa rápido, confía fácil en la IA | Mostrar incertidumbre en primer plano |
| Desconfiado | Ignora la IA por completo | Mostrar precisión histórica o niveles de confianza |
| Escéptico/Equilibrado | Usa la IA como guía | Reforzar la asistencia y dejar que decida |
Comunicar Incertidumbre Sin Perder Confianza
Una ventana de entrega "viernes a lunes" dice la verdad sobre la variabilidad. Una hora específica que se retrasa erosiona la confianza cada vez. Un reconocimiento facial que pregunta "¿este parece Pratik, está bien?" genera expectativas más honestas que uno que etiqueta la foto en silencio.
Comunicar incertidumbre no debilita la confianza — la fortalece. 💪

Optimiza para Resiliencia, No Solo para Conversión
El buen diseño se adapta cuando cambia el panorama. Un sistema resiliente:
- Se adapta conforme emergen nuevos datos y comportamientos
- Falla de forma segura, no catastrófica
- Permanece transparente y explicable
- Evita patrones de interacción frágiles y sobre-optimizados
- Anticipa efectos de segundo orden y no intencionales
El Ejemplo de Duolingo
El sistema de corazones de Duolingo introduce fricción: te equivocas mucho, se acaban los corazones, tienes que esperar o practicar material viejo. En el papel, parece un asesino de conversión. En la práctica, apoya la motivación y retención a largo plazo — la métrica que realmente importa para una app de aprendizaje. El engagement de corto plazo baja; el resultado de largo plazo mejora. 🦉
Checklist de Resiliencia Pre-Lanzamiento
- ¿Cómo se comporta el sistema bajo baja confianza de la IA?
- ¿Cuál es el fallback seguro cuando la asistencia de IA desaparece por completo?
- ¿Qué drifts anticipamos en datos, comportamiento y desempeño del modelo?
- ¿Qué efectos de segundo orden proyecta esta optimización como sombra?
El Reframe Que Cambia Todo
Deja de preguntar "¿esto va a funcionar?" Empieza a preguntar: "¿qué tan probable es que funcione, y qué pasa cuando no funcione?"
Ese único reframe cambia cómo escribes hipótesis, interpretas salidas de IA, dimensionas experimentos y diseñas para los momentos en que el sistema se equivoca. La IA no introdujo incertidumbre en nuestro mundo — solo hizo imposible ignorar la incertidumbre que siempre estuvo ahí.
Piensa en rangos, no en puntos. Prueba supuestos, no features. Construye para adaptación, no para perfección.
Lectura relacionada: