Antes de contratar una empresa para operar IA en producción, defina el servicio por el resultado que recibe el usuario, no solo por el uptime de infraestructura. Mida disponibilidad y latencia, pero también calidad de la respuesta o acción, seguridad, permisos, costo, colas humanas y recuperación. Para cada medida registre fuente, ventana, exclusiones, responsable y consecuencia.
Separe tres capas: SLI es la medida observable; SLO es el objetivo o rango operativo; SLA es el compromiso contractual y su consecuencia. Un dashboard sin consecuencia no es un SLA. Un crédito sin diagnóstico, corrección y salida tampoco protege el negocio. El comprador debe conservar visibilidad de datos brutos y autoridad para degradar, pausar o detener la automatización.
AI Service Reliability Compact-8: 32 puntos antes de firmar
Califique cada dimensión de cero a cuatro: cero, ausente; uno, promesa; dos, proceso parcial; tres, obligación documentada con owner y evidencia; cuatro, mecanismo probado en un escenario realista. Para un servicio relevante use 24 de 32 como referencia, ningún cero y mínimo tres en calidad, incidentes, recuperación y evidencia. Adapte el corte a la criticidad; no es un benchmark universal.
- Resultado del servicio — usuarios, journeys críticos, acciones permitidas, volumen, horario y operación degradada.
- SLI y SLO técnicos — disponibilidad, éxito, latencia por percentil, throughput, colas y dependencias.
- Calidad y seguridad de IA — evaluaciones, groundedness, error dañino, políticas, autonomía y revisión humana.
- Observabilidad y detección — logs, traces, versión, costo, drift, abuso, cobertura y alertas accionables.
- Severidad y comunicación — impacto, datos, clientes, autonomía, plazo, canal, audiencia y actualizaciones.
- Respuesta y recuperación — on-call, contención, fallback, rollback, RTO/RPO, restauración y validación.
- Gobierno de cambios — release, regresión, aprobación, excepción, proveedor de modelo y configuración.
- Evidencia y remedios — datos brutos, informe, causa, acción correctiva, crédito, holdback, auditoría y salida.
Defina la frontera del servicio antes del porcentaje
Mapee la ruta completa: entrada del usuario, datos y permisos, recuperación de contexto, modelo, herramientas, integraciones, revisión humana, respuesta o acción y registro final. Declare qué terceros entran en el cálculo y qué eventos son exclusiones. Si la API responde pero la acción es incorrecta, insegura o llega al cliente equivocado, el servicio no está sano.
Use pocos indicadores que representen experiencia y riesgo
- Disponibilidad útil: intentos elegibles que completan la tarea correcta.
- Latencia end-to-end por percentil, con herramientas, revisión humana y colas cuando aplique.
- Calidad: aprobación del set de evaluación y de muestras de producción estratificadas por riesgo.
- Seguridad: acciones bloqueadas, violaciones de política, acceso no autorizado y datos expuestos.
- Economía: costo por tarea aceptada, consumo anómalo y límite antes de degradación controlada.
- Operación: fallback, escalamiento humano, retrabajo, reapertura y tiempo hasta recuperación validada.
Google SRE recomienda pocos indicadores objetivos y advierte que los promedios esconden las colas. En IA, un agregado también puede ocultar fallas por idioma, población, canal o tarea de alto impacto. Defina umbrales por segmento y conserve el denominador. Un cambio en la mezcla de tráfico no debe fabricar una mejora.
Cree severidades específicas para IA
- Sev 1 — daño material en curso, acción autónoma incorrecta a escala, exposición de datos, fraude, riesgo a la seguridad o pérdida de control; contener de inmediato y activar crisis.
- Sev 2 — degradación relevante en un resultado, grupo o flujo crítico sin daño material confirmado; reducir autonomía, activar fallback e investigar.
- Sev 3 — falla localizada y recuperable, con workaround y bajo impacto; reparar dentro de la rutina acordada.
- Sev 4 — defecto cosmético, consulta o mejora sin impacto operativo; enviar al backlog.
Clasifique por impacto, alcance, datos, reversibilidad y autonomía, no por el componente. Una respuesta técnicamente rápida puede ser Sev 1 si toma decisiones prohibidas. Defina quién puede declarar o bajar severidad, quién debe participar y cuándo se informa a clientes, dirección, legal, seguridad, personas afectadas, autoridades o aseguradoras.
Haga medible la línea de tiempo
Separe tiempo para detectar, reconocer, contener, actualizar, recuperar, validar y concluir causa raíz. Inicie el reloj con la primera señal disponible para cualquiera de las partes. Defina cobertura por zona horaria, idioma y canal; contactos nominales; cadencia; contenido mínimo; y alternativa si falla el canal principal.
Vincule remedios con recuperación, no solo con créditos
Los créditos pueden disciplinar desempeño, pero rara vez compensan el daño. Use una escalera: informe y plan correctivo; capacidad adicional; freeze de cambios; holdback; crédito; auditoría focalizada; step-in o transición; y terminación por fallas críticas o repetidas. Defina cuándo eventos relacionados forman un incidente y cómo se calcula recurrencia.
No acepte exclusiones amplias por nube, modelo o subcontratista cuando el proveedor elige, integra u opera esa dependencia. Distribuya responsabilidad según control real. El mantenimiento planificado necesita aviso, ventana, límite y alternativa; no puede ser una exclusión ilimitada.
Pruebe al proveedor antes de adjudicar
Entregue a los finalistas el mismo escenario: una actualización aumenta respuestas convincentes pero incorrectas, un agente ejecuta dos acciones no autorizadas y el proveedor del modelo empieza a fallar de forma intermitente. En 75 minutos pida detección, severidad, contención, comunicación, fallback, retorno, evidencia y plan posterior. Observe quién toma el mando y si protegen usuarios antes de hablar de créditos.
Exija ocho artefactos operativos
- Catálogo de servicio y mapa de dependencias.
- Tarjetas SLI–SLO–SLA con fórmula, fuente, ventana, owner y consecuencia.
- Matriz de severidad y árbol de escalamiento.
- Runbooks de contención, fallback, rollback y restauración.
- Inventario de modelos, prompts, datos, herramientas y versiones.
- Set de evaluación y umbrales de regresión.
- Plantilla de incidente y causa raíz.
- Registros de cambios, ejercicios, acciones correctivas y riesgo aceptado.
Contexto latinoamericano y decisiones conectadas
América Latina reúne jurisdicciones, reguladores, zonas horarias e idiomas distintos. Alinee el acuerdo con la entidad contratante, roles de tratamiento de datos, requisitos sectoriales, seguros y contratos con clientes. No suponga que un reloj del proveedor satisface toda obligación de notificación. Exija aviso temprano y cooperación con información todavía incompleta; valide plazos y contenido con asesoría local.
Use https://makinai.co/insights/es/como-elegir-proveedor-servicios-gestionados-ia para seleccionar la operación, https://makinai.co/insights/es/como-elegir-empresa-evaluacion-pruebas-ia para evaluación, https://makinai.co/insights/es/due-diligence-seguridad-contratar-empresa-ia para diligencia y https://makinai.co/insights/es/que-incluir-contrato-sow-servicios-ia para el acuerdo principal.
Cuándo involucrar a MAKINAI
MAKINAI puede ayudar a mapear la frontera del servicio, definir indicadores, severidad, runbooks, pruebas de incidente y remedios antes de la selección o del lanzamiento. Conozca https://makinai.co/services/es/desarrollo-agentes-ia-automatizacion. El objetivo no es prometer cero fallas; es detectar temprano, limitar daño, recuperar con evidencia y aprender sin perder control.