Todos los insights
ES · Agentes de IA, Automatización y Operaciones

Cómo definir SLA, soporte y respuesta a incidentes al contratar servicios de IA

Convierta el uptime en un acuerdo operativo que cubra calidad de IA, severidad, detección, respuesta, recuperación, evidencia y mejora.

Un servicio de IA en producción atraviesa controles de calidad, monitoreo, incidente, recuperación y revisión de evidencia.
AI Service Reliability Compact-8 conecta resultados, SLI, SLO, severidad, respuesta, recuperación y remedios contractuales. · Generated with OpenAI

Antes de contratar una empresa para operar IA en producción, defina el servicio por el resultado que recibe el usuario, no solo por el uptime de infraestructura. Mida disponibilidad y latencia, pero también calidad de la respuesta o acción, seguridad, permisos, costo, colas humanas y recuperación. Para cada medida registre fuente, ventana, exclusiones, responsable y consecuencia.

Separe tres capas: SLI es la medida observable; SLO es el objetivo o rango operativo; SLA es el compromiso contractual y su consecuencia. Un dashboard sin consecuencia no es un SLA. Un crédito sin diagnóstico, corrección y salida tampoco protege el negocio. El comprador debe conservar visibilidad de datos brutos y autoridad para degradar, pausar o detener la automatización.

AI Service Reliability Compact-8: 32 puntos antes de firmar

Califique cada dimensión de cero a cuatro: cero, ausente; uno, promesa; dos, proceso parcial; tres, obligación documentada con owner y evidencia; cuatro, mecanismo probado en un escenario realista. Para un servicio relevante use 24 de 32 como referencia, ningún cero y mínimo tres en calidad, incidentes, recuperación y evidencia. Adapte el corte a la criticidad; no es un benchmark universal.

  • Resultado del servicio — usuarios, journeys críticos, acciones permitidas, volumen, horario y operación degradada.
  • SLI y SLO técnicos — disponibilidad, éxito, latencia por percentil, throughput, colas y dependencias.
  • Calidad y seguridad de IA — evaluaciones, groundedness, error dañino, políticas, autonomía y revisión humana.
  • Observabilidad y detección — logs, traces, versión, costo, drift, abuso, cobertura y alertas accionables.
  • Severidad y comunicación — impacto, datos, clientes, autonomía, plazo, canal, audiencia y actualizaciones.
  • Respuesta y recuperación — on-call, contención, fallback, rollback, RTO/RPO, restauración y validación.
  • Gobierno de cambios — release, regresión, aprobación, excepción, proveedor de modelo y configuración.
  • Evidencia y remedios — datos brutos, informe, causa, acción correctiva, crédito, holdback, auditoría y salida.

Defina la frontera del servicio antes del porcentaje

Mapee la ruta completa: entrada del usuario, datos y permisos, recuperación de contexto, modelo, herramientas, integraciones, revisión humana, respuesta o acción y registro final. Declare qué terceros entran en el cálculo y qué eventos son exclusiones. Si la API responde pero la acción es incorrecta, insegura o llega al cliente equivocado, el servicio no está sano.

Use pocos indicadores que representen experiencia y riesgo

  • Disponibilidad útil: intentos elegibles que completan la tarea correcta.
  • Latencia end-to-end por percentil, con herramientas, revisión humana y colas cuando aplique.
  • Calidad: aprobación del set de evaluación y de muestras de producción estratificadas por riesgo.
  • Seguridad: acciones bloqueadas, violaciones de política, acceso no autorizado y datos expuestos.
  • Economía: costo por tarea aceptada, consumo anómalo y límite antes de degradación controlada.
  • Operación: fallback, escalamiento humano, retrabajo, reapertura y tiempo hasta recuperación validada.

Google SRE recomienda pocos indicadores objetivos y advierte que los promedios esconden las colas. En IA, un agregado también puede ocultar fallas por idioma, población, canal o tarea de alto impacto. Defina umbrales por segmento y conserve el denominador. Un cambio en la mezcla de tráfico no debe fabricar una mejora.

Cree severidades específicas para IA

  • Sev 1 — daño material en curso, acción autónoma incorrecta a escala, exposición de datos, fraude, riesgo a la seguridad o pérdida de control; contener de inmediato y activar crisis.
  • Sev 2 — degradación relevante en un resultado, grupo o flujo crítico sin daño material confirmado; reducir autonomía, activar fallback e investigar.
  • Sev 3 — falla localizada y recuperable, con workaround y bajo impacto; reparar dentro de la rutina acordada.
  • Sev 4 — defecto cosmético, consulta o mejora sin impacto operativo; enviar al backlog.

Clasifique por impacto, alcance, datos, reversibilidad y autonomía, no por el componente. Una respuesta técnicamente rápida puede ser Sev 1 si toma decisiones prohibidas. Defina quién puede declarar o bajar severidad, quién debe participar y cuándo se informa a clientes, dirección, legal, seguridad, personas afectadas, autoridades o aseguradoras.

Haga medible la línea de tiempo

Separe tiempo para detectar, reconocer, contener, actualizar, recuperar, validar y concluir causa raíz. Inicie el reloj con la primera señal disponible para cualquiera de las partes. Defina cobertura por zona horaria, idioma y canal; contactos nominales; cadencia; contenido mínimo; y alternativa si falla el canal principal.

Vincule remedios con recuperación, no solo con créditos

Los créditos pueden disciplinar desempeño, pero rara vez compensan el daño. Use una escalera: informe y plan correctivo; capacidad adicional; freeze de cambios; holdback; crédito; auditoría focalizada; step-in o transición; y terminación por fallas críticas o repetidas. Defina cuándo eventos relacionados forman un incidente y cómo se calcula recurrencia.

No acepte exclusiones amplias por nube, modelo o subcontratista cuando el proveedor elige, integra u opera esa dependencia. Distribuya responsabilidad según control real. El mantenimiento planificado necesita aviso, ventana, límite y alternativa; no puede ser una exclusión ilimitada.

Pruebe al proveedor antes de adjudicar

Entregue a los finalistas el mismo escenario: una actualización aumenta respuestas convincentes pero incorrectas, un agente ejecuta dos acciones no autorizadas y el proveedor del modelo empieza a fallar de forma intermitente. En 75 minutos pida detección, severidad, contención, comunicación, fallback, retorno, evidencia y plan posterior. Observe quién toma el mando y si protegen usuarios antes de hablar de créditos.

Exija ocho artefactos operativos

  • Catálogo de servicio y mapa de dependencias.
  • Tarjetas SLI–SLO–SLA con fórmula, fuente, ventana, owner y consecuencia.
  • Matriz de severidad y árbol de escalamiento.
  • Runbooks de contención, fallback, rollback y restauración.
  • Inventario de modelos, prompts, datos, herramientas y versiones.
  • Set de evaluación y umbrales de regresión.
  • Plantilla de incidente y causa raíz.
  • Registros de cambios, ejercicios, acciones correctivas y riesgo aceptado.

Contexto latinoamericano y decisiones conectadas

América Latina reúne jurisdicciones, reguladores, zonas horarias e idiomas distintos. Alinee el acuerdo con la entidad contratante, roles de tratamiento de datos, requisitos sectoriales, seguros y contratos con clientes. No suponga que un reloj del proveedor satisface toda obligación de notificación. Exija aviso temprano y cooperación con información todavía incompleta; valide plazos y contenido con asesoría local.

Use https://makinai.co/insights/es/como-elegir-proveedor-servicios-gestionados-ia para seleccionar la operación, https://makinai.co/insights/es/como-elegir-empresa-evaluacion-pruebas-ia para evaluación, https://makinai.co/insights/es/due-diligence-seguridad-contratar-empresa-ia para diligencia y https://makinai.co/insights/es/que-incluir-contrato-sow-servicios-ia para el acuerdo principal.

Cuándo involucrar a MAKINAI

MAKINAI puede ayudar a mapear la frontera del servicio, definir indicadores, severidad, runbooks, pruebas de incidente y remedios antes de la selección o del lanzamiento. Conozca https://makinai.co/services/es/desarrollo-agentes-ia-automatizacion. El objetivo no es prometer cero fallas; es detectar temprano, limitar daño, recuperar con evidencia y aprender sin perder control.

Fuentes y referencias

  1. NIST SP 800-61 Rev. 3 — Incident Response Recommendations · National Institute of Standards and Technology

    Integra preparación, detección, respuesta, recuperación, comunicación y mejora continua con la gestión de riesgo de ciberseguridad.

    2026-09-07
  2. NIST AI 600-1 — Generative AI Profile · National Institute of Standards and Technology

    Trata el riesgo de IA generativa durante el ciclo de vida y vincula medición, monitoreo, disclosure de incidentes y terceros.

    2026-09-07
  3. Google SRE — Service Level Objectives · Google

    Distingue indicador, objetivo y acuerdo de servicio, y exige mediciones objetivas ligadas a consecuencias explícitas.

    2026-09-07
  4. UK Government — Artificial Intelligence Playbook · UK Government

    Recomienda monitoreo continuo, releases gestionados, rollback, escalamiento, assurance y procesos de fallback para IA.

    2026-09-07
Making connections

Siga explorando

Agentes de IA, Automatización y Operaciones

Cómo elegir un proveedor de servicios gestionados de IA

Leer insight
Agentes de IA, Automatización y Operaciones

Cómo elegir una empresa para integrar IA con sistemas empresariales

Leer insight
Agentes de IA, Automatización y Operaciones

Cómo elegir una empresa de IA para atención al cliente

Leer insight
Capacidad relacionada

Productos, agentes y automatización

Desarrollar un agente de IA empresarial no consiste solo en conectar un modelo a un chat. Requiere producto, contexto, herramientas, integraciones, identidad, evaluación, guardrails, observabilidad y operación humana. MAKINAI construye la experiencia completa y mide si mejora capacidad, calidad o velocidad.

Conocer esta capacidad