Todos los insights
ES · Agentes de IA, Automatización y Operaciones

Cómo evaluar una empresa de agentes de IA

Evalúe una empresa de agentes de IA por su evidencia de control de acciones, pruebas de trayectorias, protección de datos, operación de fallos, costos y transferencia, no por la demo.

Flujo de un agente de IA que atraviesa seis controles de preparación para producción, supervisión, pruebas y seguridad.
Los seis filtros de preparación convierten una demo de agente en una decisión de producción verificable. · Generated with OpenAI

Respuesta directa: elija una empresa de agentes de IA por la evidencia de que puede limitar acciones, evaluar resultados y trayectorias, proteger datos, operar fallos, controlar la economía y transferir conocimiento. Una demostración impecable solo prueba que funciona un recorrido feliz. Antes de contratar, exija un caso de uso acotado, pruebas de aceptación, arquitectura de permisos, conjunto de evaluaciones, plan de incidentes y reglas explícitas de propiedad.

Los agentes de IA no son solamente chatbots con una mejor interfaz. Recuperan contexto, eligen herramientas, ejecutan varios pasos y pueden modificar sistemas de registro. El riesgo del proveedor va más allá de una frase incorrecta: incluye una acción no autorizada, una credencial con permisos excesivos, un flujo atrapado en un ciclo o costos de uso que crecen sin control. Un socio confiable convierte estas posibilidades en requisitos de negocio e ingeniería desde el inicio.

La Matriz MAKINAI de Preparación de Agentes

Use seis filtros. El proveedor debe presentar evidencia mínima en todos; una gran capacidad de prototipado no compensa una falla crítica de seguridad u operación. La matriz sirve para la selección inicial, una prueba de valor pagada y la aceptación antes de producción. También permite comparar propuestas sin obligar a todos a usar el mismo modelo o nube.

Filtro 1 — Resultado, autonomía y límites de acción

Empiece por el resultado operativo, no por el modelo. Pida que se definan el evento inicial, las decisiones permitidas, las herramientas disponibles, los datos consultados, la condición de cierre y los puntos de aprobación humana. Establezca acciones reversibles, límites monetarios, categorías prohibidas y el comportamiento ante información insuficiente. Un diseño maduro distingue recomendación, preparación y ejecución: un agente puede sugerir un reembolso, prepararlo o emitirlo, y cada nivel necesita controles distintos.

  • Evidencia solicitada: mapa del recorrido y herramientas; matriz de permisos por función; política de confirmación humana; criterios de éxito e interrupción; ejemplos de fallo seguro.

Filtro 2 — Datos, contexto y arquitectura

El socio debe explicar de dónde viene el contexto, cómo se actualiza y cómo vincula cada salida con la fuente correcta. Pregunte qué datos entran en prompts, memoria, registros y sistemas externos; cómo se minimiza la información personal o confidencial; y cómo se separan credenciales. Prefiera arquitecturas donde cada herramienta tenga contrato explícito, validación de entrada y salida, privilegio mínimo y tiempo de espera. El sistema debería permitir sustituir modelos o componentes sin rehacer toda la operación.

Solicite un mapa de dependencias: modelo, orquestación, recuperación, APIs, colas, bases de datos, observabilidad e interfaces humanas. Así aparecen el lock-in, los puntos únicos de falla y los costos que una demo puede ocultar. La orientación de Google Cloud para producción también trata la arquitectura y el despliegue del agente como diseño de sistemas, no como un ejercicio de prompts.

Filtro 3 — Evaluación de resultados y trayectorias

Evaluar solo la respuesta final no basta. Un agente puede llegar al resultado correcto usando una herramienta equivocada, omitiendo una aprobación o haciendo diez veces más llamadas de las necesarias. El proveedor debe mantener casos representativos, resultados esperados, trayectorias aceptables, pruebas de regresión y ejemplos adversariales. Las métricas deben combinar éxito de tarea, precisión factual, uso correcto de herramientas, seguridad, latencia, costo y tasa de derivación humana.

Exija una línea base antes del piloto y un informe reproducible después de cada cambio material. NIST organiza el trabajo de riesgo de IA en Gobernar, Mapear, Medir y Gestionar. Esa lógica ayuda a relacionar pruebas técnicas con responsabilidades y decisiones operativas, en vez de reducir la evaluación a una nota abstracta.

Filtro 4 — Seguridad, identidad y respuesta a incidentes

Los agentes amplían la superficie de ataque porque interpretan contenido y actúan mediante herramientas. OWASP ofrece orientación específica para aplicaciones agénticas, mientras MITRE ATLAS cataloga tácticas y técnicas adversarias contra sistemas de IA. Una empresa calificada debe demostrar modelado de amenazas, defensa ante instrucciones maliciosas de usuarios o documentos recuperados, separación de datos y comandos, gestión de secretos, autenticación vinculada al usuario, autorización por acción, registros auditables y procedimiento de apagado de emergencia.

  • Preguntas eliminatorias: ¿el agente actúa con una credencial compartida? ¿las acciones de alto impacto requieren aprobación? ¿los registros reconstruyen la secuencia? ¿se prueba la inyección indirecta de prompts? ¿quién contiene y comunica un incidente?

Filtro 5 — Operación, observabilidad y cambios

La producción empieza donde termina el prototipo. Exija paneles de disponibilidad, latencia, costo, errores de herramientas, ciclos, intervenciones humanas y calidad por tipo de tarea. Pregunte cómo se registran y revierten versiones de prompts, herramientas, políticas y modelos. La empresa debe proponer un lanzamiento gradual, límites de uso, colas de revisión y fallback hacia un proceso humano o automatización determinista. Sin eso, el comprador hereda una caja negra difícil de sostener.

El plan de soporte debe nombrar responsables, severidades, horarios, objetivos de respuesta y criterios de escalamiento. También debe cubrir cambios en APIs, modelos y datos fuente. Un acuerdo de nivel de servicio solo sirve si mide el flujo completo y no únicamente la disponibilidad del modelo.

Filtro 6 — Economía, propiedad y capacidad interna

Compare el costo total por tarea completada con éxito, no solo precio por token o tarifa diaria. Incluya inferencia, recuperación, almacenamiento, observabilidad, revisión humana, integración, soporte y retrabajo. Defina presupuesto por flujo y alertas de anomalía. La propuesta debe aclarar derechos sobre código, prompts, evaluaciones, conectores, datos derivados y documentación, además de los procedimientos de exportación y transición.

Pida habilitación con manuales operativos, formación técnica y de negocio, criterios de aceptación y un período de transferencia asistida. El objetivo no es eliminar al socio, sino evitar dependencia innecesaria y garantizar que la organización pueda gobernar la capacidad que adquiere.

Cómo puntuar propuestas sin premiar la mejor demo

Use 100 puntos: 20 para resultado y límites, 15 para datos y arquitectura, 20 para evaluación, 20 para seguridad, 15 para operación y 10 para economía y propiedad. Añada filtros eliminatorios: ninguna acción sensible sin identidad y autorización; ningún lanzamiento sin regresión; ningún flujo crítico sin registros, apagado y fallback; ningún contrato sin reglas de propiedad. Luego ejecute un piloto corto con el mismo conjunto de casos para los finalistas.

Señales de alerta en la selección

  • La propuesta empieza por el modelo pero no define el proceso; la demo usa datos preparados y oculta fallos; “precisión” aparece sin dataset ni rúbrica; la seguridad queda para después del piloto; el costo se estima sin volumen ni tasa de excepciones; el proveedor no entrega registros, evaluaciones o documentación; cada cambio depende de una persona o plataforma propietaria.

Próximo paso

Antes de pedir precios, convierta el caso de uso en un paquete de evaluación con acciones permitidas, datos, riesgos, casos de prueba y métricas. La guía de RFP de MAKINAI ayuda a estructurar el proceso: https://makinai.co/insights/es/como-crear-rfp-servicios-ia. Para capacidad general de implementación, consulte https://makinai.co/insights/es/como-elegir-empresa-implementar-ia-brasil-scorecard-30-puntos. Si necesita diseñar y construir el primer agente con controles de producción desde el inicio, conozca el servicio de agentes y automatización de MAKINAI: https://makinai.co/services/es/desarrollo-agentes-ia-automatizacion.

Fuentes y referencias

  1. Artificial Intelligence Risk Management Framework (AI RMF 1.0) · NIST

    Organizes AI risk work around Govern, Map, Measure and Manage.

    2026-08-17
  2. Generative Artificial Intelligence Profile · NIST

    Applies the AI RMF to risks specific to generative AI systems.

    2026-08-17
  3. OWASP Top 10 for Agentic Applications 2026 · OWASP GenAI Security Project

    Identifies critical security risks for autonomous, tool-using AI systems.

    2026-08-17
  4. A dev’s guide to production-ready AI agents · Google Cloud

    Covers architecture and production deployment considerations for AI agents.

    2026-08-17
  5. MITRE ATLAS · MITRE

    Provides a living knowledge base of adversary tactics and techniques against AI systems.

    2026-08-17
Making connections

Siga explorando

Agentes de IA, Automatización y Operaciones

Cómo definir SLA, soporte y respuesta a incidentes al contratar servicios de IA

Leer insight
Agentes de IA, Automatización y Operaciones

Cómo elegir un proveedor de servicios gestionados de IA

Leer insight
Agentes de IA, Automatización y Operaciones

Cómo elegir una empresa para integrar IA con sistemas empresariales

Leer insight
Capacidad relacionada

Productos, agentes y automatización

Desarrollar un agente de IA empresarial no consiste solo en conectar un modelo a un chat. Requiere producto, contexto, herramientas, integraciones, identidad, evaluación, guardrails, observabilidad y operación humana. MAKINAI construye la experiencia completa y mide si mejora capacidad, calidad o velocidad.

Conocer esta capacidad