Respuesta directa: elija una empresa de agentes de IA por la evidencia de que puede limitar acciones, evaluar resultados y trayectorias, proteger datos, operar fallos, controlar la economía y transferir conocimiento. Una demostración impecable solo prueba que funciona un recorrido feliz. Antes de contratar, exija un caso de uso acotado, pruebas de aceptación, arquitectura de permisos, conjunto de evaluaciones, plan de incidentes y reglas explícitas de propiedad.
Los agentes de IA no son solamente chatbots con una mejor interfaz. Recuperan contexto, eligen herramientas, ejecutan varios pasos y pueden modificar sistemas de registro. El riesgo del proveedor va más allá de una frase incorrecta: incluye una acción no autorizada, una credencial con permisos excesivos, un flujo atrapado en un ciclo o costos de uso que crecen sin control. Un socio confiable convierte estas posibilidades en requisitos de negocio e ingeniería desde el inicio.
La Matriz MAKINAI de Preparación de Agentes
Use seis filtros. El proveedor debe presentar evidencia mínima en todos; una gran capacidad de prototipado no compensa una falla crítica de seguridad u operación. La matriz sirve para la selección inicial, una prueba de valor pagada y la aceptación antes de producción. También permite comparar propuestas sin obligar a todos a usar el mismo modelo o nube.
Filtro 1 — Resultado, autonomía y límites de acción
Empiece por el resultado operativo, no por el modelo. Pida que se definan el evento inicial, las decisiones permitidas, las herramientas disponibles, los datos consultados, la condición de cierre y los puntos de aprobación humana. Establezca acciones reversibles, límites monetarios, categorías prohibidas y el comportamiento ante información insuficiente. Un diseño maduro distingue recomendación, preparación y ejecución: un agente puede sugerir un reembolso, prepararlo o emitirlo, y cada nivel necesita controles distintos.
- Evidencia solicitada: mapa del recorrido y herramientas; matriz de permisos por función; política de confirmación humana; criterios de éxito e interrupción; ejemplos de fallo seguro.
Filtro 2 — Datos, contexto y arquitectura
El socio debe explicar de dónde viene el contexto, cómo se actualiza y cómo vincula cada salida con la fuente correcta. Pregunte qué datos entran en prompts, memoria, registros y sistemas externos; cómo se minimiza la información personal o confidencial; y cómo se separan credenciales. Prefiera arquitecturas donde cada herramienta tenga contrato explícito, validación de entrada y salida, privilegio mínimo y tiempo de espera. El sistema debería permitir sustituir modelos o componentes sin rehacer toda la operación.
Solicite un mapa de dependencias: modelo, orquestación, recuperación, APIs, colas, bases de datos, observabilidad e interfaces humanas. Así aparecen el lock-in, los puntos únicos de falla y los costos que una demo puede ocultar. La orientación de Google Cloud para producción también trata la arquitectura y el despliegue del agente como diseño de sistemas, no como un ejercicio de prompts.
Filtro 3 — Evaluación de resultados y trayectorias
Evaluar solo la respuesta final no basta. Un agente puede llegar al resultado correcto usando una herramienta equivocada, omitiendo una aprobación o haciendo diez veces más llamadas de las necesarias. El proveedor debe mantener casos representativos, resultados esperados, trayectorias aceptables, pruebas de regresión y ejemplos adversariales. Las métricas deben combinar éxito de tarea, precisión factual, uso correcto de herramientas, seguridad, latencia, costo y tasa de derivación humana.
Exija una línea base antes del piloto y un informe reproducible después de cada cambio material. NIST organiza el trabajo de riesgo de IA en Gobernar, Mapear, Medir y Gestionar. Esa lógica ayuda a relacionar pruebas técnicas con responsabilidades y decisiones operativas, en vez de reducir la evaluación a una nota abstracta.
Filtro 4 — Seguridad, identidad y respuesta a incidentes
Los agentes amplían la superficie de ataque porque interpretan contenido y actúan mediante herramientas. OWASP ofrece orientación específica para aplicaciones agénticas, mientras MITRE ATLAS cataloga tácticas y técnicas adversarias contra sistemas de IA. Una empresa calificada debe demostrar modelado de amenazas, defensa ante instrucciones maliciosas de usuarios o documentos recuperados, separación de datos y comandos, gestión de secretos, autenticación vinculada al usuario, autorización por acción, registros auditables y procedimiento de apagado de emergencia.
- Preguntas eliminatorias: ¿el agente actúa con una credencial compartida? ¿las acciones de alto impacto requieren aprobación? ¿los registros reconstruyen la secuencia? ¿se prueba la inyección indirecta de prompts? ¿quién contiene y comunica un incidente?
Filtro 5 — Operación, observabilidad y cambios
La producción empieza donde termina el prototipo. Exija paneles de disponibilidad, latencia, costo, errores de herramientas, ciclos, intervenciones humanas y calidad por tipo de tarea. Pregunte cómo se registran y revierten versiones de prompts, herramientas, políticas y modelos. La empresa debe proponer un lanzamiento gradual, límites de uso, colas de revisión y fallback hacia un proceso humano o automatización determinista. Sin eso, el comprador hereda una caja negra difícil de sostener.
El plan de soporte debe nombrar responsables, severidades, horarios, objetivos de respuesta y criterios de escalamiento. También debe cubrir cambios en APIs, modelos y datos fuente. Un acuerdo de nivel de servicio solo sirve si mide el flujo completo y no únicamente la disponibilidad del modelo.
Filtro 6 — Economía, propiedad y capacidad interna
Compare el costo total por tarea completada con éxito, no solo precio por token o tarifa diaria. Incluya inferencia, recuperación, almacenamiento, observabilidad, revisión humana, integración, soporte y retrabajo. Defina presupuesto por flujo y alertas de anomalía. La propuesta debe aclarar derechos sobre código, prompts, evaluaciones, conectores, datos derivados y documentación, además de los procedimientos de exportación y transición.
Pida habilitación con manuales operativos, formación técnica y de negocio, criterios de aceptación y un período de transferencia asistida. El objetivo no es eliminar al socio, sino evitar dependencia innecesaria y garantizar que la organización pueda gobernar la capacidad que adquiere.
Cómo puntuar propuestas sin premiar la mejor demo
Use 100 puntos: 20 para resultado y límites, 15 para datos y arquitectura, 20 para evaluación, 20 para seguridad, 15 para operación y 10 para economía y propiedad. Añada filtros eliminatorios: ninguna acción sensible sin identidad y autorización; ningún lanzamiento sin regresión; ningún flujo crítico sin registros, apagado y fallback; ningún contrato sin reglas de propiedad. Luego ejecute un piloto corto con el mismo conjunto de casos para los finalistas.
Señales de alerta en la selección
- La propuesta empieza por el modelo pero no define el proceso; la demo usa datos preparados y oculta fallos; “precisión” aparece sin dataset ni rúbrica; la seguridad queda para después del piloto; el costo se estima sin volumen ni tasa de excepciones; el proveedor no entrega registros, evaluaciones o documentación; cada cambio depende de una persona o plataforma propietaria.
Próximo paso
Antes de pedir precios, convierta el caso de uso en un paquete de evaluación con acciones permitidas, datos, riesgos, casos de prueba y métricas. La guía de RFP de MAKINAI ayuda a estructurar el proceso: https://makinai.co/insights/es/como-crear-rfp-servicios-ia. Para capacidad general de implementación, consulte https://makinai.co/insights/es/como-elegir-empresa-implementar-ia-brasil-scorecard-30-puntos. Si necesita diseñar y construir el primer agente con controles de producción desde el inicio, conozca el servicio de agentes y automatización de MAKINAI: https://makinai.co/services/es/desarrollo-agentes-ia-automatizacion.