Ir al contenido principal
¿Hablamos?
Inteligencia Artificial · AgentOps

Agentes en producción, bajo control

Un agente no se entrega y se olvida. Operamos tus agentes con evals continuas, observabilidad de cada paso, detección de drift, auditoría y control humano, para que sigan haciendo lo correcto cuando cambian los datos, los procesos o el modelo.

  • Trazas de cada decisión y de cada herramienta usada
  • Evals de regresión antes de cualquier cambio de prompt o de modelo
  • Red teaming de agentes contra inyección y abuso de herramientas

Principios de diseño

  • Toda ejecución trazada
  • Ningún cambio de modelo o prompt sin evals
  • Alertas automáticas de comportamiento y costo
  • Un registro de auditoría por acción

Lo difícil empieza después del lanzamiento

Los modelos cambian de versión, los datos cambian y los procesos cambian. Un agente que funcionaba bien puede degradarse sin que nadie lo note.

AgentOps es la disciplina de operar agentes como sistemas críticos: medir, detectar, auditar y corregir, con personas en el punto de control correcto.

Lee: AgentOps, cómo operar agentes en producción →

Qué operamos

Observabilidad de agentes

Trazas de cada paso (entradas, decisiones, herramientas, costos, latencia), basadas en estándares abiertos como OpenTelemetry.

Evals continuas

Conjuntos de prueba propios que se ejecutan con cada cambio y periódicamente en producción.

Cómo evaluamos agentes →
Detección de drift

Alertas cuando el comportamiento, la calidad o el costo del agente se desvían de su línea base.

Guardrails y control humano

Niveles de autonomía por tipo de acción, aprobaciones y límites operativos.

Guardrails y control humano →
Red teaming de agentes

Pruebas ofensivas contra la inyección de instrucciones, la fuga de datos y el abuso de herramientas, con nuestro equipo de ethical hacking.

Ciberseguridad y ethical hacking →
Gobierno y auditoría

Inventario de agentes, responsables, versiones, permisos y evidencia para auditoría interna, tomando como referencia marcos como NIST AI RMF e ISO/IEC 42001.

Cómo lo operamos (duraciones orientativas)

011–2 semanas

Inventario y línea base

Qué agentes existen, quién es responsable, qué versiones corren y cómo se comportan hoy.

021–2 semanas

Instrumentación y tableros

Trazas, métricas de calidad y costo, y tableros por agente.

032 semanas

Evals y alertas

Conjuntos de prueba propios y alertas sobre calidad, drift y costo.

041–2 semanas

Red teaming inicial

Pruebas ofensivas específicas para agentes y plan de corrección.

05Continuo

Operación con reportes periódicos

Reportes de calidad, incidentes, costos y mejoras aplicadas.

Stack con el que trabajamos

Observabilidad

OpenTelemetryLangfuseLangSmithGrafana

Plataformas de nube

Amazon CloudWatchAzure Monitor

Calidad y control

Evals propiasMCPRed teaming

Antes de construir agentes para otros, los usamos en casa

Lo que ofrecemos es lo que usamos todos los días.

Niveleads: agentes en nuestra operación comercial

En Niveleads, nuestra plataforma comercial, los agentes prospectan, arman campañas, envían correos automáticos y revisan cómo interactúa cada lead. También hacen llamadas de voz con IA y vigilancia tecnológica, apoyan a growth y marketing, y leen señales para darle insights al equipo.

Ingeniería con agentes y QA independiente

Desarrollamos con agentes que escriben, prueban y revisan código, pero no le dejamos todo a la IA. Las entregas pasan por un agente de QA independiente y por estándares de verificación que define nuestro equipo. Quien construye no es quien aprueba.

Un sitio pensado para agentes

nivelics.com está diseñado para que también lo lean agentes y LLMs: un llms.txt que se genera dinámicamente, datos estructurados schema.org y contenido pensado para LLMs.

Arquitecturas de referencia

Escenarios ilustrativos de cómo construimos. No describen clientes ni resultados.

Agente de operaciones: de la alerta al despliegue

Una organización con muchos sistemas y un equipo de operaciones saturado de alertas.

  1. Alerta
  2. Agente de clasificación
  3. Cambios, logs y runbooks vía MCP
  4. Verificador
  5. Ejecutar y notificar o pedir aprobación
  6. Registro de auditoría

El agente correlaciona cada alerta con despliegues y cambios recientes, consulta logs y runbooks, clasifica la severidad y propone la acción. Las acciones reversibles preaprobadas en el runbook, como reiniciar un servicio, las ejecuta con el visto bueno del verificador y luego notifica. Para las irreversibles prepara el plan y espera aprobación humana.

Harness: Herramientas de solo lectura por defecto · verificador contra el runbook · trazas de cada decisión · evals construidas con incidentes históricos

Orquestación multisistema de un proceso de negocio

Un proceso que atraviesa varios sistemas y áreas, con reprocesos por datos inconsistentes.

  1. Solicitud
  2. Orquestador
  3. Agentes de integración y ejecución
  4. Verificador
  5. Cierre o excepción a una persona

Un orquestador recibe la solicitud. Un agente de integración valida datos entre el ERP, el gestor documental y la base de datos. Un agente ejecutor registra los cambios y un verificador independiente confirma la consistencia antes de cerrar. Las excepciones llegan a una persona con todo el contexto ya armado.

Harness: Servidores MCP por sistema con mínimo privilegio · transacciones idempotentes con compensación · enrutamiento de modelos · tablero de AgentOps

Preguntas frecuentes

Sí. Empezamos con un inventario y una línea base, instrumentamos lo que falte y definimos evals antes de asumir la operación.

Es la desviación gradual de su comportamiento respecto a lo esperado, causada por cambios en los datos, en los procesos o en la versión del modelo. Se detecta comparando contra una línea base y con evals periódicas.

Cada ejecución: qué recibió el agente, qué decidió, qué herramientas usó, con qué parámetros y permisos, y qué resultado obtuvo.

Con tableros en vivo y un reporte periódico de calidad, incidentes, costos y mejoras aplicadas.

Sí, con red teaming específico para agentes: inyección de instrucciones, abuso de herramientas y fuga de datos.

¿Quieres auditar la seguridad de tus agentes? Conoce ethical hacking →

¿Cuántos agentes tienes hoy en producción y quién los vigila?

Empezamos con un inventario y una línea base: sabrás qué hacen tus agentes, cuánto cuestan y dónde están los riesgos.

Hablar de AgentOps →Respuesta en menos de 24 horas · Bajo acuerdo de confidencialidad