Ir al contenido
Agentes de IA · Prueba acotada

Treinta días, criterios escritos antes de empezar, y una decisión con números al final

El piloto responde una sola pregunta: ¿esto mueve la aguja en tu operación o no? Se define qué se va a medir y contra qué punto de partida antes de encender nada, se corre un mes con implementación y mensualidad reducidas, y al cierre hay un reporte.

Casi todas las pruebas de IA fracasan por cómo se diseñaron

El patrón se repite: alguien enciende una herramienta unas semanas, al final todos opinan que «se ve interesante», nadie sabe si mejoró algo, y el proyecto muere sin que nadie decida matarlo. La causa rara vez es el modelo: se arrancó sin escribir qué significaría que funcione, sin medir cómo estaban las cosas antes, y sin acordar quién decide al terminar. Un piloto que no puede fallar tampoco puede probar nada.

Las cuatro piezas que se escriben antes de encender

La métrica principal

Una sola, y observable sin discusión. No «mejorar la atención», sino algo que se cuenta: mensajes respondidos fuera de horario, facturas con gestión registrada.

La línea base

Cómo está eso hoy, medido sobre tus datos de las semanas previas, no estimado de memoria. Sin línea base, cualquier resultado se lee como éxito o fracaso según convenga.

El umbral mínimo

A partir de qué valor tiene sentido continuar. Fijarlo antes impide la negociación posterior, que es el momento en que un piloto ambiguo se convierte en un gasto recurrente.

Las métricas de guardia

Lo que no debe empeorar aunque la principal mejore: quejas de clientes, errores que llegaron al cliente, casos escalados tarde. Ganar velocidad rompiendo otra cosa no es ganar.

Qué se mide en cada agente durante el mes

Las magnitudes dependen de tu operación; la forma es siempre la misma: se cuenta lo que el agente hizo y lo que pasó a una persona. Estos son los indicadores que solemos instrumentar, y ninguno es una promesa de resultado:

  • Atención de mensajes: conversaciones recibidas, cuántas resolvió sin ayuda, cuántas escaló y cuántas llegaron fuera del horario de tu equipo.
  • Documentos comerciales: solicitudes recibidas, tiempo entre la solicitud y el documento enviado, cuántos salieron sin intervención y cuántos requirieron una excepción de precio.
  • Cartera: facturas incluidas en la escalera, gestiones enviadas por peldaño, respuestas recibidas, promesas de pago registradas y cuántas se cumplieron en su fecha.
  • Digitalización: documentos procesados, campos extraídos, proporción que pasó por la cola de excepciones y correcciones por tipo de documento.

El reporte de cierre pone cada número al lado de su línea base. Esa comparación es todo el producto del piloto: no un tablero, no una demostración, un antes y un después medidos igual.

Las tres salidas posibles, decididas de antemano

Al terminar el mes solo hay tres caminos, y cuál se toma lo dice el umbral escrito al principio:

  • Continuar. Se cumplió el umbral y las métricas de guardia se sostuvieron. El agente pasa a tarifa plena y sigue funcionando sin cortes.
  • Ajustar y repetir. El resultado quedó corto pero la causa está identificada y es corregible: faltaba un dato conectado, el guion no cubría un tipo de caso, la escalera estaba mal calibrada. Se corrige y se vuelve a medir con el mismo criterio, no con uno nuevo más fácil.
  • Apagar. El resultado quedó corto y la causa es de fondo: el proceso no estaba listo, o el volumen no justifica el gasto. Se apaga y el reporte se queda contigo.

Una condición hace honesto todo lo anterior: la tercera salida tiene que ser posible de verdad. Un piloto del que solo se puede salir contratando no es una prueba, es una promoción con otro nombre.

Qué te llevas del mes, pase lo que pase

  • Documento de criterios firmado antes de arrancar: métrica, línea base, umbral y guardias
  • La línea base medida sobre tu operación, que antes probablemente nadie había calculado
  • El agente configurado y funcionando en tu entorno real, no en una demostración
  • Registro completo y consultable de lo que hizo el agente durante el mes
  • Reporte de cierre con cada número al lado de su punto de partida
  • Una recomendación por escrito con la salida que corresponde según lo acordado

El calendario del mes

01

Antes de empezar: acuerdo escrito

Se elige el agente, se escriben los criterios y se mide la línea base con tus datos históricos. Esta etapa decide si el piloto va a servir de algo.

02

Primeros días: implementación

Se enchufan tus datos, se fijan el tono y las reglas, y se prueba en interno. Se cobra a precio reducido, y es trabajo real que queda hecho si después continúas.

03

El grueso del mes: operación medida

El agente trabaja en condiciones reales, con tu gente supervisando, y los indicadores no se cambian a mitad de camino.

04

Cierre: reporte y decisión

Se comparan los números contra la línea base y se aplica el umbral, con el acuerdo del primer día delante.

El plan de piloto y los agentes a los que aplica, con precios en vivo

Las condiciones, sin letra pequeña

30 días Duración del ensayo, con el reporte comparativo entregado al cerrar
1 Uno solo por empresa; cubre los agentes de IA y deja fuera el nivel más autónomo de la vigilancia de red
8×5 Durante el mes, las personas que acompañan atienden de lunes a viernes en oficina

Elegir con qué agente probar

Empieza por el proceso que más te duele y que ya tenga datos, porque sin datos no hay línea base:

La vista general está en la página de agentes.

Preguntas frecuentes

¿Es gratis el piloto?

No. La implementación se cobra a precio reducido y la mensualidad del mes también; los importes vigentes están publicados en el catálogo de esta tienda. Un piloto gratuito suena mejor y funciona peor: nadie asigna tiempo de su gente a algo que no le costó nada.

¿Qué pasa al terminar si decido seguir?

El agente continúa sin corte y pasa a la tarifa plena publicada. No hay que volver a implementar nada: la configuración del piloto es la misma que sostiene la operación después.

¿Y si decido no seguir?

Se apaga y te quedas con el reporte y con la línea base medida. Lo pagado por implementar no se reembolsa: es trabajo ya hecho, y se advierte antes de firmar.

¿Puedo probar dos agentes a la vez?

Se ofrece uno solo por empresa, y hay una razón práctica: dos cambios simultáneos en la misma operación hacen imposible atribuir el resultado a ninguno. Primero se decide uno.

¿Aplica a la vigilancia de red?

Está pensado para los agentes de software del catálogo. El nivel más autónomo de Network Guardian queda fuera, porque ejecutar cambios pre-aprobados en una red requiere un historial de confianza que un mes no construye.

¿Cuánto tiempo de mi gente consume?

Hace falta alguien de tu lado que responda los escalamientos y revise el reporte semanal. Si nadie puede asumirlo, conviene mover el piloto a otro momento en vez de correrlo mal.

¿Quién escribe los criterios de éxito?

Los escribimos juntos y los firmas tú. Que el proveedor defina solo la vara con la que se le mide es la manera clásica de que todos los pilotos salgan bien y ninguno cambie nada.

Dónde encaja esto

«Piloto de 30 días» vive en agentes de inteligencia artificial. El recorrido entero empieza en Soluciones.

Definamos primero qué contaría como éxito

La conversación útil no empieza por qué agente quieres, sino por qué número quieres mover y cómo está ese número hoy. Con eso resuelto, elegir el agente es la parte fácil.