La lectura semanal
¿Quieres hablar de este ensayo? Escríbeme: amitkvint@gmail.comcopiado· o escríbeme por LinkedIn
El agente de IA que pusimos sobre una cola de unos 4.000 reportes al mes tenía un panel de métricas, una vía de escalado y un paso de clasificación por delante. Nada de eso es lo que lo mantuvo honesto.
Lo que lo mantuvo honesto fue una hora a la semana en la que dos personas se sentaban a leer lo que de verdad había contestado a los clientes.
Ya mencioné este bucle de pasada en el artículo sobre escalar soporte sin contratar, y prometí dedicarle un artículo propio cuando escribí sobre lo que no debería automatizarse nunca. Aquí está.
Quién leía
Yo, porque la calidad del conjunto era responsabilidad mía, igual que la decisión de si el agente podía asumir una parte mayor de la cola. Y un supporter con experiencia, porque necesitas a alguien que vea lo que a ti se te escaparía.
Ese emparejamiento no fue casual, y no lo haría con una sola persona.
Yo leía como responsable. Quería saber si el agente estaba listo para ampliar, y cuando quieres que algo esté listo, lees con un poco de generosidad. El supporter leía como alguien que había contestado miles de esos reportes a mano, y sabía qué aspecto tiene una respuesta correcta, qué aspecto tiene una respuesta técnicamente correcta pero inútil, y qué aspecto tiene una respuesta segura a un problema que todavía nadie ha resuelto. Esas tres se leen de forma muy distinta cuando las has vivido, y casi igual cuando no.
Qué buscábamos al leer
No si la conversación se había cerrado. Eso el panel ya lo sabía, y ya he escrito en otro sitio sobre por qué un ticket cerrado demuestra muy poco.
Leíamos las respuestas en sí, como las habría leído el cliente, y nos hacíamos una pregunta más sencilla: ¿yo habría enviado esto?
La IA fallaba de tres maneras generales: citaba la documentación equivocada, se mostraba demasiado segura ante un bug desconocido, o usaba el tono equivocado.
Los hallazgos útiles nunca fueron los fallos evidentes. Una respuesta claramente equivocada la escala el propio cliente y aparece sola en los números. Las que justificaban la hora eran las respuestas plausibles. El documento correcto enlazado para la versión equivocada del problema. Una respuesta tranquilizadora a un reporte que, para una persona que ya lo había visto antes, era claramente la primera señal de un bug para el que aún no teníamos solución. Una respuesta exacta que llegaba con un tono que la situación no merecía.
Ninguna de esas rebota limpiamente. El cliente prueba los pasos, no funcionan, y una semana después llega otro ticket con otro asunto. El marcador del agente, si lo hubiera tenido, habría contado un éxito.
Qué hacíamos con ello
Cada hallazgo volvía al sistema. Algunos eran huecos en la documentación: el agente contestaba con lo que tenía, y en ese rincón lo que tenía era poco. Otros eran problemas de clasificación, reportes marcados como AI Ready que no deberían haberlo sido, y así es como la línea entre agente y humano se fue moviendo durante meses, en las dos direcciones. Otros eran ajustes.
Lo importante no es en qué cajón caía cada uno. Lo importante es que el agente solo mejoró en los sitios donde alguien había leído una respuesta y había dicho, en voz alta, que no era suficientemente buena. Nada más nos lo dijo. Los números de la cola completa, que eran los que usábamos para decidir si el agente podía asumir más, nos avisaban de que algo iba mal. Nunca nos decían qué.
Por qué tiene que ser una hora recurrente
Es tentador tratarlo como una actividad de lanzamiento. Leer mucho las primeras semanas, corregir lo que aparece, y luego dejar que manden los números.
Las primeras semanas fueron, de hecho, cuando más leímos, y el periodo más intenso. Pero el bucle nunca se desmontó, y si dejas de leer cometes un error enorme.
Dos razones.
Los reportes cambian. Un plugin publica una versión nueva, un hosting cambia algo, un tipo de sitio nuevo se vuelve habitual, y una categoría de preguntas que el agente manejaba bien en marzo empieza a desviarse en septiembre. Los números acabarán mostrando esa deriva. La lectura la muestra la semana en que empieza.
Y las personas que leen cambian. El supporter que se sienta contigo aprende, desde dentro, en qué es bueno el agente y dónde se marca un farol. Ese conocimiento vuelve al equipo de una forma que ningún informe consigue. Cuando le llega un escalado con el historial del agente adjunto, ya sabe de qué partes de ese historial puede fiarse.
La parte a la que siempre vuelvo
Todas las conversaciones que oigo sobre operar IA en soporte van del modelo, los prompts, las integraciones y las métricas. Todo eso importa, y todo eso se puede comprar.
La hora, no. Necesita a alguien con suficiente experiencia para saber qué es una buena respuesta, con suficiente autoridad para decir que el agente no está listo para más, y con un jefe que trate esa reunión como la más importante de la semana y no como un extra.
Si vas a poner un agente sobre tu propia cola, yo pondría esa hora en el calendario antes de que el agente salga a producción, y desconfiaría mucho de cualquiera, incluido el proveedor, que te diga que después del primer mes ya no la vas a necesitar.
La vas a necesitar. La cola no ha dejado de cambiar. El agente tampoco, y alguien tiene que estar leyendo. :-)