Guías prácticas detalladas

Medir la latencia útil de un agente IA

Cronometrar tareas completas, conservar fallos y separar rapidez aparente y resultado aceptado.

Actualización :

Puesto de pruebas y botón de parada. Escena ilustrativa.

Ilustración generada por IA · Puesto de pruebas y botón de parada. Escena ilustrativa.

¿Cuándo se puede utilizar el resultado?

Primer contenido, fin de generación y validación humana son eventos distintos. La comparación define límites y salida esperada. No clasifica proveedores: organiza mediciones locales reproducibles.

  1. Definir límites

    Precisar envío, primer contenido, herramientas terminadas, entrega o validación. Usar reloj adecuado para duraciones. No restar relojes de máquinas distintas sin sincronización conocida.

  2. Fijar escenario

    Conservar entrada, instrucciones, versión, permisos y caché. Separar primeras llamadas y repeticiones. Registrar la parte de herramientas externas.

  3. Conservar fallos

    Anotar duraciones, intentos, reintentos y expiraciones. Publicar cantidad y distribución. Una tarea abandonada sigue visible aunque no termine.

  4. Comparar calidad aceptada

    Aplicar igual criterio y contar correcciones y revisión. Una salida rápida inválida no ahorra tiempo útil. Indicar esfuerzo humano.

Situaciones y decisiones

Situaciones tipo para preparar un control. No describen misiones realizadas ni observaciones reales.

Respuesta en dos segundos

Ejemplo ficticio: texto a 2 s, herramientas a 12 s y validación a 90 s. Separar etapas en vez de anunciar tarea completa a 2 s.

Media sin expiraciones

Ensayo ilustrativo: 9 éxitos y 1 expiración. Las duraciones correctas no describen diez peticiones. Publicar éxito y exclusiones.

Prueba que conservar

  • Límites y unidades
  • Versiones, entrada y caché
  • Duraciones, fallos y reintentos
  • Calidad y tiempo humano

Referencias oficiales

Protocolos relacionados

Comprobaciones antes de concluir

  • ¿Son iguales los límites?
  • ¿Se registra la caché?
  • ¿Son visibles los fallos?
  • ¿La calidad se evalúa igual?

Tiempos por etapa vinculados a calidad, fallos y validación.

Preguntas frecuentes

¿Medir el primer fragmento?

Sí para rapidez percibida. Añadir fin y validación para distinguir primera visualización y resultado útil.

¿Bastan dos medias?

Ocultan dispersión y fallos. Incluir cantidad, condiciones, mediana o distribución y tasa de resultados aceptados.

HERRAMIENTAS / REGISTROS

Redactar un registro

Influyen tarea, carga, red y herramientas. Percentiles de pocos ensayos son frágiles. No prometer disponibilidad general a partir de pruebas locales.

  • Fecha de consulta y zona horaria
  • URL exacta
  • Tarea / etapa del recorrido
  • Versión / revisión
  • Eventos inicial y final
  • Duraciones por etapa y unidad
  • Fallos, expiraciones y reintentos
  • Repeticiones y dependencia entre observaciones
  • Criterio de validación
  • Límite / incertidumbre
  • Decisión / próxima acción
  • Responsable del control
  • Próximo control