Evaluador

Puntúa y evalúa la calidad del contenido con IA

El bloque Evaluador usa IA para puntuar y evaluar la calidad del contenido mediante métricas de evaluación personalizables que tú defines. Ideal para el control de calidad, las pruebas A/B y para garantizar que los resultados de tu IA cumplan con estándares específicos.

Métricas de evaluación*
Métricas de evaluación
Contenido*
Introduce el contenido a evaluar
Modelo*
Escribe o selecciona un modelo...
Clave de API*
••••••••
Punto de conexión de Azure OpenAI
••••••••
Versión de la API de Azure
2024-07-01-preview

Descripción general

El bloque Evaluador te permite:

Puntúa la calidad del contenido: usa IA para evaluar el contenido según métricas personalizadas con puntuaciones numéricas

Define métricas personalizadas: crea criterios de evaluación específicos adaptados a tu caso de uso

Automatiza el control de calidad: crea flujos de trabajo que evalúen y filtren el contenido automáticamente

Haz seguimiento del rendimiento: supervisa las mejoras y la consistencia a lo largo del tiempo con puntuaciones objetivas

Cómo funciona

El bloque Evaluator procesa el contenido mediante una evaluación con IA:

  1. Recibir contenido - Toma el contenido de entrada de bloques anteriores de tu flujo de trabajo
  2. Aplicar métricas - Evalúa el contenido según las métricas personalizadas que definas
  3. Generar puntuaciones - El modelo de IA asigna puntuaciones numéricas a cada métrica
  4. Devolver puntuaciones - Devuelve valores numéricos con los nombres de métricas en minúsculas; no devuelve un resumen narrativo independiente.

Opciones de configuración

Métricas de evaluación

Define métricas personalizadas con las que evaluar el contenido. Cada métrica incluye:

  • Nombre: un identificador corto para la métrica
  • Descripción: una explicación detallada de lo que mide la métrica
  • Rango: el rango numérico para la puntuación (p. ej., 1-5, 0-10)

Métricas de ejemplo:

Accuracy (1-5): How factually accurate is the content?
Clarity (1-5): How clear and understandable is the content?
Relevance (1-5): How relevant is the content to the original query?

Contenido

El contenido que se va a evaluar. Puede ser:

  • Proporcionado directamente en la configuración del bloque
  • Conectado desde la salida de otro bloque (normalmente un bloque Agent)
  • Generado dinámicamente durante la ejecución del flujo de trabajo

Selección del modelo

Elige un modelo de IA para realizar la evaluación:

OpenAI: GPT-4o, o1, o3, o4-mini, gpt-4.1 Anthropic: Claude 3.7 Sonnet Google: Gemini 2.5 Pro, Gemini 2.0 Flash Otros proveedores: Groq, Cerebras, xAI, DeepSeek Modelos locales: cualquier modelo que se ejecute en Ollama

Recomendación: usa modelos con sólidas capacidades de razonamiento, como GPT-4o o Claude 3.7 Sonnet, para obtener evaluaciones más precisas.

Clave de API

Tu clave de API del proveedor de LLM seleccionado. Se almacena de forma segura y se usa para la autenticación.

Cómo funciona

  1. El bloque Evaluator toma el contenido proporcionado y tus métricas personalizadas
  2. Genera un prompt especializado que indica al LLM que evalúe el contenido
  3. El prompt incluye pautas claras sobre cómo puntuar cada métrica
  4. El LLM evalúa el contenido y devuelve puntuaciones numéricas para cada métrica
  5. El bloque Evaluator da formato a estas puntuaciones como salida estructurada para usarlas en tu flujo de trabajo

Ejemplos de casos de uso

Evaluación de la calidad del contenido

Escenario: evaluar la calidad de una entrada de blog antes de publicarla

  1. El bloque Agente genera el contenido de la entrada de blog
  2. El evaluador evalúa la precisión, la legibilidad y el nivel de interacción
  3. El bloque Condición comprueba si las puntuaciones alcanzan los umbrales mínimos
  4. Puntuaciones altas → Publicar; puntuaciones bajas → Revisar y reintentar

Pruebas A/B de contenido

Escenario: comparar varias respuestas generadas por IA

  1. El bloque Paralelo genera varias variaciones de respuesta
  2. El evaluador puntúa cada variación según su claridad y relevancia
  3. El bloque Función selecciona la respuesta con la puntuación más alta
  4. El bloque Respuesta devuelve el mejor resultado

Control de calidad de la atención al cliente

Escenario: garantizar que las respuestas de soporte cumplan los estándares de calidad

  1. El agente de soporte genera una respuesta a la consulta del cliente
  2. El evaluador puntúa la utilidad, la empatía y la precisión
  3. Las puntuaciones se registran para el entrenamiento y el monitoreo del rendimiento
  4. Las puntuaciones bajas activan el proceso de revisión humana

Entradas y salidas

  • Contenido: el texto o los datos estructurados que se van a evaluar

  • Métricas de evaluación: criterios personalizados con rangos de puntuación

  • Modelo: modelo de IA para el análisis de la evaluación

  • Clave de API: autenticación para el proveedor de LLM seleccionado

  • evaluator.content: resumen de la evaluación

  • evaluator.model: modelo utilizado para la evaluación

  • evaluator.tokens: estadísticas de uso de tokens

  • evaluator.cost: resumen del costo de la llamada de evaluación

  • Puntuaciones de métricas: Salidas numéricas con los nombres de métricas en minúsculas

  • Acceso: disponible en los bloques posteriores al evaluador

Buenas prácticas

  • Usa descripciones de métricas específicas: Define claramente qué mide cada métrica para obtener evaluaciones más precisas
  • Elige rangos adecuados: Selecciona rangos de puntuación que ofrezcan suficiente granularidad sin ser demasiado complejos
  • Conecta con bloques Agent: Usa bloques Evaluator para evaluar las salidas de los bloques Agent y crear bucles de retroalimentación
  • Usa métricas consistentes: Para el análisis comparativo, mantén métricas consistentes entre evaluaciones similares
  • Combina varias métricas: Usa varias métricas para obtener una evaluación integral