Evaluador
Puntúa y evalúa la calidad del contenido con IA
El bloque Evaluador usa IA para puntuar y evaluar la calidad del contenido mediante métricas de evaluación personalizables que tú defines. Ideal para el control de calidad, las pruebas A/B y para garantizar que los resultados de tu IA cumplan con estándares específicos.
Descripción general
El bloque Evaluador te permite:
Puntúa la calidad del contenido: usa IA para evaluar el contenido según métricas personalizadas con puntuaciones numéricas
Define métricas personalizadas: crea criterios de evaluación específicos adaptados a tu caso de uso
Automatiza el control de calidad: crea flujos de trabajo que evalúen y filtren el contenido automáticamente
Haz seguimiento del rendimiento: supervisa las mejoras y la consistencia a lo largo del tiempo con puntuaciones objetivas
Cómo funciona
El bloque Evaluator procesa el contenido mediante una evaluación con IA:
- Recibir contenido - Toma el contenido de entrada de bloques anteriores de tu flujo de trabajo
- Aplicar métricas - Evalúa el contenido según las métricas personalizadas que definas
- Generar puntuaciones - El modelo de IA asigna puntuaciones numéricas a cada métrica
- Devolver puntuaciones - Devuelve valores numéricos con los nombres de métricas en minúsculas; no devuelve un resumen narrativo independiente.
Opciones de configuración
Métricas de evaluación
Define métricas personalizadas con las que evaluar el contenido. Cada métrica incluye:
- Nombre: un identificador corto para la métrica
- Descripción: una explicación detallada de lo que mide la métrica
- Rango: el rango numérico para la puntuación (p. ej., 1-5, 0-10)
Métricas de ejemplo:
Accuracy (1-5): How factually accurate is the content?
Clarity (1-5): How clear and understandable is the content?
Relevance (1-5): How relevant is the content to the original query?Contenido
El contenido que se va a evaluar. Puede ser:
- Proporcionado directamente en la configuración del bloque
- Conectado desde la salida de otro bloque (normalmente un bloque Agent)
- Generado dinámicamente durante la ejecución del flujo de trabajo
Selección del modelo
Elige un modelo de IA para realizar la evaluación:
OpenAI: GPT-4o, o1, o3, o4-mini, gpt-4.1 Anthropic: Claude 3.7 Sonnet Google: Gemini 2.5 Pro, Gemini 2.0 Flash Otros proveedores: Groq, Cerebras, xAI, DeepSeek Modelos locales: cualquier modelo que se ejecute en Ollama
Recomendación: usa modelos con sólidas capacidades de razonamiento, como GPT-4o o Claude 3.7 Sonnet, para obtener evaluaciones más precisas.
Clave de API
Tu clave de API del proveedor de LLM seleccionado. Se almacena de forma segura y se usa para la autenticación.
Cómo funciona
- El bloque Evaluator toma el contenido proporcionado y tus métricas personalizadas
- Genera un prompt especializado que indica al LLM que evalúe el contenido
- El prompt incluye pautas claras sobre cómo puntuar cada métrica
- El LLM evalúa el contenido y devuelve puntuaciones numéricas para cada métrica
- El bloque Evaluator da formato a estas puntuaciones como salida estructurada para usarlas en tu flujo de trabajo
Ejemplos de casos de uso
Evaluación de la calidad del contenido
Escenario: evaluar la calidad de una entrada de blog antes de publicarla
- El bloque Agente genera el contenido de la entrada de blog
- El evaluador evalúa la precisión, la legibilidad y el nivel de interacción
- El bloque Condición comprueba si las puntuaciones alcanzan los umbrales mínimos
- Puntuaciones altas → Publicar; puntuaciones bajas → Revisar y reintentar
Pruebas A/B de contenido
Escenario: comparar varias respuestas generadas por IA
- El bloque Paralelo genera varias variaciones de respuesta
- El evaluador puntúa cada variación según su claridad y relevancia
- El bloque Función selecciona la respuesta con la puntuación más alta
- El bloque Respuesta devuelve el mejor resultado
Control de calidad de la atención al cliente
Escenario: garantizar que las respuestas de soporte cumplan los estándares de calidad
- El agente de soporte genera una respuesta a la consulta del cliente
- El evaluador puntúa la utilidad, la empatía y la precisión
- Las puntuaciones se registran para el entrenamiento y el monitoreo del rendimiento
- Las puntuaciones bajas activan el proceso de revisión humana
Entradas y salidas
Contenido: el texto o los datos estructurados que se van a evaluar
Métricas de evaluación: criterios personalizados con rangos de puntuación
Modelo: modelo de IA para el análisis de la evaluación
Clave de API: autenticación para el proveedor de LLM seleccionado
evaluator.content: resumen de la evaluación
evaluator.model: modelo utilizado para la evaluación
evaluator.tokens: estadísticas de uso de tokens
evaluator.cost: resumen del costo de la llamada de evaluación
Puntuaciones de métricas: Salidas numéricas con los nombres de métricas en minúsculas
Acceso: disponible en los bloques posteriores al evaluador
Buenas prácticas
- Usa descripciones de métricas específicas: Define claramente qué mide cada métrica para obtener evaluaciones más precisas
- Elige rangos adecuados: Selecciona rangos de puntuación que ofrezcan suficiente granularidad sin ser demasiado complejos
- Conecta con bloques Agent: Usa bloques Evaluator para evaluar las salidas de los bloques Agent y crear bucles de retroalimentación
- Usa métricas consistentes: Para el análisis comparativo, mantén métricas consistentes entre evaluaciones similares
- Combina varias métricas: Usa varias métricas para obtener una evaluación integral