Base de conocimientos
La base de conocimientos te permite subir, procesar y buscar en tus documentos con búsqueda vectorial inteligente y fragmentación. Los documentos de diversos tipos se procesan, se convierten en embeddings y quedan disponibles para búsqueda de forma automática. Tus documentos se fragmentan de manera inteligente, y puedes verlos, editarlos y buscarlos mediante consultas en lenguaje natural.
Carga y procesamiento
Solo tienes que subir tus documentos para empezar. TradingGoose los procesa automáticamente en segundo plano: extrae el texto, crea los embeddings y los divide en fragmentos que se pueden buscar.
El sistema gestiona todo el flujo de procesamiento por ti:
- Extracción de texto: El contenido se extrae de tus documentos mediante analizadores especializados para cada tipo de archivo
- Fragmentación inteligente: Los documentos se dividen en fragmentos significativos con tamaño y superposición configurables
- Generación de embeddings: Se crean embeddings vectoriales para habilitar la búsqueda semántica
- Estado del procesamiento: Sigue el progreso mientras se procesan tus documentos
Tipos de archivo compatibles
TradingGoose admite archivos PDF, Word (DOC/DOCX), texto sin formato (TXT), Markdown (MD), HTML, Excel (XLS/XLSX), PowerPoint (PPT/PPTX) y CSV. Cada archivo puede pesar hasta 100MB, con un rendimiento óptimo para archivos de menos de 50MB. Puedes subir varios documentos a la vez, y los archivos PDF incluyen procesamiento OCR para documentos escaneados.
Visualización y edición de fragmentos
Una vez procesados tus documentos, puedes ver y editar los fragmentos individuales. Esto te da control total sobre cómo se organiza y se busca tu contenido. La vista de fragmentos muestra el contenido de texto de cada fragmento, su índice dentro del documento y las etiquetas asociadas.
Configuración de fragmentos
- Tamaño de fragmento predeterminado: 1,024 tokens estimados para el fragmentador de texto, con aproximadamente cuatro caracteres por token
- Rango configurable: 100-4,000 para el ajuste de tamaño; no es un límite de caracteres
- Superposición: El fragmentador de texto antepone hasta 200 palabras del fragmento anterior de forma predeterminada; esto puede aumentar el tamaño final
- División jerárquica: Respeta la estructura del documento (secciones, párrafos, oraciones)
Estas unidades corresponden al fragmentador de texto. Los formatos estructurados usan fragmentadores específicos, por lo que el ajuste no es un límite universal de la longitud final del texto.
Capacidades de edición
- Editar el contenido del fragmento: Modifica el contenido de texto de fragmentos individuales
- Añadir fragmentos: Crea fragmentos adicionales cuando sea necesario; no hay controles específicos para combinar o dividir fragmentos
- Etiquetas de documentos: Organiza los documentos mediante sus campos de etiquetas
- Operaciones masivas: Habilita, deshabilita o elimina los fragmentos seleccionados
Procesamiento avanzado de PDF
Para documentos PDF, TradingGoose ofrece capacidades de procesamiento mejoradas:
Compatibilidad con OCR
Cuando se configura con Azure o Mistral OCR:
- Procesamiento de documentos escaneados: Extrae texto de PDF basados en imágenes
- Manejo de contenido mixto: Procesa PDF con texto e imágenes
- Alta precisión: Los modelos avanzados de IA garantizan una extracción de texto precisa
Uso del bloque de conocimiento en flujos de trabajo
Una vez procesados los documentos, añade un bloque Knowledge, selecciona una base de conocimiento y configura una consulta. Para usar los resultados en generación aumentada por recuperación (RAG), referencia explícitamente los resultados del bloque en el prompt del Agent posterior, por ejemplo <knowledge.results> si el bloque se llama knowledge. Conectar los bloques no inyecta el contenido recuperado.
El bloque Knowledge admite búsquedas solo con consulta, solo con etiquetas y combinadas. En el modo avanzado, configura filtros de igualdad de texto; el bloque los convierte al contrato filters de la API. Varios valores de una etiqueta se combinan con OR, y distintas etiquetas con AND. Se rechazan las etiquetas desconocidas y los operadores no compatibles. Las etiquetas organizan la búsqueda, pero no son una barrera de control de acceso. Consulta Etiquetas y filtrado.
Características del bloque de conocimiento
- Búsqueda semántica: Encuentra contenido relevante usando consultas en lenguaje natural
- Integración de contexto: Referencia explícitamente los fragmentos recuperados en los prompts de los agentes
- Recuperación dinámica: La búsqueda ocurre en tiempo real durante la ejecución del flujo de trabajo
- Puntuación de relevancia: Resultados clasificados por similitud semántica
Opciones de integración
- Prompts del sistema: Proporciona contexto a tus agentes de IA
- Contexto dinámico: Busca e incluye información relevante durante las conversaciones
- Búsqueda en varios documentos: Consulta en toda tu base de conocimiento
- API de búsqueda filtrada: Combina la búsqueda vectorial con etiquetas mediante el campo
filtersde la API; sigue aplicándose la limitación del bloque descrita arriba
Tecnología de búsqueda vectorial
TradingGoose utiliza búsqueda vectorial impulsada por pgvector para comprender el significado y el contexto de tu contenido:
Comprensión semántica
- Búsqueda contextual: Encuentra contenido relevante incluso cuando las palabras clave exactas no coinciden
- Recuperación basada en conceptos: Comprende las relaciones entre ideas
- Compatibilidad con varios idiomas: Funciona en distintos idiomas
- Reconocimiento de sinónimos: Encuentra términos y conceptos relacionados
Funciones de búsqueda
- Consultas en lenguaje natural: Haz preguntas en lenguaje natural
- Búsqueda por similitud: Encuentra contenido conceptualmente similar
- Búsqueda vectorial filtrada por etiquetas: Restringe la búsqueda semántica a documentos etiquetados; no es una búsqueda híbrida de palabras clave y vectores
- Resultados configurables: Solicita entre 1 y 100 fragmentos con
topK(predeterminado: 10). Los umbrales de similitud se seleccionan internamente y no son configurables por el usuario
Gestión de documentos
Funciones de organización
- Carga masiva: Sube varios archivos a la vez mediante la API asíncrona
- Estado de procesamiento: Actualizaciones en tiempo real sobre el procesamiento de documentos
- Búsqueda y filtrado: Encuentra documentos rápidamente en colecciones grandes
- Seguimiento de metadatos: Captura automática de la información de los archivos y los detalles de procesamiento
Seguridad y privacidad
- Almacenamiento seguro: Documentos almacenados con seguridad de nivel empresarial
- Control de acceso: Permisos basados en el espacio de trabajo
- Aislamiento del procesamiento: Cada espacio de trabajo tiene un procesamiento de documentos aislado
- Eliminación de documentos: Elimina los documentos cuando ya no los necesites; no hay políticas configurables de retención automática de documentos
Primeros pasos
- Ve a tu base de conocimiento: Accede desde la barra lateral de tu espacio de trabajo
- Sube documentos: Arrastra y suelta o selecciona los archivos que quieras subir
- Supervisa el procesamiento: Observa cómo se procesan y fragmentan los documentos
- Explora los fragmentos: Consulta y edita el contenido procesado
- Añádelo a los flujos de trabajo: Usa el bloque Knowledge para integrarlo con tus agentes de IA
La base de conocimiento transforma tus documentos estáticos en un recurso inteligente y consultable que tus flujos de trabajo de IA pueden aprovechar para generar respuestas más informadas y contextuales.