Sistema de base de conocimientos RAG - Integración inteligente de chatbot

Preguntas y respuestas basadas en RAG con integración de documentos, FAQ y noticias

2025-2026 Personal Project

Descripción del proyecto

Este proyecto implementa un sistema completo de base de conocimientos usando tecnología Retrieval-Augmented Generation (RAG) para preguntas y respuestas inteligentes en el chatbot. El sistema integra documentos, FAQs y artículos de noticias para proporcionar respuestas basadas en contexto usando modelos OpenAI. Cuenta con recuperación híbrida, un orquestador agéntico, un almacén vectorial dedicado con herramientas MCP, formato TOON para formateo eficiente de contexto, almacenamiento automático de preguntas sin respuesta e integración perfecta con el sistema de gestión de documentos.

Características principales

Generación de respuestas basada en RAG

Modelos OpenAI con respuestas JSON estructuradas

Búsqueda vectorial

Búsqueda de similitud de documentos basada en embeddings

Integración de documentos

Indexación y vectorización automática de documentos

Integración de FAQ

Búsqueda de FAQ basada en palabras clave con puntuación

Integración de noticias

Búsqueda de artículos de noticias como fuente de información de respaldo

Gestión de preguntas

Almacenamiento y gestión automática de preguntas sin respuesta

Orquestador agéntico

Agente de chat multi-paso que planifica la recuperación y el uso de herramientas

Recuperación híbrida

Combinar señales de palabras clave y vectoriales para un mejor anclaje

Almacén vectorial y herramientas MCP

Índice vectorial persistente con herramientas de recuperación accesibles vía MCP

Stack tecnológico

Framework backend

Laravel 11
PHP 8.2+
MySQL

IA & ML

OpenAI GPT-4o-mini
Embeddings vectoriales
Tecnología RAG

Frontend

Livewire
Alpine.js
Bootstrap

Gestión de datos

Vector Store
Formato TOON
JSON Schema

Flujo de trabajo

  1. Consulta del usuario: El usuario hace una pregunta en el chatbot
  2. Búsqueda de FAQ: El sistema busca en archivos FAQ con coincidencia de palabras clave y puntuación
  3. Búsqueda en base de conocimientos: Si la puntuación FAQ es baja, el sistema busca en documentos vectorizados
  4. Formateo de contexto: Los resultados de búsqueda se formatean como TOON (Token-Oriented Object Notation)
  5. Generación de respuesta: OpenAI GPT-4o-mini genera respuesta basada en contexto con esquema JSON
  6. Mostrar fuentes: Las fuentes de documentos relevantes se muestran con información de chunk
  7. Almacenamiento de preguntas: Si no se encuentra respuesta, la pregunta se almacena automáticamente para revisión
  8. Respaldo de noticias: Si no hay coincidencia de documento, el sistema busca en artículos de noticias
  9. Ruta agéntica: El orquestador selecciona herramientas, recuperación híbrida y consultas al almacén vectorial