Los chatbots genéricos inventan respuestas porque no saben lo que no saben. Aquí tienes el diagnóstico técnico honesto y las preguntas que debes hacer antes de comprar cualquier solución.
Por qué un chatbot "inteligente" te inventa respuestas
Un modelo de lenguaje grande (LLM) no busca información. Predice texto. Cuando le preguntas algo, genera la respuesta estadísticamente más probable dado su entrenamiento. Si la respuesta correcta no estaba en sus datos de entrenamiento, o si esos datos son de hace meses, el modelo no dice "no sé". Rellena el hueco con algo que suena plausible. Eso es una alucinación.
No es un bug. Es el funcionamiento normal del sistema. El problema aparece cuando ese sistema se presenta como un asistente de atención al cliente que "conoce tu negocio".
Un chatbot genérico conectado a GPT-4 sin más contexto que el nombre de tu empresa va a inventar precios, plazos de entrega, políticas de devolución y condiciones de servicio. Lo hará con total confianza. Y tu cliente lo va a creer.
El problema técnico real: falta de contexto verificable
Los LLMs tienen dos limitaciones estructurales que ningún prompt bonito soluciona:
- Fecha de corte del entrenamiento. El modelo no sabe nada de lo que ocurrió después de su última actualización. Tu catálogo actualizado, tus nuevas tarifas, tus condiciones actuales: invisibles para él.
- Ausencia de fuente de verdad propia. El modelo no tiene acceso a tus documentos internos. Genera texto basado en patrones generales del idioma, no en tu información específica.
El resultado práctico: el chatbot responde con autoridad sobre cosas que no conoce. Y cuanto más confiado suena, más daño hace.
Qué es RAG y por qué cambia la ecuación
RAG significa Retrieval-Augmented Generation: generación aumentada por recuperación. La idea es simple aunque la implementación no lo es: antes de que el LLM genere una respuesta, el sistema recupera fragmentos relevantes de una base de conocimiento real y los inyecta como contexto verificable.
El flujo conceptual es este: la pregunta del usuario activa una búsqueda semántica sobre tus documentos. Los fragmentos más relevantes se pasan al modelo junto con la pregunta. El modelo responde basándose en esos fragmentos, no en sus suposiciones.
La diferencia crítica: si la información no está en tus documentos, un sistema RAG bien construido puede decir "no tengo esa información" en lugar de inventarla. Eso es exactamente lo que necesitas en un entorno de negocio real.
Lo que he visto que falla en implementaciones reales
He construido chatbots RAG sobre corpus legales de 12 países (TuAbogaBot.io), sobre herramientas para profesores (IAprofesor.com) y para sellers de Amazon (ShopiaTools.com). En todos esos proyectos, los puntos de fallo más habituales no son los que venden los demos:
- Documentos mal estructurados. Si tus PDFs son escaneos sin OCR limpio, o si tus FAQs están en un Excel con celdas combinadas, el retrieval falla antes de que el LLM entre en escena. Basura entra, basura sale.
- Chunking mal calibrado. Los documentos se dividen en fragmentos para indexarlos. Si los fragmentos son demasiado grandes o demasiado pequeños, la búsqueda semántica devuelve contexto irrelevante o incompleto. El modelo entonces alucina para rellenar los huecos.
- Sin guardrails de salida. Un sistema RAG sin validación de respuesta puede mezclar el contexto recuperado con conocimiento general del modelo de formas inesperadas. El resultado: respuestas parcialmente correctas que son más peligrosas que las completamente incorrectas.
- Sin handoff humano. Cuando el chatbot no sabe algo, necesita un mecanismo para escalar a una persona real. Si no existe, el sistema improvisa. Siempre.
Las preguntas que debes hacer antes de comprar
Cualquier proveedor de chatbots va a usar la palabra RAG en su pitch. Aquí tienes las preguntas que separan una implementación real de un wrapper de ChatGPT con una interfaz bonita:
- ¿Cómo se indexan mis documentos? Pregunta por el proceso de chunking, el tipo de embeddings y cómo se gestiona la actualización del índice cuando cambias un documento. Si no saben responder con detalle, no hay RAG real.
- ¿Qué pasa cuando el chatbot no encuentra la respuesta en mis documentos? La respuesta correcta es que el sistema lo indica explícitamente o escala. Si dicen "el modelo siempre encuentra algo útil", es una señal de alarma.
- ¿Puedo ver ejemplos de respuestas incorrectas que el sistema ha dado? Todo sistema falla. Un proveedor honesto tiene logs, puede mostrarte errores reales y explicar qué los causó. Si solo muestran demos perfectos, desconfía.
- ¿Hay algún mecanismo de handoff a un humano? Y si lo hay, ¿cómo funciona? ¿Es automático por tipo de pregunta, por nivel de confianza de la respuesta, o manual?
- ¿Los datos de mis documentos se usan para entrenar modelos externos? Pregunta explícita sobre privacidad y dónde se almacenan tus embeddings. En muchos setups cloud, tus documentos pasan por infraestructura de terceros sin que lo sepas.
Qué distingue una implementación seria
Un chatbot RAG bien construido para una PYME tiene que resolver tres cosas al mismo tiempo: recuperar contexto relevante de tus documentos, generar respuestas que no salgan de ese contexto, y saber cuándo no puede responder y qué hacer en ese caso.
Eso requiere decisiones de diseño en cada capa: cómo se preparan los documentos, cómo se indexan, cómo se validan las respuestas antes de enviarlas al usuario, y qué ocurre cuando el sistema detecta una pregunta fuera de su alcance.
Si alguien te ofrece un chatbot RAG por un precio simbólico con setup en 24 horas, pregúntate cuál de esas capas está omitiendo. Normalmente es la validación de salida y el handoff humano, que son exactamente las que protegen a tu negocio cuando el sistema falla.
El POC de 7 días que ofrezco para los chatbots personalizados existe precisamente por esto: para que veas el sistema funcionando sobre tus documentos reales, con tus preguntas reales, antes de comprometerte con nada. Desde 158€ puedes comprobar si lo que te ofrezco aguanta en condiciones reales. Si no aguanta, no hay contrato.