IdiomaENES
GuidesSep 7, 2026 · 9 min de lectura

Ocho preguntas antes de comprar un chat con IA

Todo producto de chat con IA queda bien en la demo. Estas son las ocho preguntas que revelan qué hará en el mes tres, y una checklist para correr en vivo.

Mauro CarreraFounder
Eight questions to ask an AI chat vendor before you buy, with the demo scorecard they should answer live
Eight questions to ask an AI chat vendor before you buy, with the demo scorecard they should answer live

Todo producto de chat con IA queda bien en la demo. Pegas una URL, lee tu sitio, responde tres preguntas cuya respuesta ya conocías, y todos en la sala asienten. Nada de esa media hora te dice qué hará la herramienta en el mes tres, cuando tenga 900 documentos, cuatro personas editándolos, y un cliente actuando sobre una respuesta que nadie revisó.

Esta es la lista para llevar a la demo. Está escrita para quien compra, no para quien vende, y algunas de estas preguntas las respondimos mal antes de responderlas bien.

El fallo que de verdad importa

A todos les preocupan las respuestas inventadas. Existen, y son las fáciles. Una respuesta inventada casi siempre es obviamente incorrecta.

El fallo caro es más silencioso. El asistente responde de forma plausible. Nadie lo revisa. Un cliente actúa sobre eso, y te enteras por el cliente.

InteractiveCómo viaja el fallo silencioso

Casi todas las preguntas de abajo son una forma de preguntar lo mismo: cuando eso pasa, cuánto tardas en encontrar la causa.

Pregunta 1: ¿Puede mostrarte de dónde salió la respuesta?

No si suena seguro. Si puede nombrar el documento, e idealmente el fragmento.

La cita se vende como una señal de confianza para tus visitantes. Lo es. Pero le sirve más a quien mantiene tu contenido.

Una respuesta incorrecta que cita politica-de-envios.pdf te dice exactamente qué editar. Una respuesta incorrecta que no cita nada te deja reescribiendo prompts con la esperanza de acertar.

Dos documentos con nombre. Si la ventana está mal, ya sabes qué archivo abrir.

Una buena respuesta lleva sus fuentes, las fuentes son las que realmente se usaron y no todo lo recuperado, y puedes abrir el fragmento.

Pregunta 2: ¿Puedes ver por qué se eligieron esos fragmentos?

Esta es la pregunta que casi nada en el mercado responde, y es la que decide si puedes arreglar una respuesta mala por tu cuenta.

La recuperación es una búsqueda. Las búsquedas tienen scores. Si puedes leer el score de cada fragmento recuperado, una respuesta mala se clasifica en uno de tres grupos en unos diez segundos.

Lo que ves
Qué está roto
Siguiente paso
El primer fragmento puntuó alto y la respuesta sigue mal
Tu contenido está mal o se contradice
Corrige los documentos
El primer fragmento puntuó bajo y respondió con seguridad
La recuperación falló y el modelo lo tapó
Ajusta la recuperación
No se recuperó nada
El contenido no está indexado, o está en otro idioma
Revisa la ingesta de documentos
Nada de esto habla de devoluciones, y lo mejor puntuó 0.19. La respuesta que salió de ahí igual estaba escrita en oraciones completas.

Una advertencia de nuestros propios registros: en contenido real, un fragmento genuinamente relevante suele puntuar entre 0.35 y 0.60, no el 0.80 que sugieren los tutoriales.

Un threshold copiado desactiva media búsqueda en silencio

Un umbral de similitud copiado de un blog puede apagar la mitad semántica de una búsqueda híbrida. El producto sigue funcionando. Solo que se convierte en búsqueda por palabras clave mientras pagas por embeddings.

Pregunta cuál es el threshold por defecto, y qué scores reales se ven en contenido como el tuyo. Si no te lo pueden decir, ellos tampoco lo están mirando.

Pregunta 3: ¿Qué hace cuando tu contenido no cubre la pregunta?

Hay exactamente dos diseños, y el proveedor eligió uno, lo diga o no.

Diseño uno. Responder con el conocimiento general del modelo. Fluido, de vez en cuando correcto, y tarde o temprano inventará tu ventana de devolución.

Diseño dos. Decir que no lo sabe y derivar a una persona. Menos impresionante en una demo. Correcto en producción.

El diseño de la derecha es el que quieres, y el que gana menos demos.

El segundo diseño no debería ser un prompt que escribes y esperas que funcione. Pregunta si es un ajuste, si se aplica de forma obligatoria, y si se puede configurar una vez para toda la cuenta en lugar de por asistente.

Pregunta 4: ¿Dónde puede correr, y quién puede hacerlo correr?

Una clave de widget vive en HTML público. Eso está bien, siempre que la clave esté atada a algo.

Pregunta:

  • ¿Puedo listar los dominios en los que tiene permitido responder, incluido staging?
  • ¿Qué pasa cuando alguien toma la clave y la pone en su propio sitio?
  • ¿Puedo rotar la clave sin volver a desplegar?

*.example.com cubriendo subdominios, y un rechazo tajante desde cualquier otro lado, es la respuesta que quieres.

Staging cuenta como dominio

Un host de preview es un origen distinto al de producción, así que necesita su propia entrada. Pregunta hasta qué nivel llega el comodín antes de asumir que cubre app.eu.example.com.

Pregunta 5: ¿Captura al visitante o solo le responde?

Un asistente que responde una pregunta de preventa y deja que el visitante se vaya de forma anónima te costó el lead y encima te cobró por el privilegio.

La distinción que vale la pena indagar es cómo lo pide. Un formulario metido en el panel de chat sigue siendo un formulario. Un asistente que pide un nombre y un email dentro de la conversación, mientras responde lo que el visitante realmente preguntó, convierte distinto.

Si cada respuesta se guarda en el momento en que llega, alguien que se va a mitad de camino igual te deja dos campos reales en lugar de nada.

Pregunta 6: ¿Encaja con el stack que ya tienes?

Dos preguntas de integración se confunden constantemente.

Contenido que entra. Cómo llega tu material al asistente, y cómo se mantiene al día cuando lo editas. Un plugin, un crawler, una API o un webhook.

Leads que salen. Dónde aterriza un lead capturado. Tu CRM, tu lista de correo, tu gestor de proyectos.

Pide las dos, y pide la lista de integraciones por escrito.

Pregunta 7: ¿Están escritos los límites?

"Contáctanos para volumen" también es un límite. Solo que no está escrito en ningún lugar que puedas leer antes de firmar.

Consigue los números antes de comprometerte:

  • ¿Qué cuenta como respuesta facturable? ¿Una pregunta abandonada? ¿Una prueba de tu propio equipo?
  • ¿Qué pasa al 100% de tu plan? ¿Se detienen las respuestas, o te facturan a una tarifa que nunca aceptaste?
  • ¿Cuánto tiempo se guarda el historial de analíticas?
  • ¿Quién paga las llamadas al modelo, y puedes traer tu propia clave?

Sea el proveedor que elijas, pide el equivalente por escrito.

Pregunta 8: ¿Qué pasa con tu contenido?

La checklist:

  • ¿Se usa mi contenido para entrenar el modelo de alguien? (La respuesta debería ser no.)
  • ¿Están cifradas mis credenciales guardadas, y alguien puede volver a leerlas? (Cifradas, y nadie, incluido tú.)
  • ¿Se guardan las direcciones IP de los visitantes?
  • ¿Puede un workspace alcanzar alguna vez las filas de otro, y eso se aplica en la base de datos o en el código de la aplicación?
  • ¿Hay un registro de auditoría de quién cambió qué?

Consigue las respuestas por escrito, y pide la política de privacidad detrás de ellas en lugar de un resumen en un email.

La checklist para la demo

Lleva esto a la próxima demo y hazlos responder en vivo, no en un email de seguimiento.

  • Muéstrame una respuesta con sus fuentes, y abre uno de los fragmentos.
  • Muéstrame el score de similitud de cada fragmento que recuperaste.
  • Pregúntale algo que mi contenido no cubre, sin editar mi contenido primero.
  • Pon la clave del widget en un dominio que no esté en la lista permitida.
  • Muéstrame dónde aterriza un lead capturado en mi CRM.
  • Muéstrame la página donde los límites de mi plan están escritos como números.
  • Dime qué pasa el día que llegue al 100% de ellos.

Una herramienta que puede hacer los siete en una llamada en vivo es una herramienta cuyo equipo la ha corrido en producción. Una herramienta que necesita responderte después en tres de ellos es una herramienta que vas a depurar a ciegas en el mes tres.

Preguntas frecuentes

¿Y si el proveedor no puede responder esto en vivo?

Un email de seguimiento significa que no están seguros de la respuesta, o que no está en el producto. En cualquier caso, vas a pasar más tiempo depurando del que habrías pasado en esa demo.

¿Puedo usar esto con cualquier producto de chatbot?

Sí. Lleva las ocho preguntas y la checklist a cualquier demo. El producto que responde los siete en vivo es el que tiene un equipo que sabe qué construyó.

¿Cuánto debería durar la demo?

Si conocen bien el producto, los siete puntos de la checklist deberían tomar veinte minutos. Reserva una hora si quieres entrar en el razonamiento detrás de cada respuesta.

Empieza por la documentación y los casos de uso del proveedor para ver cómo resolverían tu trabajo, y corre la checklist cuando hables con ellos.

Etiquetadobuying-guidecitationsretrievalevaluationsecurity
Escrito porMauro CarreraBuilds WelcomeAI. Spends most days reading similarity scores that should have been higher.

Sigue leyendo