# Modelos, y cuál usar > Qué cambia la elección de modelo, qué no cambia, y cómo mantener el coste con sentido. Source: https://welcomeai.dev/es/docs/ai-models Category: Empieza aquí Updated: 2026-09-06 --- En cada respuesta intervienen dos modelos distintos, y hacen trabajos que no tienen nada que ver. ## El modelo de embeddings Convierte tu contenido en números para que las preguntas puedan encontrarlo. Se ejecuta una vez por fragmento al indexar un documento, y una vez por pregunta. Nunca escribe nada. Cambiarlo obliga a reindexar todo, porque los vectores de dos modelos distintos no son comparables. Elige uno y déjalo en paz salvo que tengas un motivo. ## El modelo que responde Lee los pasajes que encontró la recuperación y escribe la respuesta. Este es el que eliges por base de conocimiento, y el que limita tu plan. Los modelos más grandes escriben mejor: siguen las instrucciones con más exactitud, manejan una pregunta que abarca tres pasajes y dicen "el contenido no cubre esto" en vez de inventarse algo. También cuestan más por respuesta y tardan más en arrancar. **Lo que el modelo no cambia es qué se recuperó.** Si el pasaje correcto no se encontró, ningún modelo puede responder desde él. Mira el contexto recuperado antes que el modelo: una respuesta mala es mucho más a menudo un problema de recuperación, y subir de modelo para arreglar uno sale caro y no funciona. ## La ventana de contexto Cada modelo tiene un límite de cuánto puede tener presente a la vez, que se llama su **ventana de contexto**. Todo lo que se envía para una respuesta tiene que caber ahí: los pasajes que encontró la recuperación, la conversación hasta ese punto, tus instrucciones y la pregunta. Rara vez lo vas a alcanzar. Top K limita cuántos pasajes entran, y una conversación se recorta a los últimos turnos antes de enviarse. Importa en dos sitios: un Top K muy alto sobre una base de documentos largos, y un chat que lleva una hora abierto. En ambos se descarta primero lo más antiguo, así que un asistente que "olvida" lo que se dijo al principio de una conversación larga no está roto: se quedó sin sitio, y la solución es un modelo con una ventana más grande. ## Un valor por defecto razonable Usa el modelo más barato que responda bien a tus preguntas, y compruébalo haciendo las mismas preguntas reales en el Playground con cada uno. En una base bien organizada que responde preguntas de hecho, un modelo pequeño suele ser indistinguible. En preguntas que exigen conciliar varios pasajes, o un tono cuidado, la diferencia se nota enseguida. ## Lo que cuesta El coste es por token, y se cuentan las dos direcciones: la pregunta más cada pasaje recuperado que entra, y la respuesta que sale. La salida cuesta unas cinco veces la entrada. Eso tiene una consecuencia práctica: **Top K es un ajuste de coste además de uno de calidad.** Seis pasajes en vez de tres duplica aproximadamente la entrada de cada respuesta. Facturación y uso desglosa el mes por modelo para que veas a dónde se fue. ## Traer las tuyas En el plan Bring Your Own aportas tus claves de Anthropic y OpenAI y el proveedor te factura directamente a sus precios. Todo lo demás funciona igual. No hay vuelta atrás a nuestra cuenta: si tu clave deja de funcionar, el asistente lo dice en lugar de seguir en silencio con la nuestra.