Modelos, y cuál usar
Qué cambia la elección de modelo, qué no cambia, y cómo mantener el coste con sentido.
En cada respuesta intervienen dos modelos distintos, y hacen trabajos que no tienen nada que ver.
El modelo de embeddings
Convierte tu contenido en números para que las preguntas puedan encontrarlo. Se ejecuta una vez por fragmento al indexar un documento, y una vez por pregunta. Nunca escribe nada.
Cambiarlo obliga a reindexar todo, porque los vectores de dos modelos distintos no son comparables. Elige uno y déjalo en paz salvo que tengas un motivo.
El modelo que responde
Lee los pasajes que encontró la recuperación y escribe la respuesta. Este es el que eliges por base de conocimiento, y el que limita tu plan.
Los modelos más grandes escriben mejor: siguen las instrucciones con más exactitud, manejan una pregunta que abarca tres pasajes y dicen "el contenido no cubre esto" en vez de inventarse algo. También cuestan más por respuesta y tardan más en arrancar.
Lo que el modelo no cambia es qué se recuperó. Si el pasaje correcto no se encontró, ningún modelo puede responder desde él. Mira el contexto recuperado antes que el modelo: una respuesta mala es mucho más a menudo un problema de recuperación, y subir de modelo para arreglar uno sale caro y no funciona.
Un valor por defecto razonable
Usa el modelo más barato que responda bien a tus preguntas, y compruébalo haciendo las mismas preguntas reales en el Playground con cada uno. En una base bien organizada que responde preguntas de hecho, un modelo pequeño suele ser indistinguible. En preguntas que exigen conciliar varios pasajes, o un tono cuidado, la diferencia se nota enseguida.
Lo que cuesta
El coste es por token, y se cuentan las dos direcciones: la pregunta más cada pasaje recuperado que entra, y la respuesta que sale. La salida cuesta unas cinco veces la entrada.
Eso tiene una consecuencia práctica: Top K es un ajuste de coste además de uno de calidad. Seis pasajes en vez de tres duplica aproximadamente la entrada de cada respuesta. Facturación y uso desglosa el mes por modelo para que veas a dónde se fue.
Traer las tuyas
En el plan Bring Your Own aportas tus claves de Anthropic y OpenAI y el proveedor te factura directamente a sus precios. Todo lo demás funciona igual. No hay vuelta atrás a nuestra cuenta: si tu clave deja de funcionar, el asistente lo dice en lugar de seguir en silencio con la nuestra.