IdiomaENES
EngineeringSep 9, 2026 · 9 min de lectura

El costo de una respuesta de IA, desglosado

La parte cara de una respuesta de IA no es la respuesta. Son los varios miles de tokens que el modelo lee antes de escribir trescientos.

Hernan MoyaCo-Founder
The token budget of one answered question: retrieved context 2,400 of 4,700, system prefix 1,500 of 4,700, and the answer 300 of 4,700
The token budget of one answered question: retrieved context 2,400 of 4,700, system prefix 1,500 of 4,700, and the answer 300 of 4,700

La mayoría de la gente que presupuesta un asistente de IA presupuesta la respuesta. La respuesta es la parte barata.

Una sola pregunta en un sistema de recuperación le manda al modelo varios miles de tokens y recibe unos cientos de vuelta. Casi todo lo que pagas ocurre antes de que se escriba una palabra.

A dónde van los tokens en realidad

Esta es una pregunta respondida en un pipeline RAG que funciona. Los números son aproximados y se mueven con tus ajustes, pero las proporciones se sostienen.

InteractiveUna pregunta, tarifada por lo que el modelo tuvo que leer

El prefijo de sistema lleva tus instrucciones, tono y reglas, y es idéntico byte a byte en cada request. El contexto recuperado son los fragmentos que eligió la recuperación, distintos cada vez. El historial son los turnos recientes, y la respuesta es la única parte que el lector llega a ver.

Cuatro mil cuatrocientos tokens leídos, trescientos escritos. El lector ve el seis por ciento de lo que costó la pregunta.

La salida es chica, y está tarifada como si lo supiera

Los tokens de salida cuestan unas cinco veces los de entrada en todo modelo que valga la pena. Suena a que deberían dominar, y no lo hacen, porque hay quince veces menos.

La consecuencia práctica es contraintuitiva: una respuesta larga sobre un contexto chico sale más barata que una respuesta corta sobre un contexto grande. Los equipos que ajustan por costo suelen empezar acortando respuestas, que es la palanca más chica que tienen.

El contexto recuperado es el dial

Mira los números otra vez. El componente de entrada más grande es el que cambia en cada request, y por eso es el que el caché no puede alcanzar.

También es el que controlas de forma directa. Recuperar ocho fragmentos en vez de cinco manda alrededor de un 60% más de contexto en cada pregunta, para siempre.

InteractiveLa profundidad de recuperación, paso a paso
Menos fragmentos suele responder mejor

Recortar la profundidad de recuperación es el cambio raro que baja el costo y sube la calidad al mismo tiempo. Las coincidencias débiles son ruido, y un modelo con tres fragmentos precisos le gana a uno con ocho donde cinco son marginales.

El segundo dial es el tamaño de chunk, porque define cuánto texto carga cada fragmento recuperado. Los ajustes de recuperación se discuten casi siempre como perillas de calidad. Son el control de costo principal del sistema.

welcomeai.devUso y límites de IA: cómo los ajustes de recuperación cambian lo que consumes

Qué alcanza el caché y qué no

El prefijo de sistema es idéntico en cada request, así que puede cachearse en el proveedor y facturarse a una tarifa de lectura mucho menor. Eso es más o menos un tercio de la entrada resuelto barato.

El contexto recuperado no se puede cachear, por construcción. Se arma por pregunta, y dos preguntas que recuperan fragmentos distintos no comparten nada.

Por eso el orden del prompt importa para el costo y no solo para la calidad. Todo lo estable va primero; todo lo que cambia por pregunta va después.

Indexar no es donde está la plata

Convertir documentos en vectores cuesta cerca de una centésima por token de lo que cuesta responder, y pasa una vez por documento en vez de una vez por pregunta.

Un manual grande sale más barato de indexar que una tarde movida de preguntas. Re-indexar después de cambiar un ajuste se siente caro y no lo es; lo caro es servir la misma pregunta mil veces con más contexto del que necesitaba.

La pregunta más barata es la que nunca se hace

Una respuesta servida desde el caché de respuestas no cuesta nada en el modelo, porque al modelo nunca se lo llamó. En un asistente de soporte, donde una porción real del tráfico es el mismo puñado de preguntas, eso ahorra más que cualquier ajuste de prompt.

El orden en que conviene trabajar, del menor esfuerzo al mayor:

  1. Cachea las respuestas repetidas, para que las preguntas comunes dejen de llegar al modelo
  2. Recorta la profundidad de recuperación hasta que la calidad empiece a caer, y ahí para
  3. Mantén estable la parte estable del prompt, para que siga siendo cacheable
  4. Ajusta el modelo a la tarea en vez de mandar todo al más grande por defecto
  5. Recién entonces piensa en el largo de las respuestas

Preguntas frecuentes

Si quieres un solo número para vigilar, que sea tokens de contexto recuperado por pregunta respondida. Es lo más grande que pagas, lo único grande que controlas del todo, y lo que crece en silencio cada vez que alguien sube un ajuste de recuperación para arreglar una respuesta mala.

Etiquetadocostretrievaltokenscachingrag
Escrito porHernan Moya

Sigue leyendo