Saltar al contenido

Ventana de contexto

La ventana de contexto es la cantidad máxima de tokens (texto, código, imágenes o audio convertidos a unidades) que un modelo de lenguaje puede procesar a la vez, sumando la entrada del usuario y la respuesta generada.

La ventana de contexto es la cantidad máxima de tokens —texto, código, imágenes o audio convertidos a unidades— que un modelo de lenguaje puede procesar a la vez, sumando tu entrada y la respuesta que genera. Funciona como su memoria de trabajo: lo que cabe dentro influye en el razonamiento; lo que queda fuera deja de existir para el modelo en ese momento.

Un token no es una palabra. Puede ser una palabra, parte de una palabra, un signo o un espacio. En español, una regla práctica es ~1,3-1,5 tokens por palabra. Así, ventana de contexto ocupa unos 5-6 tokens.

Cómo funciona

Cuando envías un mensaje a un modelo como GPT-5, Claude o Gemini, el sistema suma varias piezas dentro de la misma ventana: las instrucciones de sistema que definen su comportamiento, tu prompt con los documentos adjuntos, el historial de la conversación y la respuesta que está generando. Todo compite por el mismo presupuesto.

Si la suma supera el límite, el modelo o la aplicación recorta lo más antiguo o devuelve un error. Por eso un asistente puede olvidar lo que dijiste al principio de un chat largo: esa parte ya quedó fuera de la ventana.

Por qué importa el tamaño, y por qué no hace magia

Una ventana grande permite resumir un contrato largo, revisar un repositorio completo o mantener una conversación extensa sin perder el hilo en una sola pasada. Pero más contexto no garantiza mejor respuesta.

Hay tres límites prácticos. Primero, el efecto lost in the middle: Liu et al. 2023, Lost in the Middle: How Language Models Use Long Contexts, Stanford/UC Berkeley, mostró que los modelos recuperan mejor lo situado al principio y al final, y pierden precisión con datos enterrados en el medio. Segundo, coste y latencia: se paga por token, llenar ventanas enormes en cada llamada es caro y lento. Tercero, ruido: volcar documentos irrelevantes diluye la atención y puede empeorar el resultado.

Aumentar la ventana no sustituye una buena ingeniería de contexto. Cuando el conocimiento es enorme o cambia a menudo, conviene recuperar solo los fragmentos relevantes con RAG en lugar de cargar todo en cada petición.

Ventana de contexto, RAG y fine-tuning

Son tres formas complementarias de dar conocimiento. La ventana es memoria inmediata, ideal para material puntual de la sesión, como un PDF que acabas de subir. RAG recupera dinámicamente los fragmentos relevantes de una base y los inserta en la ventana, ideal para bases grandes y cambiantes. El fine-tuning ajusta los pesos para internalizar un estilo o dominio estable, no para datos frescos. El patrón profesional combina los tres: un modelo afinado que usa RAG para traer datos a una ventana bien gestionada.

Ejemplo ilustrativo

Imagina un asistente legal con ventana de 200.000 tokens. Le subes un contrato de 50 páginas, unos 30.000 tokens, y le haces preguntas. Mientras contrato más conversación no superen el límite, el modelo ve todo. Si además tuvieras jurisprudencia de cientos de casos, lo eficiente no sería ampliar la ventana sin fin, sino indexar esos casos y recuperar solo los 3-4 más relevantes por consulta.

Cómo aprovecharla bien

  • Coloca lo importante al principio o al final del prompt, no enterrado en un bloque enorme.
  • Resume el historial largo en lugar de arrastrarlo entero.
  • Usa RAG cuando el conocimiento supere la ventana o cambie a menudo.
  • Mide el consumo: la mayoría de APIs lo reporta por petición.

Las cifras de ventana cambian con cada versión. Consulta la documentación oficial de cada proveedor para datos en tiempo real.


Actualizado: 31 de mayo de 2026 — Equipo editorial de AIClases.

Preguntas frecuentes

¿Qué es la ventana de contexto en una IA?
Es el número máximo de tokens que un modelo de lenguaje puede tener 'a la vista' en una sola petición, contando tanto el texto que le envías (prompt, documentos, historial) como la respuesta que genera. Si superas ese límite, el modelo ignora o trunca la información sobrante.
¿Cuántos tokens es 1.000.000 de contexto?
Como referencia práctica en español, 1.000.000 de tokens equivalen aproximadamente a 700.000-750.000 palabras, es decir, varios libros completos. En inglés, la regla habitual es ~0,75 palabras por token; en español el ratio es algo menor porque se generan más tokens por palabra.
¿Más ventana de contexto significa mejor IA?
No necesariamente. Una ventana grande permite analizar más material de una vez, pero los modelos pueden sufrir el efecto 'lost in the middle' (pierden precisión con datos situados en mitad de contextos muy largos) y el coste por petición sube. A menudo, combinar RAG con una ventana moderada da mejores resultados que volcar todo en una ventana gigante.
¿Cuál es la diferencia entre ventana de contexto y memoria a largo plazo?
La ventana de contexto es memoria temporal: se borra al terminar cada conversación o petición. La memoria a largo plazo (mediante RAG, bases de datos vectoriales o funciones de memoria del producto) persiste entre sesiones y se recupera cuando hace falta, sin necesidad de mantenerlo todo cargado.

Términos relacionados

02 / LLEVAR A LA PRÁCTICA

Después de leer

Convierte una idea útil en una habilidad repetible.

Elige una ruta breve, aplícala a una tarea real y termina con algo que puedas revisar, usar o compartir.