Cómo dejé de chocar con los límites de uso de Claude Code
El problema no era el plan, era yo
Durante un tiempo viví chocando con los límites de uso de Claude Code. Me ponía a trabajar, y a media mañana, aviso: límite alcanzado. Frustrante. Lo primero que piensas es “necesito un plan más caro”. Pues no. Resulta que el problema era mi configuración, y desde que lo arreglé llevo semanas usándolo todo el día sin tocar el límite.
¿Qué cambié? Básicamente, dejé de malgastar tokens en contexto invisible que ni sabía que estaba ahí. Te cuento qué es eso, cómo detectarlo y qué tocar, porque muchas veces no necesitas pagar más: necesitas dejar de tirar tokens a la basura.
Qué es el “contexto invisible” que te come la cuota
Pequeño recordatorio: cada vez que le pides algo a Claude, no le mandas solo tu mensaje. Le mandas también un montón de contexto que se cuela por debajo: tus instrucciones, archivos que tiene cargados, el historial de la conversación, reglas del proyecto… Todo eso son tokens, y todos cuentan para tu límite.
El problema es que buena parte de ese contexto es invisible en el sentido de que no lo ves ni lo piensas, pero ahí está, sumando en cada mensaje. Los culpables habituales:
- Archivos enormes que se cargan enteros en el contexto cuando solo hacía falta un trozo.
- Un CLAUDE.md inflado con reglas viejas, duplicadas y relleno (justo lo que contaba que evita el creador de Claude Code).
- Historial acumulado de una sesión larguísima que arrastras sin necesidad.
- Herramientas y configuraciones que meten información de fondo en cada petición.
Cada una parece poca cosa. Juntas, te están comiendo la cuota a bocados sin que te enteres. Estás pagando, en tokens, por arrastrar peso muerto en cada mensaje.
Cómo detectarlo
Antes de tocar nada, mira dónde se te va. Las pistas:
- Si una conversación recién empezada ya va “pesada” o lenta, tienes mucho contexto base cargándose de entrada.
- Si tu CLAUDE.md ocupa miles de tokens, ahí tienes un sospechoso claro.
- Si arrastras sesiones eternas sin reiniciar, el historial acumulado pesa una barbaridad.
La idea es auditar tu setup: qué se está cargando por defecto en cada petición y qué de eso es realmente necesario. Mucha gente, yo incluido en su momento, nunca ha mirado esto. Y es justo donde están los tokens tirados.
Los ajustes que me funcionaron
Esto es lo que cambió la cosa para mí:
- Adelgazar el CLAUDE.md al mínimo. Fuera reglas viejas, duplicadas y relleno. Un archivo de instrucciones corto y directo no solo gasta menos: además funciona mejor, porque el modelo no se distrae.
- No cargar archivos enteros si no hace falta. Trabaja por trozos relevantes en vez de meter ficheros gigantes completos en el contexto.
- Reiniciar sesiones a menudo. Cuando una tarea termina o te atascas, empieza una sesión nueva en vez de arrastrar un historial kilométrico. De paso, una sesión fresca suele ver mejor el problema (otra de las estrategias del creador de Claude Code).
- Limpiar el contexto entre tareas distintas. No mezcles diez asuntos en la misma conversación interminable.
La regla de fondo es sencilla: mantén el contexto limpio y ajustado a lo que necesitas ahora. Cada token que no arrastras es un token que te queda para trabajar.
Por qué esto importa (más allá del límite)
Hay un bonus que mucha gente no ve: recortar el contexto invisible no solo estira tu cuota, también mejora los resultados. Un modelo con un contexto limpio y enfocado se equivoca menos, prioriza mejor y va más rápido. Un modelo ahogado en ruido de fondo se despista. Así que esto no es solo ahorrar: es trabajar mejor.
Para una empresa que use estas herramientas a diario en su equipo, controlar el consumo de tokens (y de paso la calidad) es directamente dinero y productividad. Auditar y afinar estos setups es parte de lo que ayudo a montar, porque la diferencia entre un setup limpio y uno descuidado se nota en la factura y en los resultados.
Un ritual sencillo para mantenerlo a raya
Más allá de los ajustes puntuales, lo que de verdad funciona es convertir esto en un hábito. Yo me he acostumbrado a un par de gestos que apenas cuestan: cuando termino una tarea, cierro la sesión y abro otra para la siguiente, en vez de arrastrar la conversación hasta el infinito. Y cada cierto tiempo le doy un repaso al CLAUDE.md para quitar lo que ya no aporta.
Son dos costumbres tontas, pero marcan la diferencia entre llegar al límite a mediodía o no tocarlo en toda la semana. Es como el orden en el escritorio: no es que limpiar una vez te cambie la vida, es que mantenerlo limpio te ahorra problemas cada día. Con el contexto pasa igual. Un setup que se revisa de vez en cuando gasta menos y rinde mejor, sin que tengas que pensar en ello.
Lo que me llevo de todo esto
Antes de pagar un plan más caro, mira qué estás malgastando. En mi caso, el problema nunca fue que el plan se quedara corto, sino que arrastraba toneladas de contexto invisible en cada mensaje. Adelgacé el setup y pasé de chocar con el límite cada día a no tocarlo en semanas.
Audita tu configuración, recorta el CLAUDE.md, no cargues lo que no necesitas y reinicia sesiones. Es gratis, mejora los resultados y, muchas veces, te ahorra el upgrade. El token más barato es el que no gastas.
Preguntas frecuentes
¿Por qué llego tan rápido a los límites de uso de Claude Code?
Casi siempre por contexto invisible que se cuela en cada petición y consume tokens sin que lo notes: archivos enormes cargados enteros, un CLAUDE.md inflado, historial de sesiones larguísimas y configuraciones que meten información de fondo. Todo eso suma en cada mensaje y te come la cuota, aunque tu pregunta sea corta.
¿Qué es el contexto invisible?
Es todo lo que se envía al modelo además de tu mensaje: instrucciones, archivos cargados, historial de la conversación y reglas del proyecto. Se llama invisible porque no lo ves ni lo piensas, pero cuenta como tokens en cada petición. Si está inflado o desordenado, te gasta la cuota y, además, empeora los resultados al distraer al modelo.
¿Cómo reduzco el consumo de tokens sin pagar más?
Adelgazando el CLAUDE.md al mínimo necesario, no cargando archivos enteros cuando solo hace falta un trozo, reiniciando sesiones en vez de arrastrar historiales kilométricos y limpiando el contexto entre tareas distintas. Mantener el contexto limpio y enfocado estira mucho la cuota y, de paso, mejora la calidad de las respuestas.
¿Recortar el contexto empeora los resultados?
Al contrario, suele mejorarlos. Un modelo con un contexto limpio y enfocado se equivoca menos, prioriza mejor y responde más rápido, mientras que uno ahogado en ruido de fondo se despista. Recortar el contexto invisible no solo ahorra tokens: también hace que el asistente trabaje mejor.
Fuentes
Compártelo si te ha resultado útil, sobre todo con quien viva chocando con el límite a media mañana.
¿Habías mirado alguna vez cuánto contexto arrastras en cada petición? Cuéntame.
Y… el token más barato siempre es el que no gastas.
Artículos relacionados
Las 6 estrategias del creador de Claude Code para tus proyectos
Llevamos meses optimizando prompts, creando reglas y ajustando cada parámetro de Claude Code, y resulta que Boris Cherney, el hombre que creó la herramienta, lo hace de una forma muy distinta a la mayoría. En una entrevista reveló las seis estrategias que usa él, y al leerlas te das cuenta de que casi todos lo estábamos haciendo regular. Van desde empezar siempre en modo plan y mantener un CLAUDE.md minimalista, hasta darle a Claude una forma de verificar su propio trabajo, trabajar con varias sesiones en paralelo, encapsular tus tareas repetidas y, la más filosófica de todas, no apostar nunca contra el modelo. Aquí te las cuento una a una, con ejemplos prácticos de cómo aplicarlas hoy mismo para sacarle de verdad el jugo a Claude Code.
NotebookLM: el cuaderno con Inteligencia Artificial de Google
NotebookLM es una de esas herramientas que, cuando entiendes para qué sirve, no sabes cómo has vivido sin ella. Es un cuaderno con Inteligencia Artificial de Google al que le subes tus propias fuentes (PDFs, documentos, páginas web, vídeos de YouTube) y, a partir de ahí, te responde preguntas citando de dónde sale cada cosa, te hace resúmenes, mapas mentales e incluso un podcast con dos voces hablando de tus documentos. La clave, y lo que lo diferencia de un ChatGPT cualquiera, es que solo trabaja con lo que tú le das, así que no se inventa cosas de fuera. Te cuento qué es, qué puedes hacer con él, cuánto cuesta y para qué lo uso yo.
Qué es la inferencia en Inteligencia Artificial y por qué importa
Cada vez que le escribes a ChatGPT o a Claude y te responde, estás viendo inferencia: el modelo, ya entrenado, aplicándose sobre tu pregunta para generar una respuesta. Entrenar un modelo y usarlo son dos fases completamente distintas, con costes, hardware y problemas distintos, y entender la diferencia te explica un montón de cosas que vives a diario: por qué a veces el modelo va lento, por qué la velocidad se mide en tokens por segundo, por qué unos chips valen para entrenar y otros para responder, y por qué cada vez tiene más sentido ejecutar Inteligencia Artificial en tu propio equipo. Te lo cuento sin tecnicismos, con la diferencia entre entrenamiento e inferencia bien clara.