Marcos Ramírez BETA

#tokens

Medidor de uso de tokens de un asistente de código bajando, con archivos de contexto siendo recortados

Cómo dejé de chocar con los límites de uso de Claude Code

Vivía chocando con los límites de uso de Claude Code, y ahora lo uso todo el día sin tocarlos en semanas. ¿Qué cambié? Me puse a mirar mi configuración y descubrí que estaba malgastando una barbaridad de tokens en contexto invisible que ni sabía que estaba ahí: archivos enormes que se colaban en cada petición, instrucciones acumuladas, ruido que no aportaba nada pero que se contaba en cada mensaje. Aquí te cuento qué es ese contexto invisible que te come la cuota sin que te enteres, cómo detectarlo y qué ajustes concretos me han permitido estirar muchísimo el uso sin pagar más. Porque muchas veces no necesitas un plan más caro: necesitas dejar de tirar tokens a la basura.

Chip de procesador iluminado sobre una placa, con flujos de datos representando la fase de inferencia de un modelo de Inteligencia Artificial

Qué es la inferencia en Inteligencia Artificial y por qué importa

Cada vez que le escribes a ChatGPT o a Claude y te responde, estás viendo inferencia: el modelo, ya entrenado, aplicándose sobre tu pregunta para generar una respuesta. Entrenar un modelo y usarlo son dos fases completamente distintas, con costes, hardware y problemas distintos, y entender la diferencia te explica un montón de cosas que vives a diario: por qué a veces el modelo va lento, por qué la velocidad se mide en tokens por segundo, por qué unos chips valen para entrenar y otros para responder, y por qué cada vez tiene más sentido ejecutar Inteligencia Artificial en tu propio equipo. Te lo cuento sin tecnicismos, con la diferencia entre entrenamiento e inferencia bien clara.

08:30 8 min Marcos Ramírez Lucía
Captura del repositorio de MarkItDown en GitHub con el código del proyecto

MarkItDown: pasa cualquier documento a Markdown y ahorra tokens

MarkItDown es una herramienta open-source de Microsoft que convierte PDFs, Word, Excel, PowerPoint, imágenes, audio y HTML a Markdown. La uso para pasar documentos a la Inteligencia Artificial y ahorrar tokens. Te enseño cómo funciona, cómo instalarla y por qué deberías probarla.

08:30 7 min Marcos Ramírez Lucía
Representación visual de dos plataformas de voz conectadas por un flujo de migración, fondo oscuro tech con ondas de sonido digitales

De VAPI a Retell: la migración que se llevó media arquitectura

Cuento cómo integré VAPI en marcosramirez.dev para tener un agente de voz en la web, por qué migré a Retell cinco días después, y cómo esa decisión arrastró consigo un cambio de arquitectura completo: de Cloudflare Pages a Cloudflare Workers, pasando por SSR, rutas de API y gestión segura de tokens. La historia de cómo una sola dependencia puede cambiar toda tu infraestructura.

08:30 7 min Marcos Ramírez Lucía