Home technologyLa gran promesa de la IA local de Microsoft son los “tokens gratis”. En realidad no son gratis, pero eso no importa

La gran promesa de la IA local de Microsoft son los “tokens gratis”. En realidad no son gratis, pero eso no importa

by markoflorentino@icloud.com


En julio de 1991 un chaval de 23 años, indio y con su pelo intacto, asistió a una conferencia de desarrolladores de Microsoft que le cambió la vida. Un año después Nadella estaba trabajando en Microsoft y el resto, como suele decirse, es historia. 

Ayer Nadella contaba esa historia en el evento conjunto de Microsoft y Nvidia también en San Francisco. Y para él dicho evento podía marcar otro punto de inflexión porque, dijo, «Nuestro objetivo es llevar inteligencia sin límites a cada hogar y a cada escritorio con Windows». Y su plan para lograr algo así era simple: 

Hacer resurgir al PC gracias a la «inteligencia híbrida«.

Y hacerlo con una estrategia muy razonable: para él en esta nueva y fascinante era de la IA podremos usar por supuesto los modelos de IA en la nube que venimos usando en los últimos tres años, pero es que además de esos modelos podremos usar modelos de IA locales. 

La «inteligencia híbrida» tiene sentido

Ahí es donde entraba la llamada «inteligencia híbrida«, un nuevo concepto marketiniano que Microsoft Pavan Davuluri, directivo de Microsoft, explicaba de forma sencilla:  

«Nos dirigimos a un futuro en el que la inteligencia híbrida siempre está disponible. Ejecutándose en local cuando tiene sentido, accediendo a la nube si lo necesita y trayendo lo mejor de ambos mundos».

Captura De Pantalla 2026 10 08 A Las 4 56 36
Captura De Pantalla 2026 10 08 A Las 4 56 36

El discurso fue convincente. Tenía sentido, porque estamos viendo cómo combinar ambas opciones puede ser una excelente idea, pero aquí Microsoft moldeó esa idea a su favor. Lo hizo insinuando que esa inteligencia híbrida impulsaría de nuevo el mundo del PC —que siempre ha sido el mundo de Microsoft— porque sus nuevos equipos nos permiten disfrutar de algo maravilloso: 

«Tokens gratis».

Así hablaron de ellos. Cuando tienes una máquina que es capaz de trabajar con modelos locales de IA, lo que generas con esas máquinas es aparentemente gratis. No tienes que pagar suscripciones de ChatGPT o de Claude, y la calidad de los modelos disponibles es realmente notable hoy en día. 

Captura De Pantalla 2026 10 08 A Las 5 11 42
Captura De Pantalla 2026 10 08 A Las 5 11 42

¿Tokens gratis?

En la demo que realizó Kayla Cinnamon, otra de las directivas de Microsoft, se vio claro: al usar GitHub Copilot con su nuevo enrutador inteligente de modelos, se pudo ver cómo cierta tarea había usado ciertos tokens «de pago», pero también se podía ver cuántos tokens había generado «gratis» gracias al uso de modelos locales.  

La idea es potentísima y tiene, como decíamos muchísimo sentido. Cinnamon explicaba que podía dejar el ordenador encendido con GitHub Copilot funcionando en su proyecto y «estaría consiguiendo todos esos tokens sin pagar mientras duermo». 

Eso es cierto: los tokens que está generando el modelo local tienen en ese momento un coste ínfimo: el de la energía que consume el equipo para poder generarlos. Está también el factor privacidad, porque las conversaciones que tienes con modelos locales se quedan en tu máquina, así que es una ventaja clara para trabajar por ejemplo con datos sensibles. Pero es que hay otro coste oculto y muy importante del que Microsoft no habló. 

Pero de gratis, nada

El problema con el discurso de Microsoft es que los tokens gratis no lo son en absoluto, porque para poder usar modelos locales de IA necesitas un PC que pueda manejarlos con soltura, y esos PCs, sobre todo a día de hoy, no son especialmente baratos. 

Captura De Pantalla 2026 10 08 A Las 5 24 41
Captura De Pantalla 2026 10 08 A Las 5 24 41

El nuevo Microsoft Surface Laptop Ultra

Tenemos el ejemplo perfecto en el nuevo Microsoft Surface Laptop Ultra, un ultraportátil fantástico basado en los nuevos chips Nvidia RTX Spark. Estos equipos son una gran opción para poder usar esos modelos de IA locales, pero para poder hacerlo tendremos que desembolsar al menos 2.599 dólares.

Ese precio es además para el modelo base, que solo tiene 24 GB de «memoria unificada» LPDDR5x (Microsoft le ha copiado el nombre de Apple). Y esos 24 GB precisamente se quedan cortos para modelos locales como el popular Qwen3.8-27B, probablemente el mejor «pequeño» modelo en su relación de tamaño/prestaciones. 

De hecho, para poder usar ese modelo con cierta soltura conviene dar el salto a la versión del Surface Laptop Ultra con 32 GB de memoria unificada, que sube a 3.299 dólares. No tenemos datos de momento sobre el ancho de banda de esta memoria (Microsoft no los indica en las especificaciones técnicas del equipo), pero ese será un detalle más que interesante. 

Captura De Pantalla 2026 10 08 A Las 5 37 47
Captura De Pantalla 2026 10 08 A Las 5 37 47

El MacBook Pro basado en un M5 Pro con 48 GB de memoria unificada tiene el mismo precio que el Surface Laptop Ultra de 32 GB. Habrá que ver cuál se comporta mejor con modelos locales de IA.

Porque por 3.299 dólares podemos comprar un MacBook Pro con un M5 Pro con 48 GB de memoria unificada y con un ancho de banda de 307 GB/s. Es una máquina igualmente atrayente para poder usar modelos de IA locales, aunque ciertamente en la propuesta de Microsoft sigue pesando ese soporte nativo de CUDA que ofrecen los llamativos chips RTX Spark. 

Será interesante comparar cómo se comportan ambas máquinas al usar modelos de IA locales, pero sea como fuere, una cosa está clara: esos «tokens gratis» de los que habla Microsoft no son en absoluto gratis, porque tienes que invertir 2.599 dólares (o probablemente más) en una máquina que te dé acceso a esa posibilidad. 

Y 2.599 dólares son muchos meses de suscripción a los planes actuales de ChatGPT Plus (20 dólares) o Claude Pro (20 dólares también), o bien de otras plataformas comparables. Dichos planes dan por supuesto acceso a los modelos frontera más avanzados del mercado, pero también es cierto que no te dan «tokens infinitos». 

Hay cuotas de uso (en estos dos casos, un número X de tokens cada cinco horas y un número Y de tokens cada semana), pero aun así son una excelente opción para un gran número de usuarios, y si necesitas más siempre puedes acceder a planes más caros con más cuota… o a la API, que sí ofrece tokens infinitos pero que también puede suponer un coste infinito porque es la opción «pago por uso» ilimitada. 

Y aun así, la inteligencia híbrida vence y convence

Esta crítica a la forma de vendernos la idea de la inteligencia híbrida se basa solo en esa falacia de los tokens gratis que utilizó Microsoft. Por supuesto que no son gratis, porque aunque tienes tokens ilimitados, esa inteligencia local no es tan buena como la de la nube y además impone una fuerte inversión inicial. 

Pero lo cierto es que la idea de la inteligencia híbrida (queramos llamarla así o no) sigue siendo muy potente de cara al futuro, y es más que probable que se imponga como la forma estándar de trabajar con IA, no solo en el PC, sino en el resto de dispositivos. 

Lo estamos viendo en los móviles, que incorporan pequeños modelos locales para resolver algunas tareas, pero que también permiten darnos acceso a modelos frontera en la nube. Tanto Siri AI como Gemini funcionan de esa forma, y lo hacen cada vez de forma más transparente para el usuario.

Con el PC y otros dispositivos está ocurriendo lo mismo: si tienes un equipo relativamente potente en el que ya realizaste una inversión importante —una GPU con al menos 16 GB de memoria gráfica ayuda mucho— podrás usar modelos locales de IA notables a una velocidad más que decente. 

Combinar esos modelos con consultas a modelos frontera, pagues o no una suscripción a OpenAI, Anthropic o cualquier otro rival es algo obvio de cara al futuro. La idea es sencilla: modelos más o menos caros en la nube para las tareas más o menos complejas, y modelos «gratuitos» (con muchas comillas) en local para otras tareas más rutinarias y simples. 

Teniendo en cuenta la frenética evolución de la IA, ese futuro mixto tiene aún más sentido: los modelos abiertos son cada vez más potentes y eficientes, y la evolución del hardware va en paralelo y hace que nuestros PCs y móviles nos den cada vez más «inteligencia» por menos dinero. 

Esa idea me recuerda a otra que ya vivimos: en los primeros años de internet en la que todo estaba dominado por módems, pitidos, webs toscas y maravillosas y velocidades de conexión terribles, los usuarios pagábamos por minuto de conexión. 

Hacíamos lo que necesitábamos y salíamos rápido de la llamada para que no nos costara mucho. Luego llegaron la banda ancha y las tarifas planas y pudimos disfrutar de un acceso ilimitado a internet: pagabas (y pagas) una cuota mensual, y toda internet estaba a tu alcance en cualquier momento y lugar.

Con la IA puede que ocurra exactamente lo mismo. Hoy pagamos por los tokens, así que los usamos cuando los necesitamos y «colgamos» rápidamente esa llamada cuando dejamos de hacerlo. Los planes actuales de suscripción son un primer paso para esa «tarifa plana de IA» que puede llegar algún día, pero precisamente ahí es donde los modelos locales de IA y el PC resurgen. 

De repente tienes tarifa plana de la IA, local, privada y «bastante inteligente». 

Y eso es maravilloso… si asumes que el coste inicial será fuerte. Pero como idea, desde luego, es potentísima. Nadella probablemente tenga razón. No será ni mucho menos el único en aprovechar esa idea —Apple nos vendió el mismo concepto hace poco con sus nuevos Mac—, pero la inteligencia híbrida está aquí para quedarse.

Imagen | Microsoft

En Xataka | Meta quiere plantar cara a OpenAI y Google con un arma muy particular: una IA potente que funciona offline en tu ordenador



Source link

related posts

Leave a Comment