Eficiencia de tokens: por qué importa más que la potencia bruta de la IA

Que un nuevo modelo de IA sea "mejor" ya no significa automáticamente que obtenga una puntuación más alta en las tablas de clasificación; cada vez más, significa que realiza la misma tarea con menos unidades de cómputo y, por tanto, a menor costo. Esas unidades se llaman tokens: los fragmentos de palabras que un modelo procesa al leer una entrada y genera al producir una salida, y la cantidad de tokens que requiere una tarea determina en gran medida cuánto cuesta realmente ejecutarla. El último modelo insignia de una empresa se ha convertido en un ejemplo actual de ese cambio de enfoque del sector, de la capacidad bruta hacia esta "eficiencia de tokens".
Para entender la eficiencia de tokens conviene recordar qué son los tokens. Cada instrucción y cada respuesta se dividen en tokens, y la mayoría de los servicios comerciales de IA cobran a los clientes según cuántos tokens se procesan y se generan. Dos modelos pueden responder correctamente a la misma pregunta, pero si uno lo hace usando una tercera parte de los tokens, ese modelo está entregando en la práctica el mismo resultado por un tercio del costo.
En la fase inicial de la carrera de la IA, la competencia giraba sobre todo en torno a saltos de capacidad: cada nuevo modelo insignia superaba ampliamente a su predecesor en pruebas de razonamiento, programación o conocimiento general. A medida que esa carrera ha madurado, la brecha de rendimiento bruto entre los modelos de primer nivel se ha reducido, desplazando el centro de gravedad de la competencia hacia otro lugar.
Ahora la verdadera disputa consiste en ofrecer una calidad similar con un costo de cómputo y de tokens mucho menor. Eso importa enormemente para el trabajo de producción de alto volumen: si un bot de atención al cliente o una herramienta de autocompletado de código gestiona millones de solicitudes al día, incluso una pequeña mejora en el costo por token se traduce en una diferencia grande en la factura total.
Varias tendencias técnicas explican estas ganancias de eficiencia: arquitecturas de modelo más eficientes, datos de entrenamiento seleccionados con más cuidado, modelos más pequeños destilados a partir de otros más grandes y sistemas de enrutamiento inteligentes que dirigen una solicitud a un modelo más barato o más caro según su complejidad. Ninguno de estos avances constituye por sí solo un gran titular, pero en conjunto empujan la curva de costos hacia abajo.
Para las empresas, esto cambia cómo se evalúan los presupuestos de IA. Una empresa se pregunta cada vez más no "qué modelo obtiene la puntuación más alta en la prueba", sino "qué modelo ofrece calidad suficiente para esta tarea concreta al menor costo en tokens". Un umbral de "suficientemente bueno y barato" está reemplazando a uno de "el mejor posible" en muchas decisiones empresariales.
Para los usuarios finales, la eficiencia de tokens también tiene consecuencias concretas: una inferencia más barata significa que las aplicaciones orientadas al consumidor pueden llegar a públicos más amplios a menor costo, o mediante niveles gratuitos más generosos. Un modelo que consume menos tokens entre bastidores suele traducirse, para el usuario, en respuestas más rápidas y precios de suscripción más bajos.
Esta dinámica no es exclusiva de una sola empresa; casi todos los grandes laboratorios de IA intentan ahora tanto aumentar la capacidad como ofrecer esa misma capacidad más barata. La competencia se libra cada vez más no solo en torno a quién lanza el modelo más inteligente, sino a quién entrega esa misma inteligencia usando menos recursos.
Conviene señalar que la eficiencia puede implicar concesiones. Un modelo optimizado para ser más barato por token puede seguir quedando por detrás de los modelos de primer nivel, más costosos, en las tareas de razonamiento más difíciles —pruebas matemáticas de varios pasos o problemas de planificación largos y complejos, por ejemplo—. La eficiencia no sustituye de forma universal a la capacidad bruta en todas las tareas.
En los próximos años, el hilo conductor del progreso de la IA probablemente se leerá menos en las tablas de clasificación y más en la velocidad con la que caen las curvas de costos. El indicador que más vigilarán inversores y clientes empresariales podría acabar siendo no qué modelo obtiene la puntuación más alta, sino qué proveedor puede ofrecer la misma calidad por el menor dinero.
Para seguir leyendo

TikTok, X y Meta acusadas de bloquear datos a investigadores de la UE
Investigadores europeos afirman que TikTok, X y Meta no están proporcionando datos de sus plataformas que están legalmente obligadas a compartir, según los investigadores y una denuncia relacionada. Sostienen que esa falta de acceso dificulta los estudios independientes sobre los efectos de las redes sociales en la sociedad. Las empresas no son citadas directamente en lo reportado aquí; las afirmaciones se atribuyen a los investigadores y a la denuncia subyacente.

Subida de precio del Pixel 11: un directivo de Google casi la confirma
Shakil Barkat, vicepresidente de Dispositivos y Servicios de Google, prácticamente confirmó en una entrevista con 9to5Google que el próximo teléfono Pixel de la empresa costará más que el Pixel 10. Barkat dijo que Google había "protegido a los consumidores de las fluctuaciones del suministro durante todo el tiempo posible", pero que "la economía ha cambiado fundamentalmente". Apple, Nintendo, Microsoft y Roku también han subido precios recientemente por motivos similares.

El CEO de Hugging Face pide "transparencia radical" tras el ataque a OpenAI
El CEO de Hugging Face, Clément Delangue, ha pedido "transparencia radical" a las empresas de IA tras un incidente de seguridad que afectó a OpenAI y que él mismo describió como "el primer ciberataque de un agente autónomo". Delangue calificó el hecho de "sin precedentes" y dijo que "merece una respuesta sin precedentes". Estas caracterizaciones provienen de su declaración pública, no de un relato oficial de OpenAI sobre el incidente.

Por qué los modelos de IA chinos como Kimi inquietan a Wall Street
El lanzamiento del modelo Kimi de Moonshot AI provocó un episodio de inquietud familiar en Silicon Valley y Wall Street, en línea con anteriores lanzamientos chinos que presionaron los precios estadounidenses. El patrón dice menos sobre un modelo concreto que sobre cuánto dependen todavía las valoraciones de IA de un poder de fijación de precios duradero. Este artículo explica por qué los modelos chinos, más baratos y competitivos, siguen inquietando a los mercados estadounidenses.

La IA AlphaFold ayuda a rediseñar proteínas de edición genética más seguras
Investigadores están usando AlphaFold, el sistema de inteligencia artificial de Google DeepMind que predice la estructura tridimensional de las proteínas, para identificar qué partes de las proteínas de edición genética provocan errores fuera del objetivo. El trabajo busca rediseñar proteínas asociadas a CRISPR para que corten el ADN con mayor precisión, reduciendo errores que podrían afectar genes no deseados. La investigación aún está en fase de ingeniería de proteínas, no es un tratamiento clínico.