Breaking
Tech

Efficacité par jeton : pourquoi elle compte plus que la puissance brute

Ars Technicail y a 2 h
Processeur informatique abstrait aux circuits lumineux
Processeur informatique abstrait aux circuits lumineuxPhoto: Steve A Johnson / Pexels

Un nouveau modèle d'IA « meilleur » ne signifie plus automatiquement qu'il obtient un score plus élevé sur les classements de référence ; de plus en plus, cela signifie qu'il accomplit la même tâche avec moins d'unités de calcul, donc à moindre coût. Ces unités s'appellent des jetons (tokens) — les fragments de mots qu'un modèle traite en lisant une entrée et génère en produisant une sortie — et le nombre de jetons qu'une tâche nécessite détermine en grande partie ce qu'elle coûte réellement à exécuter. Le tout dernier modèle phare d'une entreprise est devenu un exemple actuel de ce basculement du secteur, de la capacité brute vers cette « efficacité par jeton ».

Pour comprendre l'efficacité par jeton, il est utile de se rappeler ce que sont les jetons. Chaque requête et chaque réponse sont découpées en jetons, et la plupart des services d'IA commerciaux facturent les clients en fonction du nombre de jetons traités et générés. Deux modèles peuvent tous deux répondre correctement à une question, mais si l'un le fait avec trois fois moins de jetons, ce modèle offre en pratique le même résultat pour un tiers du coût.

Dans la première phase de la course à l'IA, la concurrence portait surtout sur des sauts de capacité : chaque nouveau modèle phare surpassait largement son prédécesseur sur les tests de raisonnement, de programmation ou de culture générale. À mesure que cette course a mûri, l'écart de performance brute entre les modèles de pointe s'est réduit, déplaçant le centre de gravité de la concurrence ailleurs.

Désormais, la véritable bataille consiste à offrir une qualité similaire à un coût de calcul et de jetons bien plus faible. Cela compte énormément pour les tâches de production à fort volume : si un agent conversationnel de service client ou un outil de complétion de code traite des millions de requêtes par jour, même une petite amélioration du coût par jeton se traduit par une différence importante sur la facture totale.

Plusieurs tendances techniques sous-tendent ces gains d'efficacité : des architectures de modèles plus efficaces, des données d'entraînement plus soigneusement sélectionnées, des modèles plus petits distillés à partir de modèles plus grands, et des systèmes d'orientation intelligents qui dirigent une requête donnée vers un modèle moins cher ou plus coûteux selon sa complexité. Aucune de ces avancées ne constitue à elle seule une percée spectaculaire, mais ensemble, elles tirent la courbe des coûts vers le bas.

Pour les entreprises, cela change la façon dont les budgets d'IA sont évalués. Une entreprise se demande de plus en plus non pas « quel modèle obtient le meilleur score au test », mais « quel modèle offre une qualité suffisante pour cette tâche précise au coût en jetons le plus bas ». Un seuil « suffisamment bon et bon marché » remplace un seuil « le meilleur possible » dans de nombreuses décisions d'entreprise.

Pour les utilisateurs finaux, l'efficacité par jeton a aussi des conséquences concrètes : une inférence moins chère signifie que les applications grand public peuvent toucher un public plus large à moindre coût, ou via des offres gratuites plus généreuses. Un modèle qui consomme moins de jetons en coulisses se traduit généralement, pour l'utilisateur, par des réponses plus rapides et des prix d'abonnement plus bas.

Cette dynamique n'est propre à aucune entreprise en particulier ; presque tous les grands laboratoires d'IA cherchent désormais à la fois à augmenter la capacité et à offrir cette même capacité moins cher. La concurrence se joue de plus en plus non seulement sur qui sort le modèle le plus intelligent, mais sur qui délivre cette même intelligence avec moins de ressources.

Il faut noter que l'efficacité peut s'accompagner de compromis. Un modèle optimisé pour être moins cher par jeton peut encore accuser un retard par rapport aux modèles de pointe, plus coûteux, sur les tâches de raisonnement les plus difficiles — des preuves mathématiques à plusieurs étapes ou des problèmes de planification longs et complexes, par exemple. L'efficacité ne remplace pas universellement la capacité brute pour toutes les tâches.

Au cours des prochaines années, le fil conducteur des progrès de l'IA se lira probablement moins dans les classements de référence que dans la vitesse à laquelle les courbes de coûts baissent. L'indicateur le plus surveillé par les investisseurs et les clients d'entreprise pourrait finir par ne pas être quel modèle obtient le meilleur score, mais quel fournisseur peut offrir la même qualité pour le moins d'argent.

Cet article est un résumé éditorial assisté par IA basé sur Ars Technica. L'image est une photo d'archive de Steve A Johnson sur Pexels.

À lire ensuite

Façade architecturale d'un bâtiment institutionnel européen
Plus dans Tech

TikTok, X et Meta accusés de bloquer l'accès aux données des chercheurs

Des chercheurs européens affirment que TikTok, X et Meta ne fournissent pas les données de plateforme qu'ils sont légalement tenus de partager, selon les chercheurs et une plainte connexe. Ils estiment que ce manque entrave les études indépendantes sur les effets des réseaux sociaux sur la société. Les entreprises ne sont pas directement citées dans ce qui a été rapporté ici ; les affirmations sont attribuées aux chercheurs et à la plainte sous-jacente.

Ars Technica
Gros plan d'un smartphone sur un fond épuré
Tech

Hausse de prix du Pixel 11 : un dirigeant de Google la confirme presque

Shakil Barkat, vice-président Appareils et Services chez Google, a pratiquement confirmé lors d'un entretien avec 9to5Google que le prochain téléphone Pixel de l'entreprise coûterait plus cher que le Pixel 10. Barkat a déclaré que Google avait « protégé les consommateurs des fluctuations d'approvisionnement aussi longtemps que possible », mais que « l'économie a fondamentalement changé ». Apple, Nintendo, Microsoft et Roku ont tous récemment relevé leurs prix pour des raisons similaires.

The Vergeil y a 2 h
Image abstraite représentant la sécurité des serveurs avec un cadenas numérique
Tech

Le PDG de Hugging Face réclame une transparence radicale après le piratage

Le PDG de Hugging Face, Clément Delangue, a appelé les entreprises d'IA à une « transparence radicale » à la suite d'un incident de sécurité touchant OpenAI, qu'il a qualifié lui-même de « première cyberattaque menée par un agent autonome ». Delangue a décrit l'événement comme « sans précédent » et a estimé qu'il « mérite une réponse sans précédent ». Ces qualifications proviennent de sa propre déclaration publique, et non d'un compte rendu officiel d'OpenAI.

TechCrunchil y a 2 h
Gros plan abstrait d'une carte de circuit imprimé
Tech

Pourquoi les modèles d'IA chinois comme Kimi inquiètent Wall Street

Le lancement du modèle Kimi par Moonshot AI a déclenché un accès d'inquiétude familier en Silicon Valley et à Wall Street, rappelant de précédents lancements chinois ayant fait pression sur les prix américains. Ce schéma en dit moins sur un modèle précis que sur la mesure dans laquelle les valorisations de l'IA reposent encore sur un pouvoir de fixation des prix durable. Cet article explique pourquoi les modèles chinois, moins chers et compétitifs, continuent d'inquiéter les marchés américains.

TechCrunchil y a 2 h
Illustration d'un modèle de structure protéique en 3D
Tech

L'IA AlphaFold aide à repenser des protéines d'édition génique plus sûres

Des chercheurs utilisent AlphaFold, le système d'intelligence artificielle de Google DeepMind qui prédit la structure tridimensionnelle des protéines, pour identifier quelles parties des protéines d'édition génique provoquent des erreurs hors cible. Les travaux visent à repenser les protéines associées à CRISPR afin qu'elles coupent l'ADN avec plus de précision, réduisant les erreurs susceptibles de toucher des gènes non visés. La recherche en est encore au stade de l'ingénierie des protéines, pas d'un traitement clinique.

Ars Technicail y a 2 j