Petite pièce de monnaie alimentant une grande machinerie, métaphore du modèle Gemini 3.5 Flash-Lite à bas coût

Gemini 3.5 Flash-Lite : le modèle à 30 centimes qui code

0,30 dollar le million de tokens en entrée, 2,50 dollars en sortie. À ce tarif, un millier de tris d’emails, d’extractions de données ou de réponses courtes coûte quelques centimes. Jusqu’ici, ce genre de prix plancher achetait un modèle tout juste bon à classer et reformuler. L’annonce de Google du 21 juillet change la donne : le nouveau Gemini 3.5 Flash-Lite passe de 31 à 54 % sur Terminal-Bench, un test qui mesure la capacité à travailler dans un terminal comme un développeur. L’entrée de gamme vient d’apprendre à coder.

De 31 à 54 % : Flash-Lite fait le travail du milieu de gamme

Le chiffre mérite qu’on s’y arrête. Terminal-Bench 2.1 évalue un modèle sur des tâches concrètes d’ingénierie : manipuler des fichiers, lancer des commandes, corriger du code jusqu’à ce que les tests passent. La génération précédente de Flash-Lite plafonnait à 31 %. La nouvelle atteint 54 %, et dépasse même Gemini 3 Flash, le modèle du dessus sorti quelques mois plus tôt, sur SWE-Bench Pro (54,2 % contre 49,6 %), un test de résolution de bugs dans de vrais projets logiciels.

Autrement dit, le modèle vendu comme la version « éco » du catalogue Google fait aujourd’hui ce que le milieu de gamme faisait au printemps. Le tout à une vitesse d’environ 350 tokens par seconde selon les mesures d’Artificial Analysis citées par Google, ce qui en fait un des modèles les plus rapides du marché.

Ce mouvement n’est pas isolé. OpenAI a suivi la même pente en juin quand GPT-5.6 Sol a repris la tête sur le code tout en baissant ses prix. La compétence descend la gamme, trimestre après trimestre.

Trois fois moins cher que son équivalent chez Anthropic

La comparaison qui compte pour un budget d’automatisation : chez Anthropic, le modèle rapide s’appelle Claude Haiku 4.5, et Flash-Lite fait payer trois fois moins en entrée, deux fois moins en sortie. Chez Google même, le 3.6 Flash coûte cinq fois plus cher en entrée. La grille tarifaire des modèles rapides se lit désormais ainsi :

Le prix du million de tokens, modèle rapide par modèle rapide

ModèleEntrée ($/M)Sortie ($/M)Positionnement
Gemini 3.5 Flash-Lite0,30 $2,50 $Volume : tri, extraction, code léger
Claude Haiku 4.51,00 $5,00 $Rapide chez Anthropic
Gemini 3.6 Flash1,50 $7,50 $Milieu de gamme Google, agentique
Claude Sonnet 53,00 $15,00 $Qualité proche Opus, production

Concrètement, ce sont toutes les briques discrètes d’un système automatisé qui basculent dans une autre catégorie de coût : l’agent qui trie une boîte mail partagée, le workflow n8n qui extrait les champs d’une facture, le routeur qui qualifie un lead avant de le pousser dans le CRM. Ces tâches tournent des centaines ou des milliers de fois par jour, et chacune ne justifie pas un modèle premium. Quand l’entrée de gamme devient fiable sur du code et du raisonnement court, l’arbitrage se déplace : on réserve les gros modèles aux étapes qui pensent, et on confie tout le volume au petit.

Reste une réserve d’usage : un benchmark de code ne dit rien de la tenue en français soutenu ni de la finesse sur des consignes ambiguës. Sur ces terrains, l’écart avec les modèles supérieurs demeure, et c’est précisément ce qui justifie de garder une architecture à deux étages plutôt que de tout basculer sur le moins cher. Notre comparatif des meilleurs LLM pour un usage professionnel détaille cette logique de répartition par tâche.

Au-dessus, le 3.6 Flash travaille plus en écrivant moins

L’annonce du 21 juillet porte aussi un successeur au modèle principal : Gemini 3.6 Flash. Sa particularité la plus intéressante n’est pas un score mais une sobriété : il consomme 17 % de tokens de sortie en moins que son prédécesseur à travail égal, et Google en profite pour baisser le prix de sortie de 9 à 7,50 dollars le million. Une réponse plus courte facturée moins cher, l’économie se cumule.

Sur le fond, les progrès se concentrent sur le travail agentique : 49 % sur DeepSWE contre 37 % pour la version précédente, et 83 % sur OSWorld-Verified, le test où le modèle pilote un ordinateur complet. Ses connaissances s’arrêtent désormais à mars 2026, contre janvier 2025 auparavant, un bond qui réduit le besoin de recherche web pour les sujets récents.

Google glisse au passage que Gemini 3.5 Pro est en test chez des partenaires et que l’entraînement de Gemini 4, « le plus ambitieux » de l’histoire de DeepMind, est en cours. Le calendrier s’accélère.

Un troisième acteur rejoint le club des modèles sous clé

Le troisième modèle de l’annonce ne sera pas dans votre console API. Gemini 3.5 Flash Cyber, spécialisé dans la détection et la correction de vulnérabilités, est réservé aux gouvernements et à des partenaires approuvés. Il motorise CodeMender, l’outil de Google qui corrige automatiquement des failles dans le code open source.

Le schéma est désormais familier : Anthropic garde Claude Mythos derrière Project Glasswing, OpenAI distribue GPT-5.4-Cyber en accès restreint, et la course aux IA offensives se joue en club fermé depuis le printemps. Google formalise à son tour ce que nous décrivions dans notre analyse des modèles jugés trop capables pour une diffusion libre : les capacités cyber de pointe ne sortent plus par l’API publique.

Deux vitesses se dessinent donc chez tous les laboratoires en même temps. Vers le bas, des modèles toujours moins chers et plus compétents, poussés en libre-service pour capter le volume. Vers le haut, des capacités triées sur le volet, distribuées à qui montre patte blanche. Entre les deux, celui qui construit des automatisations récupère la meilleure affaire : le prix du bas de gamme vient de cesser d’être un compromis.

À lire en ce moment