Un modèle téléchargeable plutôt qu'un nouvel appel à l'indépendance numérique
Le 3 octobre 2026, jour de la Fête de l'unité allemande, la société heidelbergeoise Aleph Alpha a publié les poids complets de Kolibri, un modèle de raisonnement bilingue allemand-anglais, sous licence Apache 2.0 et disponible sur Hugging Face. L'entreprise le présente comme destiné aux administrations publiques, aux industriels et au secteur aérospatial, c'est-à-dire aux organisations qui veulent exploiter un modèle performant sans céder le contrôle de leur infrastructure.
Kolibri est un transformeur à mélange d'experts comptant 78,1 milliards de paramètres au total, dont 3,46 milliards activés à chaque token, soit environ 4,4 % de la capacité totale. Le modèle a été entraîné sur des infrastructures situées en Allemagne et en Finlande. Sa limite de connaissances est fixée au 18 juin 2026 pour les deux langues prises en charge. Aleph Alpha annonce une fenêtre de contexte allant jusqu'à 1 048 576 tokens, mais ses propres documents précisent que la longueur réellement entraînée est de 262 144 tokens, le passage au million de tokens nécessitant une configuration de service spécifique. L'entreprise recommande d'ailleurs de ne pas dépasser 262 144 tokens pour les tâches complexes ou sensibles à la latence. Le chiffre d'un million de tokens est donc un plafond validé, pas le point de fonctionnement conseillé pour la majorité des usages.
Une architecture pensée pour réduire le calcul, pas la mémoire
Kolibri répartit chaque token vers 6 des 384 experts disponibles, plus un expert partagé auquel chaque token est systématiquement soumis, sur 50 couches au total. Dix de ces couches traitent l'intégralité du contexte, les quarante autres se limitent à une fenêtre glissante de 512 tokens, ce qui contient le coût de calcul même sur de longs documents. Cette conception clairsemée réduit le calcul actif par rapport à un modèle dense de taille comparable, mais pas le besoin de mémoire : la version FP8 du modèle occupe environ 78 gigaoctets, ce qui impose au minimum deux GPU A100 ou H100 de 80 Go, ou un seul H200, B200 ou B300. Des poids ouverts ne signifient donc pas un déploiement léger.
Aleph Alpha a conçu un tokenizer bilingue de 128 000 entrées, baptisé UniBPE, spécifiquement adapté aux mots composés allemands. L'entreprise revendique 11,2 % de tokens en moins que le tokenizer de GPT-5 sur du texte allemand. Un test indépendant mené sur la Loi fondamentale allemande par le blogueur technique Tejas, non affilié à Aleph Alpha, a mesuré un écart encore supérieur, de 15 %, pour un résultat quasi identique en anglais. C'est l'un des rares éléments de cette annonce vérifié hors du cadre fourni par l'éditeur.
L'entraînement principal a mobilisé 768 GPU Nvidia B200 pendant 21 jours pour 20 000 milliards de tokens de préentraînement, suivis d'un entraînement intermédiaire et d'une adaptation au contexte long, pour un total proche de 24 000 milliards de tokens. L'allemand représente environ 21,3 % du mélange de préentraînement, soit 4 300 milliards de tokens, contre environ 62 % pour l'anglais et 14 % pour le code. Aleph Alpha estime à 950 mégawattheures l'énergie consommée pour le préentraînement, l'entraînement intermédiaire et l'adaptation au contexte long, en précisant que ce chiffre exclut l'apprentissage par renforcement, les états d'inactivité et les modèles proxy expérimentaux.
Deux définitions concurrentes de la souveraineté
Aleph Alpha définit la souveraineté par la possession : les clients téléchargent les poids, choisissent leur infrastructure et peuvent opérer sans transmettre chaque requête à un fournisseur externe. L'entreprise insiste sur le fait que les équipes ont construit, entraîné et évalué Kolibri intégralement en Allemagne et en Finlande, sous droit européen et allemand, sans contrôle étranger sur le pipeline.
Une approche concurrente, déjà déployée en Allemagne, définit la souveraineté par la gouvernance locale plutôt que par la propriété du modèle. L'initiative associant OpenAI, SAP et Microsoft repose sur Delos Cloud, une infrastructure utilisant la technologie Azure au sein d'une structure conçue pour répondre aux exigences allemandes de souveraineté. SAP a annoncé le passage de cette infrastructure à 4 000 GPU pour les charges de travail d'IA, et les trois partenaires visent l'administration publique, les instituts de recherche et la gestion documentaire, soit exactement le marché que vise Kolibri.
| Dimension | Kolibri (poids ouverts) | OpenAI for Germany (OpenAI, SAP, Microsoft) |
|---|---|---|
| Propriété du modèle | Poids téléchargeables, Apache 2.0 | Modèle propriétaire, accès via service géré |
| Infrastructure | Choisie et exploitée par le client | Delos Cloud, technologie Azure |
| Dépendance au fournisseur par requête | Aucune une fois le modèle déployé | Maintenue via le service géré |
| Support et écosystème | En construction, pas d'hébergeur tiers au lancement | Support établi, relations d'achat existantes |
| Compétences internes requises | Élevées : GPU dédiés, expertise d'inférence | Plus faibles : service managé |
Ce que montrent les benchmarks, et ce qu'ils ne prouvent pas
Les scores publiés par Aleph Alpha sont obtenus avec ses propres outils d'évaluation, en utilisant pour chaque modèle le niveau de raisonnement le plus élevé disponible. Aucun tiers n'a reproduit ces résultats à ce jour. L'entreprise revendique un score global de 75,5 en anglais et 70,8 en allemand, et situe Kolibri sur la frontière de Pareto qualité/coût de service dans les deux langues, affirmant qu'il égale des modèles disposant de jusqu'à quatre fois plus de paramètres actifs.
| Test | Kolibri | Qwen3.6-35B-A3B | Nemotron 3 Super 120B-A12B | Mistral Small 4 119B-A6B |
|---|---|---|---|---|
| AIME 2025 | 96,9 | 84,6 | 91,7 | 79,8 |
| GPQA diamond | 84,3 | 83,4 | 78,0 | 74,7 |
| LiveCodeBench v6 | 85,9 | 82,5 | 82,0 | 71,2 |
| BFCL v4 (appel d'outils) | 61,4 | 67,2 | 61,0 | 58,0 |
Le modèle a aussi ses zones documentées de faiblesse, publiées par Aleph Alpha dans sa propre fiche : il se classe dernier d'une comparaison de douze modèles sur un test de connaissances sans document (51,0), répond correctement à seulement 14,8 % des questions d'un test de culture générale contre 22,2 % pour Qwen3.5-35B-A3B, et reste en retrait sur l'appel d'outils en plusieurs tours (39,8 contre 58,2 pour GLM-4.7 Flash) et sur des tâches d'agent de code (27,7 contre 39,7 pour Qwen3.5 sur Terminal-Bench 2.1). À 128 000 tokens de contexte, il obtient 67,9 contre 89,9 pour Qwen3.5, et ne reprend l'avantage qu'aux longueurs les plus extrêmes.
Le point le plus pertinent pour un usage administratif concerne l'abstention. Aleph Alpha a entraîné Kolibri avec un protocole qu'elle nomme Merlin-Arthur, destiné à lui faire reconnaître les cas où le contexte fourni ne permet pas de répondre. Le modèle évite une réponse fausse dans 44 % des cas d'un test de connaissances conçu pour piéger les modèles, contre 14,8 % pour son prédécesseur Kolibri Origin. La fiche du modèle place explicitement Kolibri du côté consultatif de l'aide à la décision et déconseille une utilisation sans supervision humaine.
Ce qui reste à démontrer avant un déploiement en production
Au jour du lancement, aucun hébergeur tiers ne proposait Kolibri en service géré. Le déploiement repose sur le paquet d'inférence et le greffon vLLM propres à Aleph Alpha, qui ne prend en charge qu'une version de vLLM à la fois. Les acheteurs ont donc toujours besoin de matériel de centre de données, d'une expertise opérationnelle et d'une couche applicative construite autour du modèle. Les poids ouverts donnent la possibilité d'exploiter le modèle sans dépendre d'Aleph Alpha pour chaque requête d'inférence, mais ils ne suppriment pas l'effort d'intégration.
Le secteur a déjà vu une stratégie comparable en France. Mistral s'appuie, selon une analyse publiée par Startup Fortune, sur les règles de résidence des données de l'Union européenne et sur les marchés publics plutôt que sur une course aux scores de référence face à Qwen ou Gemini. La logique d'Aleph Alpha avec Kolibri suit un chemin similaire : viser la part du marché allemand soumise au droit de la protection des données plutôt qu'une position généraliste.
Un contexte actionnarial qui complique le récit souverain
Le lancement de Kolibri intervient alors qu'Aleph Alpha s'intègre à Cohere à la suite d'une fusion. Selon des informations rapportées par TechCrunch et Sifted, qui citent une source proche du dossier relayée par le New York Times, les deux entreprises ont annoncé des discussions de fusion en avril 2026 et signé un accord définitif le 16 septembre 2026, valorisant l'ensemble combiné à environ 20 milliards de dollars. Le groupe Schwarz, propriétaire de Lidl et déjà actionnaire d'Aleph Alpha, aurait investi 600 millions de dollars dans l'opération, selon des informations rapportées par Global Banking and Finance et tech-insider.org. L'entité combinée doit opérer sous le nom Cohere, avec un siège partagé entre Berlin et Toronto. Jonas Andrulis, fondateur d'Aleph Alpha, a quitté son poste de directeur général pour présider le conseil d'administration. Selon Startup Fortune, Ilhan Scheer est devenu directeur général unique après le départ de Reto Spörri en septembre 2026.
Kolibri est ainsi le premier lancement de produit majeur issu de cette organisation restructurée. L'entraînement et le déploiement du modèle restent, selon Aleph Alpha, ancrés en Allemagne et en Finlande sous droit européen. Mais la structure de gouvernance de l'entreprise qui porte le projet évolue vers un ensemble transatlantique, ce qui mérite d'être gardé en tête par toute organisation qui fonderait son choix d'infrastructure sur la seule nationalité de l'éditeur.
Comment évaluer l'option sans s'engager dans l'infrastructure lourde
Pour un DSI francophone qui veut comparer Kolibri à d'autres familles de modèles avant d'investir dans du matériel de centre de données, des plateformes d'accès multi-modèles permettent de tester plusieurs architectures sous un seul abonnement plutôt que de déployer chaque modèle séparément. Moon AI, édité par Stellarr Studio SAS, propose ainsi l'accès à plus de 70 modèles, dont GPT, Claude, Gemini, Mistral, DeepSeek, Llama, Grok, Qwen et son modèle maison Moon 6, pour des tarifs allant de 9,90 à 249,90 euros TTC par poste et par mois selon la formule, avec une offre gratuite sans carte bancaire. L'application et le stockage sont hébergés chez OVHcloud, à Strasbourg et à Roubaix ; les requêtes adressées aux modèles tiers partent néanmoins chez leurs fournisseurs respectifs, après un passage par Moon Blur, un mécanisme qui remplace les données personnelles par des jetons avant l'envoi et les rétablit au retour. Ce procédé étant réversible, il s'agit d'une pseudonymisation au sens de l'article 4-5 du RGPD, pas d'une anonymisation. Cette approche répond à un besoin différent de celui que vise Kolibri : elle facilite la comparaison rapide de modèles sans investissement matériel, mais ne remplace pas un déploiement entièrement maîtrisé par l'organisation.
Questions fréquentes
Kolibri est-il gratuit à utiliser ?
Les poids sont librement téléchargeables sous licence Apache 2.0, mais exploiter le modèle exige au minimum deux GPU A100 ou H100 de 80 Go, ou un GPU H200, B200 ou B300. Les sources consultées ne communiquent pas de grille tarifaire pour un éventuel support commercial d'Aleph Alpha, et aucun hébergeur tiers ne proposait le modèle en service géré au moment du lancement.
Kolibri peut-il remplacer les modèles américains pour des administrations françaises ?
Kolibri est conçu comme un modèle bilingue allemand-anglais. Les textes sources ne mentionnent pas de prise en charge du français ni de déploiement annoncé dans des administrations françaises. Son usage prévu cible explicitement le secteur public allemand et des industries réglementées allemandes.
Les poids ouverts garantissent-ils la conformité réglementaire ?
Non. Aleph Alpha indique avoir conçu Kolibri en tenant compte du règlement européen sur l'IA, du code de bonnes pratiques pour les modèles à usage général et du RGPD, et a signé le code de bonnes pratiques GPAI de l'Union européenne. Mais la fiche du modèle elle-même place Kolibri du côté consultatif de l'aide à la décision et recommande une revue humaine systématique avant toute action, ce qui signale que le modèle seul ne suffit pas à garantir une conformité opérationnelle.
La fusion entre Aleph Alpha et Cohere change-t-elle la nature souveraine de Kolibri ?
Les informations disponibles indiquent que l'entraînement et le développement de Kolibri restent situés en Allemagne et en Finlande. Mais l'entreprise qui porte le projet évolue vers une structure transatlantique opérant sous le nom Cohere, avec un siège partagé entre Berlin et Toronto, selon des informations rapportées par plusieurs médias spécialisés. Les sources consultées ne précisent pas si cette évolution de gouvernance aura des conséquences sur le pipeline ou le statut souverain de Kolibri à moyen terme.