Conformément à nos Engagements environnementaux et plus globalement à notre Mission d'entreprise commerciale à vocation éthique, nous créons et optimisons les modèles, les algorithmes, les données et les infrastructures réellement nécessaires à chaque cas d'usage.
Des architectures spécialisées et une ingénierie issue du calcul haute performance (HPC) permettent d'atteindre des performances à l'état de l'art sans le gaspillage engendré par des systèmes d'IA généralistes inutilement surdimensionnés.
Cette approche réduit les besoins en calcul, en stockage et en ressources réseau tout au long du cycle de vie de nos solutions, depuis l'entraînement jusqu'aux opérations quotidiennes d'inférence. Selon le cas d'usage, les technologies GenerIA peuvent fonctionner sur des processeurs classiques, des équipements "edge" ou du matériel mobile, consommer jusqu'à 90 % d'énergie en moins et atteindre une neutralité carbone auditée et certifiée.
La frugalité n'est pas une ambition revue à la baisse mais une ingénierie plus aboutie : davantage de performances réellement utiles, des coûts d'exploitation réduits et l'empreinte environnementale la plus faible possible.
Les grands modèles d'IA généralistes constituent rarement la réponse la plus efficace à un besoin métier clairement défini. Ces systèmes exigent énormément de mémoire, de puissance de calcul, d'électricité et de refroidissement alors qu'ils n'apportent souvent qu'une faible valeur supplémentaire pour des tâches spécialisées.
Dimensionnement adapté à chaque cas d'usage - GenerIA sélectionne l'architecture et la capacité du modèle en fonction de la complexité, du domaine de connaissances, des exigences de latence et de l'environnement de déploiement propres à chaque application.
Spécialisé plutôt que surdimensionné - Des données soigneusement sélectionnées et une spécialisation métier permettent à des systèmes plus optimisés de fournir des résultats hautement pertinents sans reproduire les coûts et l'empreinte environnementale d'un modèle universel déployé à très grande échelle.
A l'aune des résultats utiles - La frugalité s'évalue selon le rapport entre les performances fonctionnelles et les ressources nécessaires pour les atteindre. Un modèle plus petit n'est pas raisonnablement frugal s'il produit des réponses inutilisables ; un système efficace doit préserver ou améliorer la qualité de service requise.
L'impact environnemental ne se limite pas aux fonctions d'inférence des modèles. Il englobe la collecte et la préparation des données, l'entraînement, le stockage, le déploiement, les échanges réseau, la supervision et les éventuels réentraînements. GenerIA aborde la frugalité comme une discipline d'ingénierie appliquée à l'ensemble du système, avec une vision holistique et des optimisations transverses.
Moins de données inutiles - Des jeux de données pertinents, représentatifs et correctement gouvernés réduisent les besoins d'entraînement et de traitement tout en améliorant la précision dans le domaine concerné.
Moins de calculs inutiles - Le dimensionnement des modèles, l'optimisation des algorithmes et le ciblage des pipelines évitent de recourir à une génération coûteuse lorsqu'un système de recherche, un traitement déterministe ou un modèle spécialisé plus petit suffit - par exemple un modèle de Machine learning plutôt qu'un modèle génératif.
Moins de mouvements et de stockage inutiles - L'accès direct aux systèmes de stockage existants, l'optimisation de la localité des informations, l'indexation maîtrisée et la réduction du volume des données échangées limitent les duplications, les flux réseau et les besoins supplémentaires de persistance.
Mieux utiliser le matériel existant - Selon l'application, les modèles GenerIA peuvent fonctionner sur des processeurs classiques, des équipements "edge" ou du matériel mobile. Ils prolongent ainsi la durée de vie utile des équipements existants et réduisent la dépendance envers des infrastructures GPU actives en permanence. Nous encourageons également, lorsque cela est possible et raisonnable, le réemploi de matériels et de composants (notamment les processeurs, les GPU et la mémoire) tout en utilisant systématiquement des supports de stockage neufs afin de préserver la fiabilité et l'intégrité des données.
Partenariats privilégiés avec des concepteurs d'infrastructure - Des accords privilégiés avec des bâtisseurs de centres de données et de concepteurs de nuages privés nous permettent de tenir notre promesse de frugalité (et de souveraineté) de bout en bout. Nous approchons régulièrement les marchés ensemble, en mode consortium, avec des offres qui intègrent ce principe dès la conception.
Réduire les besoins en ressources permet également de diminuer les coûts d'infrastructure, d'énergie et d'exploitation. Des infrastructures de déploiement plus légères rendent l'IA professionnelle accessible à davantage d'organisations et facilitent son exploitation dans des environnements locaux, souverains ou déconnectés.
La frugalité renforce ainsi simultanément plusieurs autres caractéristiques des solutions GenerIA : leur souveraineté, leur flexibilité, leur accessibilité économique et leur résilience.
Notre méthodologie respecte les principes et les bonnes pratiques du référentiel AFNOR Spec 2314, auquel GenerIA a contribué. Ces pratiques couvrent l'ensemble du cycle de vie de l'IA, depuis l'évaluation initiale de l'utilité réelle d'un projet jusqu'à la mesure continue après son déploiement.
Analyse des besoins et de l'utilité - Avant de concevoir un modèle, nous identifions la tâche, la valeur attendue, les seuils de qualité et les ressources techniques disponibles. Nous déterminons également si chaque étape nécessite véritablement le recours à l'IA. Ne pas déclencher un appel inutile à un modèle constitue l'inférence la plus efficace possible.
Ingénierie de données ciblée - Les données sont sélectionnées pour leur pertinence, leur diversité et leur qualité plutôt qu'accumulées indistinctement. Le nettoyage, la déduplication, la normalisation et l'enrichissement des métadonnées maximisent l'information utile extraite de chaque donnée stockée et traitée.
Rationalisation des modèles - Nous évaluons différentes architectures au regard du cas d'usage et sélectionnons celle qui offre le meilleur rapport entre performances et ressources consommées. Selon les exigences, un processus peut combiner plusieurs modèles spécialisés de plus petite taille - notamment des modèles de Machine learning ou des architectures génératives de type Mixture of Experts (MOE) - plutôt que de dépendre d'un système unique surdimensionné.
Compression et optimisation numérique - Lorsque le cas d'usage le permet, des techniques telles que l'élagage et la quantification réduisent la taille des modèles, la pression exercée sur la mémoire et les besoins de calcul tout en préservant le niveau de précision requis.
Recherche efficace et optimisation du contexte - Les pipelines de recherche sélectionnent uniquement les informations nécessaires à la requête en cours. La réduction des éléments de contexte non pertinents diminue le nombre de tokens traités, la latence et l'énergie consommée par l'inférence, tout en améliorant généralement la précision des réponses.
Optimisation logicielle de niveau HPC - Des techniques avancées de profilage permettent d'identifier les goulots d'étranglement au niveau des CPU, des GPU, de la mémoire, du stockage et du réseau. Des implémentations efficaces, la maîtrise des traitements concurrents, le traitement par lots, la mise en cache et une exécution adaptée au matériel réduisent les infrastructures nécessaires pour atteindre les objectifs de performance.
Déploiement adapté à l'infrastructure - L'efficacité du matériel, son taux d'utilisation attendu, le PUE du centre de données, les sources d'électricité, les besoins de refroidissement et la distance réseau sont pris en compte lors de la sélection d'un environnement de déploiement. Un même modèle peut avoir des impacts très différents selon l'endroit et la manière dont il est exécuté.
Métrologie continue - La qualité fonctionnelle, la latence, l'activité de calcul et la consommation énergétique sont mesurées en production. Différentes configurations peuvent être comparées au moyen de tests contrôlés, ce qui permet au système d'améliorer son rapport performances vs ressources consommées.
Neutralité carbone mesurée - Une fois la consommation et les émissions associées réduites au minimum et quantifiées, l'empreinte résiduelle peut être intégrée à une démarche de neutralité carbone auditable et certifiable par un organisme indépendant. La neutralité carbone constitue ainsi l'étape finale de l'ingénierie frugale, pas un substitut à celle-ci.