Le Zero-shot learning permet à des modèles d’IA de résoudre des tâches pour les­quelles ils n’ont reçu aucun exemple d’en­traî­ne­ment. Cela rend les systèmes plus flexibles, plus adap­tables et les rapproche d’une forme d’in­tel­li­gence plus générale.

Qu’est-ce que le Zero-shot learning ?

Le Zero-shot learning désigne une méthode d’ap­pren­tis­sage au­to­ma­tique dans laquelle un modèle d’in­tel­li­gence ar­ti­fi­cielle traite des classes ou des tâches qui ne font pas ex­pli­ci­te­ment partie de son en­traî­ne­ment.

Au lieu de s’appuyer sur des exemples concrets, le modèle utilise des des­crip­tions sé­man­tiques, des attributs ou des ins­truc­tions en langage naturel. Il peut ainsi déduire des concepts inconnus à partir de con­nais­sances déjà acquises.

On peut con­si­dé­rer cette approche comme une forme de devinette in­tel­li­gente, basée sur un savoir structuré plutôt que sur le hasard. Le modèle établit des liens entre les sig­ni­fi­ca­tions apprises et de nouveaux concepts.

Cette approche est par­ti­cu­liè­re­ment utile dans les domaines com­por­tant de nom­breuses classes ou des classes rares, pour les­quelles il existe peu ou pas de données d’en­traî­ne­ment. Elle permet une uti­li­sa­tion plus efficace des données et élargit fortement les pos­si­bi­li­tés d’ap­pli­ca­tion de l’in­tel­li­gence ar­ti­fi­cielle.

Outils d'IA
Exploitez toute la puissance de l'in­tel­li­gence ar­ti­fi­cielle
  • Créez votre site Web en un temps record
  • Boostez votre activité grâce au marketing par IA
  • Gagnez du temps et obtenez de meilleurs résultats

Comment fonc­tionne le Zero-shot learning ?

Le Zero-shot learning fonc­tionne en per­met­tant aux modèles d’IA d’exploiter ce que l’on appelle des espaces sé­man­tiques. Il s’agit d’espaces ma­thé­ma­tiques dans lesquels les sig­ni­fi­ca­tions sont re­pré­sen­tées sous forme de vecteurs nu­mé­riques. Pour sim­pli­fier : les mots, pro­prié­tés ou des­crip­tions sont projetés de manière à ce que les sens si­mi­laires soient proches les uns des autres.

Les nouvelles classes ou tâches sont intégrées dans cet espace de sig­ni­fi­ca­tions via des des­crip­tions tex­tuelles, des attributs ou des ins­truc­tions en langage naturel. En parallèle, le modèle trans­forme également des images, des fichiers audio ou d’autres types de données en vecteurs com­pa­rables. Ainsi, tous les types d’entrée, qu’il s’agisse de texte ou d’image, sont re­pré­sen­tés dans un même espace sé­man­tique.

Ensuite, le modèle identifie la cor­res­pon­dance sé­man­tique la plus proche entre une nouvelle entrée et une des­crip­tion dis­po­nible, puis les associe. L’in­ter­mo­da­lité joue ici un rôle central : le modèle peut relier des in­for­ma­tions provenant de dif­fé­rentes sources, par exemple du texte et des images. Ces systèmes utilisent souvent des ar­chi­tec­tures de type Trans­for­mer, capables de traiter ef­fi­ca­ce­ment langage et données visuelles dans une re­pré­sen­ta­tion commune.

Pendant l’en­traî­ne­ment, l’IA apprend quels motifs, relations et sig­ni­fi­ca­tions sont typiques de certains concepts ou tâches. Lors de l’uti­li­sa­tion en Zero-shot learning, il suffit ensuite de fournir un prompt en langage naturel décrivant la tâche à réaliser.

Le modèle utilise alors ses con­nais­sances lin­guis­tiques et con­tex­tuelles pour résoudre la tâche sans exemples spé­ci­fiques. Il ne se limite pas à des motifs su­per­fi­ciels, mais établit des liens logiques entre les sig­ni­fi­ca­tions, ce qui lui permet aussi de traiter des tâches complexes ou abs­traites.

Quelles sont les formes de Zero-shot learning ?

Le Zero-shot learning existe sous plusieurs variantes, qui se dis­tin­guent par la manière dont les in­for­ma­tions sont ex­ploi­tées et combinées. Dans de nombreux cas, il s’agit de re­con­naître des classes inconnues, mais chaque approche repose sur un mécanisme spé­ci­fique.

Zero-shot learning basé sur les attributs

Avec cette méthode, les classes sont décrites à l’aide de listes d’attributs, par exemple « a des rayures », « a quatre pattes » ou « vit dans l’eau ». Le modèle apprend d’abord à re­con­naître ces attributs, puis associe les objets inconnus aux com­bi­nai­sons cor­res­pon­dantes.

Cette variante a été l’une des premières formes de Zero-shot learning et convient par­ti­cu­liè­re­ment aux tâches de clas­si­fi­ca­tion visuelle. Elle nécessite toutefois des ensembles d’attributs bien définis et struc­tu­rés. L’approche est précise, mais re­la­ti­ve­ment peu flexible.

Zero-shot learning basé sur les espaces de vecteurs

Dans le Zero-shot learning basé sur les vecteurs, les données d’entrée et les des­crip­tions sont projetées dans un espace vectoriel commun. Le modèle cherche ensuite la re­pré­sen­ta­tion sé­man­tique la plus proche.

Cette méthode sert de base à des modèles mul­ti­mo­daux modernes comme CLIP. Elle est très flexible et fa­ci­le­ment ex­ten­sible, et fonc­tionne aussi avec du langage naturel ou des données non struc­tu­rées. Son ef­fi­ca­cité dépend cependant fortement de la qualité des em­bed­dings.

Zero-shot learning génératif

Les modèles d’IA gé­né­ra­tive comme les Ge­ne­ra­tive Ad­ver­sa­rial Networks (GAN) ou les modèles Stable Diffusion génèrent des exemples ar­ti­fi­ciels pour des classes inconnues à partir de leurs des­crip­tions.

Le Zero-shot learning se rapproche ici du Few-shot learning. Cette approche permet de combler les lacunes de données, notamment lorsque les données réelles sont rares ou in­dis­po­nibles. En revanche, les exemples générés peuvent parfois in­tro­duire des biais ou des re­pré­sen­ta­tions inexactes.

Quels sont les domaines d’ap­pli­ca­tion du Zero-shot learning ?

Le Zero-shot learning est utilisé dans de nombreux domaines où la flexi­bi­lité est plus im­por­tante que la quantité de données dis­po­nibles :

  • Computer Vision : en Computer Vision, le Zero-shot learning permet de classer des objets rares ou nouveaux sans disposer de données d’en­traî­ne­ment sup­plé­men­taires.
  • Analyse du langage : en trai­te­ment du langage, la méthode est utilisée pour détecter de nouvelles ca­té­go­ries de sen­ti­ments ou de nouveaux thèmes sans an­no­ta­tion manuelle.
  • Systèmes de re­com­man­da­tion : dans les systèmes de re­com­man­da­tion, cette approche aide à intégrer im­mé­dia­te­ment de nouveaux produits ou contenus.
  • Robotique : en robotique, il permet aux machines de com­prendre de nouvelles tâches sans dé­mons­tra­tion préalable.
  • Médecine : en médecine, la méthode ZSL peut con­tri­buer à iden­ti­fier des pa­tho­lo­gies décrites à l’écrit.

Le Zero-shot learning joue aussi un rôle important dans de nombreux usages des Large Language Models (LLM), qui doivent cons­tam­ment in­ter­pré­ter de nouvelles tâches et formats. La méthode peut également être utile en cy­ber­sé­cu­rité pour détecter des types d’attaques jusqu’alors inconnus.

Quels sont les avantages et in­con­vé­nients du Zero-shot learning ?

Cette approche est per­for­mante, mais loin d’être simple. S’il offre d’im­por­tants avantages en termes de flexi­bi­lité, il dépend fortement d’une sé­man­tique fiable et de re­pré­sen­ta­tions de données robustes.

Avantages du Zero-shot learning

Le Zero-shot learning permet de re­con­naître des classes en­tiè­re­ment nouvelles sans coûts d’en­traî­ne­ment sup­plé­men­taires. Les modèles né­ces­si­tent ainsi moins de données, plus efficaces et plus rapides à déployer.

Les en­tre­prises peuvent utiliser ces systèmes sans devoir cons­ti­tuer de grands jeux de données ni mettre en place des processus de la­bel­li­sa­tion coûteux. La capacité de gé­né­ra­li­sa­tion du modèle augmente nettement, ce qui est crucial dans des en­vi­ron­ne­ments dy­na­miques. Les modèles réa­gis­sent mieux aux chan­ge­ments et né­ces­si­tent moins de main­te­nance.

De plus, le Zero-shot learning ouvre des cas d’usage que l’ap­pren­tis­sage au­to­ma­tique classique ne peut pas couvrir.

In­con­vé­nients du Zero-shot learning

Le principal in­con­vé­nient est la forte dé­pen­dance à la qualité des in­for­ma­tions sé­man­tiques. Des erreurs dans les des­crip­tions ou les em­bed­dings peuvent entraîner des pré­dic­tions in­cor­rectes.

Il existe également un risque de biais sé­man­tiques, car les modèles peuvent re­pro­duire des biais présents dans leurs données d’en­traî­ne­ment lors du transfert vers de nouvelles classes. Les modèles de Zero-shot learning sont par ailleurs plus dif­fi­ciles à évaluer, puisqu’il n’existe pas d’exemples d’en­traî­ne­ment pour les classes cibles.

Dans les domaines critiques, cette in­cer­ti­tude peut poser problème. Enfin, la mise en œuvre est tech­ni­que­ment exigeante, en par­ti­cu­lier lorsqu’elle implique des données mul­ti­mo­dales.

Aperçu des avantages et in­con­vé­nients du Zero-shot learning

Avantages In­con­vé­nients
Ne requiert aucun exemple d’en­traî­ne­ment pour les nouvelles classes Forte dé­pen­dance à la qualité sé­man­tique
Réduit les coûts et le temps liés à la cons­ti­tu­tion des données Risque de biais et de mauvaises in­ter­pré­ta­tions
Forte capacité de gé­né­ra­li­sa­tion Éva­lua­tion difficile des nouvelles classes
Très flexible dans des en­vi­ron­ne­ments dy­na­miques Ar­chi­tec­tures de modèles tech­ni­que­ment complexes
Permet des ap­pli­ca­tions avec des concepts rares ou nouveaux Moins adapté aux en­vi­ron­ne­ments critiques exigeant une va­li­da­tion élevée
Aller au menu principal