technologie

Gemini en crise : google balance sur la montagne des hallucinations

Le monde de l’intelligenceartificielle est en ébullition, et les chatbots sont au cœur du débat. Une étude récente, menée par Legal Guardian Digital, révèle un constat alarmant : Google Gemini, malgré son partenariat colossal avec Apple, est loin d’être infaillible. Le modèle est, en fait, victime d’hallucinations – des erreurs factuelles flagrantes – jusqu’à 32% du temps, ce qui suscite des interrogations au sein même de la firme de Cupertino.

Une turbulence pour l’écosystème siri

Les LLM, ou Grands Modèles de Langue, fonctionnent en apprenant à prédire le mot suivant le plus probable dans une séquence. Lorsqu’ils sont confrontés à une question complexe ou ambiguë, ils peuvent, statistiquement, inventer des réponses, des chiffres, des dates… Un phénomène que les experts appellent « hallucination ». Il est impératif de toujours vérifier les informations fournies par ces outils, notamment ceux concernant les marchés financiers, les noms propres ou les dates historiques. L’erreur ne relève pas d’une faute de l’IA, mais d’une limitation de ses données d’entraînement.

L’étude révèle que 25% des travailleurs américains utilisent déjà ces chatbots de manière régulière. Il devient donc crucial de connaître leurs limites, et surtout, d’identifier ceux qui sont les plus susceptibles de produire des erreurs. Perplexity AI, quant à lui, affiche des taux d’hallucination bien plus faibles, ne dépassant que 13%.

Au-delà de gemini : les concurrents

Au-delà de gemini : les concurrents

DeepSeek et Grok, des modèles développés par DeepSeek et Elon Musk, se positionnent également comme des alternatives moins sujettes aux erreurs, avec des taux d’hallucination de 14% et 15% respectivement. Bien que DeepSeek ait été entraîné avec un budget significativement inférieur à celui de ChatGPT, il se montre étonnamment performant.

L’étude souligne également un autre point crucial : la fiabilité du service. Seuls Perplexity AI et Grok assurent une disponibilité quasi-continue, avec un uptime de 99,98% et 99,95% respectivement. Claude, quant à lui, affiche une fiabilité de 99,68%. ChatGPT et Gemini, malgré leur puissance, sont plus sujets aux interruptions, avec des taux d’uptime de 99,98% et 99,95% respectivement. L’indice de confiance, calculé sur la base de la fréquence des erreurs, du taux de satisfaction client et de la disponibilité, attribue à Perplexity AI une note de 85, contre 79 pour Grok et 50 pour ChatGPT. Meta AI, lui, se classe en bas de la hiérarchie avec un score de 37.

La situation est claire : l’IA générative est prometteuse, mais exige une vigilance constante. Google doit impérativement maîtriser les hallucinations de Gemini avant que son intégration à Siri ne pose des problèmes majeurs.