Z.ai, l'IA gratuite, illimitée et open source, peut désormais visualiser des images, des vidéos et des documents comme un humain

Z.ai (anciennement Zhipu AI) vient de lancer un modèle d'IA multimodal open source qui vise à être la référence open source des capacités de vision d'un modèle d'intelligence artificielle. Une alternative qui vise à concurrencer GPT-5 ou Claude Opus…

Ce modèle s'appelle GLM-4.6V et il a une grande capacité à comprendre visuellement les documents, le langage de processus et ce que l'on appelle « l'appel de fonction » que nous allons expliquer dans cet article. Tout cela dans un seul modèle que vous pouvez télécharger, installer et exécuter localement sans payer un seul centime.

GLM-4.6V est capable de traiter simultanément des vidéos, des images, des documents PDF contenant des centaines de pages et du texte. Et ce, avec une fenêtre contextuelle de 128 000 jetons. Ce qui équivaudrait à 150 pages d’un livre. Mais le plus important est que GLM-4.6V non seulement comprend ce qu'il voit, mais peut également exécuter des actions basées sur cette compréhension visuelle : de l'extraction de données de formulaires à la conversion de conceptions en code, en passant par la recherche d'informations sur des sites Web… une nouvelle opportunité pour les startups et les utilisateurs qui ont besoin de bonnes capacités d'IA, mais qui ne peuvent pas se permettre le GPT-5 et d'autres alternatives.

GLM-4.6V : vision native et appel de fonctions

Jusqu’à présent, les modèles linguistiques pouvaient traiter les images, mais uniquement en tant que « spectateurs passifs ». C’est-à-dire : ils ont reçu une photo, l’ont analysée et ont renvoyé un texte. GLM-4.6V donne une touche à ce modèle. Le système comprend les images, les vidéos et les documents aussi naturellement qu’il comprend le texte. Et donc il peut exécuter des actions directement en fonction de ce qu’il voit.

Si nous lui donnons une capture d'écran d'un site Web, il peut extraire des données d'un tableau, rechercher des informations associées et générer automatiquement un rapport. Si nous vous montrons un wireframe de conception, vous pouvez le convertir directement en HTML et CSS. Si vous traitez le PDF d'un contrat, par exemple, vous pouvez identifier une clause problématique, la résumer et suggérer d'éventuelles modifications.

Pour tout cela, il dispose d’une fenêtre contextuelle de 128 000 tokens. Cela signifie que le GLM-4.6V peut traiter, en une seule fois et sans assistance, ce qui équivaudrait à 150 pages de documentation, 200 diapositives PowerPoint, une vidéo d'une heure ou tout ce qui précède combiné. Il n’est donc pas nécessaire de fragmenter les informations. Une solution parfaite pour augmenter votre rythme de travail pour les audits visuels de documents, l'extraction de données à partir de fichiers numériques ou la conversion de conceptions visuelles en code.

Résultat des tests Benchmark effectués sur GLM-4.6V. Photo : capture Softzone.

GLM-4.6V vs modèles commerciaux

Le GLM-4.6V est non seulement open source, mais concurrence directement les modèles commerciaux considérés comme premium pour un dixième du prix. Dans les résultats des principaux benchmarks multimodaux, tels que MMBench, MathVista ou OCRBench, le modèle atteint des performances au niveau de GPT-5 et Claude Opus en termes de tâches de compréhension visuelle : analyse de documents, OCR et raisonnement logique sur graphiques.

Mais ce qui est vraiment important, au-delà de la performance, c'est sa proposition économique. Le GLM-4.6V dans le cloud coûte environ 30 cents par million de jetons pour l'entrée et 90 cents pour la sortie. Un chiffre qui dans GPT-5 atteint jusqu'à 30 dollars par million de jetons et celui dans Claude Opus atteint 15 dollars. Soit une différence de prix 50 à 100 fois supérieure.

Néanmoins, la version de bureau locale est entièrement gratuite, sous licence MIT. Nous pouvons donc l’avoir directement sur notre PC sans aucun type de coût ni d’abonnement. Nous pouvons ainsi avoir une IA sur notre ordinateur avec de grandes capacités visuelles et linguistiques sans compromettre le budget d’une petite entreprise. Et le fait qu'il soit open source signifie également que les développeurs peuvent modifier le modèle pour des cas d'utilisation spécifiques sans être liés aux politiques commerciales des grandes entreprises.