Définition d’un serveur d’inférence
Un serveur d’inférence est un logiciel qui permet aux applications d’intelligence artificielle (IA) de communiquer avec de grands modèles de langage (LLM) afin de générer une réponse basée sur des données. Ce processus s’appelle l’inférence et correspond au moment où le résultat final est fourni, c’est-à-dire là où l’entreprise crée de la valeur métier.
Pour fonctionner efficacement, les LLM nécessitent des ressources importantes en stockage, mémoire et infrastructure pour réaliser des opérations d’inférence à grande échelle, ce qui explique leur coût potentiellement élevé.
La réussite des stratégies d’IA dépend donc du matériel et des logiciels sur lesquels reposent les capacités d’inférence. Red Hat AI Inference Server optimise l’inférence pour permettre à vos équipes de monter en charge tout en maîtrisant les coûts.
Fonctionnement de Red Hat AI Inference Server
Red Hat AI Inference Server assure des opérations d’inférence rapides et rentables à grande échelle. Étant open source, il prend en charge tous les modèles d’IA générative, tous les accélérateurs d’IA et tous les environnements cloud.
Basé sur vLLM, ce serveur d’inférence optimise l’utilisation des GPU et réduit les temps de réponse. Associé à l’outil LLM Compressor, il augmente l’efficacité de l’inférence sans diminuer les performances. Grâce à son adaptabilité multiplateforme et à une communauté de contributeurs en pleine croissance, vLLM s’impose comme le Linux® de l’inférence d’IA générative.
Les modèles de votre choix
Red Hat AI Inference Server prend en charge tous les principaux modèles open source avec une portabilité flexible sur GPU. Vous pouvez même exécuter des modèles qui ne se limitent pas au texte et au code, comme des modèles de données géospatiales capables d’interpréter votre environnement physique.
Vous pouvez utiliser n’importe quel type de modèle d’IA générative ou choisir parmi notre collection de modèles open source tiers, optimisés et validés pour une exécution efficace sur la plateforme Red Hat AI.
La validation des modèles Red Hat AI est réalisée à l’aide d’outils open source tels que les frameworks GuideLLM, Language Model Evaluation Harness et vLLM, afin de garantir la reproductibilité.
Nos experts sont là pour répondre à toutes vos questions techniques.
Contacter un expertNos consultants experts sont à votre écoute pour comprendre vos besoins et vous proposer des solutions parfaitement adaptées.