Qu'est-ce que l'évaluation des LLM ?

Stephen M. Walker II · Co-fondateur / PDG

Qu'est-ce que l'évaluation des LLM ?

L'évaluation des LLM est l'évaluation systématique des Modèles de Langage à Grande Échelle (LLMs) afin de déterminer leur performance, leur fiabilité et leur efficacité dans diverses applications. Pour la plupart des ingénieurs, l'évaluation porte sur les réponses du modèle aux invites (prompts).

Les évaluations sont essentielles pour identifier les forces et les faiblesses des invites d'un LLM et pour guider les décisions de déploiement et d'itération.

Le processus d'évaluation comprend l'évaluation de la performance sur diverses tâches, l'analyse de la capacité de généralisation, l'évaluation de la robustesse face aux attaques adverses, ainsi que la prise en compte des biais, de l'équité et des considérations éthiques.

Les évaluations mesurent la capacité d'un LLM à générer des réponses précises, fluides et pertinentes par rapport au contexte, ce qui permet d'identifier ses capacités et ses axes d'amélioration.

Il existe plusieurs méthodes et métriques utilisées pour une évaluation holistique des LLM :

  • Évaluation du système — Évalue les composants du système que vous contrôlez, comme les invites et le contexte, en mesurant l'efficacité avec laquelle vos entrées déterminent vos sorties, la perplexité du modèle ou la pertinence de la récupération d'information.

  • Évaluation humaine — Évalue les sorties par un expert du domaine ou un utilisateur final représentatif, en intégrant des opinions subjectives dans des évaluations basées sur les préférences. Elle prend en compte des aspects comme la fluidité, la cohérence, la créativité, la pertinence et l'équité.

  • Évaluation comparative (benchmarking) — Évalue les modèles sur des tâches spécifiques à l'aide de métriques prédéfinies, puis les classe selon leur performance.

  • Engagement et rétention — Mesure l'engagement des utilisateurs avec les fonctionnalités LLM, la qualité de ces interactions et des métriques de second ordre. La rétention mesure l'adhérence d'une fonctionnalité ou d'une application, en comparant des cohortes activées ou non par l'IA.

  • LLM-comme-juge — Utilise un autre LLM pour évaluer les sorties du modèle testé, ce qui reflète les préférences humaines pour certains cas d'usage.

Pour construire une évaluation complète, combinez plusieurs mesures afin d'obtenir une vue d'ensemble. Utilisez à la fois des mesures qualitatives et quantitatives pour capturer les préférences déclarées et révélées en vue de l'optimisation du système.

LLM Evaluation peut être menée selon différentes méthodes, notamment :

  • Jeux de données spécifiques à un domaine — Utiliser des jeux de données pertinents pour un secteur ou une application donnée afin d'évaluer la performance.
  • Tests adverses — Évaluer la robustesse face à des attaques adverses pour tester la résilience à diverses entrées malveillantes.
  • Évaluation de l'invite et du contexte — Évaluer dans quelle mesure les entrées (invites) déterminent les sorties, par exemple en faisant varier le modèle d'invite tout en gardant le LLM constant.
  • Métriques automatisées — Utiliser des bibliothèques et outils comme Klu.ai ou la librairie OpenAI Eval, qui inclut des métriques comme HellaSwag, TruthfulQA et MMLU.

Évaluer les LLM est essentiel pour améliorer leur alignement avec les valeurs humaines et garantir leur utilité, leur sécurité et leur équité. Cette évaluation est également déterminante pour choisir le meilleur modèle pour une application donnée, et constitue un aspect central du LLMOps, qui se concentre sur le développement et l'optimisation des LLM.

Les méthodes d'évaluation existantes ne capturent pas toujours pleinement la diversité et la créativité des sorties des LLM, car elles se concentrent souvent uniquement sur la précision et la pertinence.

Il convient également de rester prudent vis-à-vis des benchmarks standardisés : ces méthodes reposent généralement sur des jeux de données ou des tâches de référence spécifiques, qui ne reflètent pas nécessairement les usages réels.

Benchmarks à explorer

Pour approfondir le sujet, ces benchmarks analysent en détail des métriques et méthodologies spécifiques pour évaluer la performance des grands modèles de langage. Ils offrent un éclairage précieux sur les forces et les faiblesses des LLM sur des tâches et domaines spécialisés.

Comment fonctionne l'évaluation des LLM ?

L'évaluation des Modèles de Langage à Grande Échelle implique d'apprécier des facteurs comme la fluidité linguistique, la cohérence, la compréhension contextuelle, l'exactitude factuelle et la capacité à générer des réponses pertinentes et sensées.

Plusieurs méthodes et cadres sont disponibles pour évaluer les LLM :

  • Évaluation du système LLM — Des plateformes comme Klu.ai proposent des évaluations automatisées à l'aide d'algorithmes, de code, d'embeddings, de retours humains ou de retours de type LLM-comme-juge, afin de simplifier le flux d'évaluation. Il s'agit d'une évaluation complète des composants que vous contrôlez dans votre système, comme l'invite (ou le modèle d'invite) et le contexte. Ces évaluations mesurent dans quelle mesure vos entrées déterminent vos sorties. La métrique de résultat dépend de ce que vous cherchez à évaluer.

  • Évaluation humaine — Des évaluateurs humains jugent la qualité des sorties du modèle selon divers critères. C'est la référence pour évaluer les LLM, car elle capture des nuances que les métriques automatisées peuvent manquer. Elle peut toutefois être subjective, sujette aux biais et coûteuse en temps, en particulier à grande échelle.

  • Métriques d'engagement et de satisfaction des utilisateurs — Ces métriques mesurent la fréquence à laquelle l'utilisateur interagit avec les fonctionnalités LLM, la qualité de ces interactions et la probabilité qu'il les réutilise. Elles s'appliquent à tout LLM et peuvent être construites directement à partir de la télémétrie collectée sur les modèles.

  • Métriques automatisées — Elles incluent des métriques comme BLEU ou ROUGE, qui nécessitent des données de référence pour la comparaison. Elles sont souvent utilisées en complément d'autres méthodes pour une évaluation plus complète.

  • Tâches de référence (benchmarks) — Elles incluent des évaluations comme AlpacaEval, MT-Bench, GAIA, MMMU ou MMLU, qui utilisent des questions et réponses standardisées pour évaluer la performance des modèles. Ces benchmarks sont utiles pour comparer la performance relative des LLM, mais ne reflètent pas toujours pleinement les défis des applications réelles, car ils évaluent sur un jeu de données contrôlé qui ne se généralise pas nécessairement aux scénarios diversifiés et dynamiques dans lesquels les LLM sont déployés.

Combiner ces méthodes permet d'obtenir une image plus précise de la performance du modèle et de mettre en évidence les axes d'amélioration. Le choix de la méthode d'évaluation dépend de facteurs comme le coût et la précision recherchée ; il est toutefois essentiel d'établir des procédures d'évaluation robustes pour tout système basé sur un LLM, et il est conseillé de rassembler des évaluations spécifiques à la tâche (invite, contexte et sorties attendues) comme référence.

Quelle est la différence entre l'évaluation en ligne et hors ligne ?

L'évaluation des LLM repose à la fois sur des méthodes en ligne et hors ligne. L'évaluation en ligne mesure les LLM en production, avec des données utilisateur réelles, en captant la performance et la satisfaction utilisateur en direct via des retours directs et indirects. Elle s'appuie sur les journaux (logs) de production, avec des évaluateurs configurés pour s'exécuter automatiquement à chaque nouvelle entrée.

L'évaluation hors ligne teste les LLM sur des jeux de données spécifiques, souvent dans un environnement d'intégration continue (CI), afin de s'assurer que les fonctionnalités respectent les standards de performance avant le déploiement. Cette méthode convient particulièrement à l'évaluation d'aspects comme le ton et la véracité, et peut être automatisée dans les pipelines de développement.

L'évaluation en ligne excelle à refléter la complexité des usages réels et intègre les retours des utilisateurs, ce qui en fait un bon outil de suivi continu de la performance. L'évaluation hors ligne, à l'inverse, offre un environnement contrôlé pour des tests et des itérations plus rapides, sans nécessiter de données en direct, ce qui la rend économique et adaptée aux vérifications avant déploiement et aux tests de non-régression.

Combiner les deux approches fournit un cadre robuste pour comprendre et améliorer la qualité des LLM tout au long du cycle de développement et de déploiement.

Comment évaluer l'engagement des utilisateurs d'une application LLM ?

Évaluer l'utilité des fonctionnalités LLM est essentiel pour s'assurer qu'elles apportent une valeur qui justifie leur coût. On peut utiliser un critère d'évaluation global (Overall Evaluation Criteria, OEC) pour l'évaluation de l'utilité au niveau produit, et des métriques d'usage et d'engagement spécifiques pour analyser l'impact direct des fonctionnalités LLM.

Opportunités et visibilité

  • Opportunités de suggestion de contenu — Nombre total d'appels au LLM, indépendamment de leur visibilité pour l'utilisateur.
  • Invites envoyées au LLM — Nombre total et fréquence des invites envoyées.
  • Réponses du LLM — Nombre total et fréquence des réponses du LLM.
  • Réponses vues par les utilisateurs — Nombre total et fréquence des réponses effectivement affichées, en tenant compte de la modération et de la pertinence.

Interaction utilisateur

  • Taux d'acceptation utilisateur — Fréquence d'acceptation par l'utilisateur, qui varie selon le contexte (inclusion de texte, retour positif dans un scénario conversationnel, etc.).
  • Rétention du contenu — Quantité et taux de contenu généré par le LLM conservé par les utilisateurs après une période donnée.

Qualité de l'interaction

  • Longueur des invites et des réponses — Longueur moyenne des invites et des réponses.
  • Timing des interactions — Temps moyen entre une invite et une réponse, et temps passé sur chacune.
  • Distance d'édition — Distance d'édition moyenne entre les invites des utilisateurs, et entre les réponses du LLM et le contenu conservé, révélant le raffinement des invites et la personnalisation du contenu.

Retour et rétention

  • Retour utilisateur — Nombre de réponses ayant reçu un pouce levé/baissé, en notant un biais potentiel lié à un faible taux de réponse.
  • Métriques de conversation — Longueur et durée moyenne des conversations, nombre de conversations et jours d'activité avec les fonctionnalités LLM.
  • Rétention utilisateur — Utilisateurs actifs quotidiens, taux de rétention des nouveaux utilisateurs, usage dès la première session.

Productivité des créateurs de contenu

  • Efficacité de création de contenu — Évaluation de la vitesse et de la qualité de création avec l'assistance du LLM.
  • Portée et qualité du contenu — Nombre d'utilisateurs et de sessions créant du contenu par document, nombre de documents édités avec l'assistance du LLM, nombre total de caractères conservés par utilisateur, longueur des interactions, nombre d'éditions et usage d'éléments riches (images, graphiques).
  • Effort d'édition — Temps moyen passé par les utilisateurs en mode édition.

Productivité des consommateurs de contenu

  • Efficacité de consommation de contenu — Évaluation de la vitesse et de la qualité de consommation des documents édités par le LLM.
  • Portée et qualité du contenu — Nombre d'utilisateurs et de sessions consommant du contenu par document, nombre de documents lus édités avec le LLM, actions de consommation (partage, commentaires) par document édité par IA.
  • Effort de consommation — Temps moyen passé en mode consommation par document et par utilisateur.

Comment évaluer l'utilisation de l'API ?

Pour évaluer l'efficacité économique d'un LLM, on mesure l'utilisation de l'API à travers la consommation de tokens. Les tokens représentent des fragments de mots et constituent les unités de base du traitement automatique du langage.

Avec les modèles OpenAI, un token correspond approximativement à 4 caractères ou 0,75 mot de texte anglais. La tokenisation convertit les invites en tokens d'invite (prompt tokens) et le texte généré en tokens de complétion (completion tokens). Chaque passe avant d'un LLM produit un token ; le nombre total de passes avant équivaut donc au nombre de tokens de complétion.

Métriques clés d'utilisation de l'API

  • Réponses d'erreur 429 — Le nombre d'erreurs 429 indique une surcharge du service. Pour évaluer la performance en période de pointe, examinez le 95e ou le 90e centile de ces erreurs.
  • Nombre total de tokens — Somme des tokens d'invite et de complétion ; c'est la métrique principale d'utilisation de l'API, sur laquelle repose généralement la facturation.
  • Tokens d'invite — Tokens provenant de l'invite d'entrée. Ils sont moins coûteux et peuvent être optimisés.
  • Tokens de complétion — Tokens générés en réponse. Ils constituent le principal facteur de coût et peuvent être contrôlés via le paramètre Max_Tokens.

Inefficacités à surveiller

  • Utilisation gaspillée — Suivre les tokens de complétion issus de réponses non exploitables afin de minimiser le gaspillage.
  • Réponses tronquées — Surveiller les réponses dont le finish_reason est length, révélant une troncature potentielle liée à la limite max_tokens.

Comment évaluer l'alignement et la sécurité de l'IA ?

L'IA responsable garantit un usage éthique, sûr et digne de confiance des systèmes d'IA. Elle vise un impact sociétal positif et équitable.

L'IA responsable est essentielle à mesure que les LLM montent en puissance. Des fournisseurs proposent des outils pour évaluer les fonctionnalités et applications LLM sur les plans de la qualité, de la sécurité et de la performance. Ces outils sont déterminants pour limiter les risques pour les utilisateurs et garantir une expérience positive tout au long du cycle de déploiement.

Métriques de filtrage de contenu

Les systèmes de filtrage de contenu identifient et atténuent les invites et réponses qui enfreignent les principes d'IA responsable. Ils fournissent des annotations qui alimentent des métriques telles que :

  • Erreurs HTTP 400 — Pourcentage d'invites classées dans une catégorie et un niveau de sévérité filtrés spécifiques.
  • Interruptions par filtre de contenu — Pourcentage de réponses interrompues par le filtre de contenu, indiqué par un finish_reason de type content_filter.

Ces annotations permettent également d'obtenir des statistiques détaillées par catégorie de filtrage.

Comment évaluer la performance de l'API d'un LLM ?

Évaluer la performance de l'API d'un LLM implique de mesurer la latence et le débit afin de garantir des interactions efficaces pour l'utilisateur. Il est important de suivre la latence à chaque niveau de l'interaction avec le LLM, ainsi que pour tout composant additionnel du flux applicatif.

Métriques de latence

  • Temps jusqu'au premier token — Mesure la durée entre l'envoi de l'invite par l'utilisateur et l'apparition du premier token, évaluée selon différents centiles.

Métriques de débit

  • Requêtes par seconde (RPS) — Nombre de requêtes traitées par le LLM par seconde.
  • Tokens par seconde — Nombre de tokens produits par seconde pendant le streaming de la réponse du LLM.

Quelles données sont nécessaires pour évaluer les préférences humaines ?

Pour les applications LLM qui n'utilisent pas Klu, il faut collecter manuellement les retours humains et les données de télémétrie du système.

Pour calculer les métriques, il est nécessaire de rassembler les données pertinentes issues de la réponse de l'API, ainsi que l'identifiant de l'utilisateur final depuis la télémétrie produit, afin de le transmettre à l'API.

Pour les fonctionnalités où le LLM modifie directement le texte de l'utilisateur, la télémétrie doit distinguer les éditions de l'utilisateur de celles du LLM. Cette distinction est essentielle pour mesurer précisément toute réduction du contenu généré par l'utilisateur lorsque le LLM propose de l'autocomplétion.

Comment évaluer le succès d'une application LLM ?

Tests A/B pour les fonctionnalités LLM — Les tests A/B sont essentiels pour mesurer l'impact des fonctionnalités LLM et prendre des décisions éclairées sur les évolutions du produit à partir des métriques précédentes.

Lancement d'une fonctionnalité LLM — Il est crucial de s'assurer que la fonctionnalité est performante et fiable dès son lancement, en optimisant la productivité tout en tenant compte du rapport coût-bénéfice.

Expérience en « drapeau caché » — Avant de rendre la fonctionnalité visible aux utilisateurs, menez une expérience où ses composants sont chargés sans être visibles, afin d'en confirmer la performance et la fiabilité. Il est recommandé d'activer ce drapeau pour les utilisateurs internes (dogfooding).

Expérience « zéro à un » — Le groupe de traitement dispose de la fonctionnalité LLM, le groupe témoin non. Mettez en place un déploiement progressif pour surveiller la capacité GPU et vérifier la stabilité des métriques produit, tout en recherchant des gains de productivité. Il est conseillé de commencer avec un groupe de test optimal qui permette d'apprendre tout en limitant les risques, puis d'élargir progressivement le déploiement jusqu'à 100 % une fois la stabilité confirmée.

Optimisation post-lancement — Après le lancement, continuez à affiner la fonctionnalité pour répondre aux besoins des utilisateurs : optimisation des invites, intégration de nouveaux modèles, amélioration de l'expérience utilisateur.

Expérience fantôme (shadow) — Ces expériences mesurent l'impact de changements sans exposer les utilisateurs : les réponses du groupe traitement et du groupe témoin sont générées à partir des mêmes entrées, mais seule la réponse du groupe témoin est affichée. Cela permet de comparer des métriques sensibles sans affecter l'expérience utilisateur (utilisation GPU, performance, latence, métriques d'invite), à l'exception des métriques nécessitant une interaction utilisateur.

Expérience 1-N — Les tests A/B classiques (expériences 1-N) permettent d'évaluer des changements de produit, y compris les fonctionnalités LLM, tout au long du cycle de vie de l'expérimentation.

À quoi ressemble un flux de travail type d'évaluation LLM ?

L'évaluation des LLM évalue systématiquement la performance, la fiabilité et l'efficacité d'un LLM à travers ses applications. Ce processus comprend le benchmarking, le calcul de métriques et l'évaluation humaine.

  1. Établir un benchmark — Créez un système d'évaluation dédié, basé sur un LLM, dont la tâche est d'étiqueter les données aussi efficacement qu'un humain aurait étiqueté votre « jeu de données de référence ».

  2. Choisir un LLM pour l'évaluation — Décidez quel LLM utiliser pour l'évaluation ; il peut être différent de celui utilisé par votre application. Ce choix est souvent influencé par le coût et la précision recherchée.

  3. Tester le système d'évaluation — À ce stade, vous disposez à la fois de votre modèle et de votre système d'évaluation testé, et avez validé que ce dernier fonctionne, avec une compréhension quantifiable de sa performance par rapport à la vérité terrain.

  4. Exécuter l'évaluation sur votre application — Utilisez votre système d'évaluation sur votre application pour mesurer sa performance et identifier des pistes d'amélioration.

  5. Amélioration continue — Des évaluations régulières basées sur un LLM favorisent l'amélioration continue, en permettant d'identifier des tendances de performance et de suivre les progrès dans le temps.

Pour une évaluation rigoureuse, utilisez des jeux de données diversifiés et des évaluations en conditions réelles. Mettez régulièrement à jour les benchmarks, corrigez les biais et maintenez un retour continu.

Quelles sont les bonnes pratiques pour l'évaluation des LLM ?

Pour une évaluation efficace, adoptez une approche rigoureuse et précise garantissant fiabilité, confiance et impact.

  • LLM comme juges — Utilisez des LLM avancés pour évaluer les sorties d'autres LLM. Des plateformes comme Klu.ai offrent cette capacité afin que les équipes IA obtiennent facilement un retour proche des préférences humaines.
  • Prise en compte de multiples facteurs — Évaluez les LLM en considérant un large éventail de facteurs, des aspects techniques aux nuances éthiques, afin de garantir des sorties de haute qualité et un alignement sociétal.
  • Évaluation du système — Évaluez les composants contrôlables du système, comme l'invite et le contexte ; la métrique dépend de l'aspect spécifique évalué.
  • Évaluation humaine — Malgré un biais potentiel, elle reste essentielle pour capturer les nuances que les métriques automatisées peuvent manquer.
  • Métriques multiples — Utilisez plusieurs métriques d'évaluation (comme BLEU ou ROUGE) pour une évaluation holistique.
  • Système de classement Elo — Utilisez le système Elo pour les comparaisons « A contre B », en prenant des précautions pour garantir la robustesse du classement, les calculs Elo individuels pouvant être volatils.
  • Jeux de données par composant — Créez un jeu de données d'évaluation pour chaque composant du système LLM afin d'obtenir l'évaluation la plus fiable possible.

Comment évaluer les invites (prompts) ?

L'évaluation des invites est cruciale pour les LLM car elle influence fortement les sorties. Elle se divise en évaluation du modèle LLM et évaluation de l'application LLM.

Des plateformes comme Klu.ai simplifient l'évaluation des applications LLM grâce à des fonctionnalités d'ingénierie des invites, de recherche sémantique, de contrôle de version, de tests et de suivi des performances.

L'évaluation des invites LLM comporte deux étapes. D'abord, établir un benchmark de métrique d'évaluation LLM en créant une évaluation dédiée basée sur un LLM capable d'étiqueter les données aussi efficacement qu'un « jeu de données de référence » étiqueté par un humain, puis comparer votre métrique à cette évaluation. Ensuite, exécuter cette métrique d'évaluation sur les résultats de votre application LLM.

Il est recommandé d'utiliser un échantillon représentatif des entrées utilisateur afin de réduire la subjectivité lors du réglage des invites. En raison de l'imprévisibilité de la qualité des invites générées par les LLM, garantir leur qualité est essentiel pour obtenir des sorties fiables.

Quelles sont les applications de l'évaluation des LLM ?

Les LLM ont de nombreuses applications dans différents domaines, et l'évaluation de leur performance est essentielle pour construire des applications robustes :

  • Évaluation de la performance — Évaluer les LLM selon des métriques comme la précision, la fluidité, la cohérence et la pertinence au sujet est essentiel pour comprendre leurs capacités et leurs limites.
  • Comparaison de modèles — Comparer la performance de différents LLM sur des tâches spécifiques aide à identifier les modèles à l'état de l'art et à suivre les progrès dans le temps.
  • Détection et atténuation des biais — Évaluer les LLM en matière d'équité et de transparence aide à s'assurer qu'ils n'exhibent pas de biais ou de comportements indésirables.
  • Satisfaction utilisateur et retour — Recueillir les retours utilisateurs et évaluer les réponses générées selon la créativité, le ton de marque, la pertinence et d'autres dimensions aide à améliorer l'expérience utilisateur.
  • Évaluation continue — Identifier les sorties insatisfaisantes, les marquer pour reproductibilité et les ajouter au jeu de données d'évaluation contribue à construire une application LLM robuste.

Pour évaluer et optimiser des applications propulsées par des LLM, il est essentiel de créer un jeu de données d'évaluation, de définir des critères de réussite pour chaque métrique et d'utiliser des cadres d'évaluation adaptés.

Parmi les méthodes d'évaluation innovantes figure RAGAS, qui évalue la récupération d'information des LLM selon plusieurs métriques (fidélité, pertinence, nocivité), ainsi que des plateformes comme Klu.ai pour itérer, tester, évaluer et surveiller les applications LLM. Des approches d'auto-évaluation, comme le LLM-comme-juge, peuvent également être utilisées pour comparer la performance d'un LLM à une notation humaine.

Quel est l'impact de l'évaluation des LLM sur l'IA ?

Les LLM ont un impact significatif sur le domaine de l'intelligence artificielle et le potentiel de transformer de nombreux secteurs :

  • Amélioration des capacités conversationnelles — Les LLM peuvent rendre les bots et assistants plus naturels et interactifs grâce aux techniques d'IA générative.
  • Génération de contenu original — Les LLM peuvent produire du contenu créatif original et pertinent dans des domaines comme l'image, la musique et le texte, ce qui les rend adaptés aux recommandations personnalisées.
  • Augmentation de la productivité — Certaines études indiquent que les LLM peuvent accroître la productivité sur des tâches comme la rédaction, les tâches répétitives ou créatives, et la génération d'idées lors de sessions d'idéation.
  • Transformation des opérations métier — Les LLM peuvent aider les entreprises à réduire leurs coûts et à améliorer leurs opérations en automatisant le service client, en menant des analyses concurrentielles par IA et en déployant des agents autonomes.
  • Ingénierie des données — Les LLM et l'IA générative peuvent jouer un rôle clé dans l'ingénierie des données, en aidant au nettoyage des données, à la gestion de leur qualité et à l'automatisation des politiques, directives et documentations.
  • Compréhension du langage naturel — Les LLM ont réalisé des progrès significatifs dans la compréhension du contexte et de l'intention derrière les requêtes humaines, rendant les interactions avec les systèmes d'IA moins mécaniques.

L'adoption des LLM comporte aussi des défis : coûts d'utilisation, confidentialité des données, précision des modèles et adaptation aux données propres à chaque entreprise. Pour intégrer efficacement les LLM dans leurs opérations, les entreprises ont besoin d'une expertise spécifique et doivent inscrire les LLM et l'IA générative dans leur feuille de route d'initiatives IA.

More terms

Continue exploring the glossary.

Learn how teams define, measure, and improve LLM systems.

Glossary term

What is the belief-desire-intention (BDI) agent model?

The belief-desire-intention (BDI) software model is a computational model of the mind that is used in artificial intelligence (AI) research. The model is based on the belief-desire-intention (BDI) theory of mind, which is a psychological theory of how humans think and make decisions.
Read term

Glossary term

What is a fuzzy set?

A fuzzy set is a mathematical concept that extends the classical notion of a set. Unlike in classical sets where elements either belong or do not belong to the set, in fuzzy sets, elements have degrees of membership. This degree of membership is represented by a value between 0 and 1, where 0 indicates no membership and 1 indicates full membership. The degree of membership can take any value in between, representing partial membership. This allows for a more nuanced representation of data, particularly when dealing with imprecise or vague information.
Read term

It's time to build

Collaborate with your team on reliable Generative AI features.
Want expert guidance? Book a 1:1 onboarding session from your dashboard.

Talk to sales