OpenAI a publié une évaluation des performances des tâches de valeur économique de l'IA avec GDPvalPANews le 26 septembre. OpenAI a lancé un nouvel outil d'évaluation, GDPval, qui se concentre sur la mesure de la performance de l'IA dans les tâches de valeur économique du monde réel. GDPval couvre 44 professions dans neuf grandes industries qui contribuent le plus au PIB américain, les tâches étant conçues par des experts du secteur ayant en moyenne 14 ans d'expérience. Les résultats de l'évaluation montrent que le modèle Claude Opus 4.1 a près de la moitié de ses sorties équivalentes ou supérieures à celles des experts. OpenAI a déclaré qu'elle continuerait à élargir l'éventail et les détails de l'évaluation GDPval à l'avenir.
Voir l'original
Cette page peut inclure du contenu de tiers fourni à des fins d'information uniquement. Gate ne garantit ni l'exactitude ni la validité de ces contenus, n’endosse pas les opinions exprimées, et ne fournit aucun conseil financier ou professionnel à travers ces informations. Voir la section Avertissement pour plus de détails.
OpenAI a publié une évaluation des performances des tâches de valeur économique de l'IA avec GDPvalPANews le 26 septembre. OpenAI a lancé un nouvel outil d'évaluation, GDPval, qui se concentre sur la mesure de la performance de l'IA dans les tâches de valeur économique du monde réel. GDPval couvre 44 professions dans neuf grandes industries qui contribuent le plus au PIB américain, les tâches étant conçues par des experts du secteur ayant en moyenne 14 ans d'expérience. Les résultats de l'évaluation montrent que le modèle Claude Opus 4.1 a près de la moitié de ses sorties équivalentes ou supérieures à celles des experts. OpenAI a déclaré qu'elle continuerait à élargir l'éventail et les détails de l'évaluation GDPval à l'avenir.