Une nouvelle recherche vient de soumettre des agents IA à un test économique simulé de 90 jours
Les résultats ? Les agents dérivent, se laissent aller et hallucinent des appels d'outils quand personne ne regarde de près. Un benchmark a révélé que les meilleurs agents ne réussissent qu'une minorité des tâches difficiles. Un autre a trouvé que la désinformation peut se propager entre les agents qui se débattent comme des potins lors d'un dîner
Traduction : la plupart des agents peuvent bien parler. Vérifier ce qu'ils ont réellement fait est la partie non résolue
Ce n'est pas un problème de benchmark. C'est un problème d'infrastructure
C'est le fossé pour lequel Origins a été construit… identité, prouvabilité
Les benchmarks continueront à devenir plus difficiles. La question est de savoir si vos agents peuvent prouver qu'ils ont réussi
Et
Plus important encore, si l'infrastructure pour les faire fonctionner à grande échelle, tout en gardant votre propriété, est là
Pensez à cette dernière partie… vous reliez les points
Les résultats ? Les agents dérivent, se laissent aller et hallucinent des appels d'outils quand personne ne regarde de près. Un benchmark a révélé que les meilleurs agents ne réussissent qu'une minorité des tâches difficiles. Un autre a trouvé que la désinformation peut se propager entre les agents qui se débattent comme des potins lors d'un dîner
Traduction : la plupart des agents peuvent bien parler. Vérifier ce qu'ils ont réellement fait est la partie non résolue
Ce n'est pas un problème de benchmark. C'est un problème d'infrastructure
C'est le fossé pour lequel Origins a été construit… identité, prouvabilité
Les benchmarks continueront à devenir plus difficiles. La question est de savoir si vos agents peuvent prouver qu'ils ont réussi
Et
Plus important encore, si l'infrastructure pour les faire fonctionner à grande échelle, tout en gardant votre propriété, est là
Pensez à cette dernière partie… vous reliez les points