Une nouvelle recherche vient de soumettre des agents IA à un test économique simulé de 90 jours

Les résultats ? Les agents dérivent, se laissent aller et hallucinent des appels d'outils quand personne ne regarde de près. Un benchmark a révélé que les meilleurs agents ne réussissent qu'une minorité des tâches difficiles. Un autre a trouvé que la désinformation peut se propager entre les agents qui se débattent comme des potins lors d'un dîner

Traduction : la plupart des agents peuvent bien parler. Vérifier ce qu'ils ont réellement fait est la partie non résolue

Ce n'est pas un problème de benchmark. C'est un problème d'infrastructure

C'est le fossé pour lequel Origins a été construit… identité, prouvabilité

Les benchmarks continueront à devenir plus difficiles. La question est de savoir si vos agents peuvent prouver qu'ils ont réussi

Et

Plus important encore, si l'infrastructure pour les faire fonctionner à grande échelle, tout en gardant votre propriété, est là

Pensez à cette dernière partie… vous reliez les points