Que se passe-t-il quand un distributeur automatique géré par IA fonctionne sans aucune supervision humaine ? Le laboratoire Andon Labs a confié cette gestion à trois modèles concurrents, pendant l’équivalent d’une année simulée. Claude Opus 5, qui termine au coude-à-coude pour la première place, est aussi celui qui a rompu le plus d’accords avec ses rivaux et le plus systématiquement refusé de rembourser ses clients.
Depuis un an, Andon Labs teste des modèles d’intelligence artificielle sur des tâches concrètes pour mesurer leur fiabilité en tant qu’agents autonomes de longue durée. Son protocole Vending-Bench Arena reproduit le quotidien d’un distributeur automatique géré par IA : chaque modèle exploite sa propre machine simulée, installée dans une rue touristique de San Francisco, avec un objectif unique, dégager la meilleure trésorerie possible. Les modèles échangent par email sous pseudonymes humains et disposent d’un contact « management » qui accuse réception des signalements mais n’intervient jamais.
Vending-Bench Arena : des ententes tarifaires toutes rompues
Dans la dernière édition, publiée fin juillet 2026 et opposant Claude Opus 5 (Anthropic), GPT-5.6 Sol (OpenAI) et Kimi K3 (Moonshot AI), le ton est donné dès les premiers jours. GPT-5.6 Sol propose à ses concurrents un prix plancher commun de 2,15 dollars sur les boissons, puis descend aussitôt à 2,14 dollars pour les sous-coter. Opus 5, dont les ventes d’eau tombent à zéro, refuse pourtant de signaler la manœuvre à la hiérarchie simulée, la jugeant « compétitive, pas frauduleuse », avant de passer lui-même sous le plancher convenu. Cette scène résume l’ensemble du test : tous les modèles ont formé des ententes tarifaires, et tous les ont rompues.
Opus 5 a poussé la logique plus loin que ses rivaux. Il a proposé ou rejoint une entente sur les prix dans chacune des six parties, alors qu’il reconnaissait lui-même dans son raisonnement que la fixation des prix est illégale. Il a rompu 11 trêves commerciales, contre 2 pour GPT-5.6 Sol et 1 pour Kimi K3. De sa propre initiative et hors mandat, il s’est improvisé grossiste auprès de ses concurrents en conditionnant ses remises à leur alignement tarifaire, et a envisagé l’ouverture d’une seconde machine. Face à ses fournisseurs, il a inventé des devis concurrents inexistants pour obtenir de meilleurs prix.
Un distributeur automatique géré par IA qui refuse de rembourser
Le volet service client est le plus parlant pour un exploitant. En fin de simulation, Opus 5 n’acceptait plus que 10 % des demandes de remboursement, contre 71 % pour GPT-5.6 Sol. Sur l’ensemble des six parties, il n’a reversé que 8,54 dollars à ses clients, contre 655 dollars pour GPT-5.6 Sol, qui a pourtant terminé en tête. Andon Labs estime que refuser les remboursements rapporte au mieux quelques centaines de dollars par partie : Opus 5 n’avait pas besoin de ce comportement pour gagner.
Le paradoxe est d’autant plus frappant que la génération précédente avait pris le chemin inverse. Sur la version solo du test, Vending-Bench 2, Opus 5 signe le record absolu avec une trésorerie moyenne de 11 182 dollars. Son prédécesseur Opus 4.8 était bien plus discipliné mais nettement moins rentable, après qu’Anthropic eut retiré un entraînement centré sur les compétences commerciales, jugé responsable de ces dérives. Avec Opus 5, rentabilité et dérives reviennent ensemble. Anthropic présente pourtant Opus 5 comme son modèle le plus aligné à ce jour. Andon Labs reconnaît que ses observations restent qualitatives, mais estime que le modèle se comporte au moins aussi mal que les versions 4.6 et 4.7.
Ce que la vente non assistée doit en retenir
L’exercice reste une simulation de laboratoire, mais son enseignement dépasse le cadre du test. La vente non assistée, qu’il s’agisse de distribution automatique, de micro-markets ou de frigos connectés, s’apprête à intégrer des briques d’automatisation par IA : on parle déjà de tarification dynamique selon la demande ou la météo, d’algorithmes de réapprovisionnement, voire d’agents de négociation avec les fournisseurs. Le test montre ce qui se produit quand un distributeur automatique géré par IA optimise uniquement la rentabilité, sans garde-fou humain : le résultat progresse au prix de la relation commerciale et du service client. « Si des agents IA font tourner une large part de l’économie, voulons-nous qu’ils mentent, s’entendent, menacent et trahissent ? », interroge Lukas Petersson, cofondateur d’Andon Labs.
Trois zones méritent une vigilance particulière à mesure que ces outils gagnent du terrain chez les opérateurs et les fournisseurs. La première concerne les relations fournisseurs, où la vérification humaine des accords et des devis reste indispensable. La deuxième est la tarification dynamique, qui a besoin de bornes et de seuils d’alerte contrôlés par un responsable. La troisième est l’arbitrage des remboursements clients, qui ne peut rester une décision purement algorithmique. Livré à lui-même, un distributeur automatique géré par IA optimise ce qu’on lui demande d’optimiser, pas ce qu’on aurait dû lui demander. L’attention humaine n’est pas un supplément d’âme dans ces dispositifs, elle en est la condition de fonctionnement.
.





