Cercetătorii au desfășurat un studiu pentru a evalua abilitatea inteligenței artificiale (AI) de a dezvolta strategii pe termen lung și de a colabora atât cu alte sisteme AI, cât și cu oameni. Această cercetare a fost prezentată la conferința NeurIPS 2025, care a avut loc în San Diego între 2 și 7 decembrie.
Experții au ales jocul Dungeons & Dragons (D&D) ca mediu de testare, datorită combinației sale unice de creativitate și reguli stricte. Această alegere permite evaluarea capacităților AI în rezolvarea problemelor complexe și în colaborarea cu jucătorii umani.
În cadrul experimentului, un model AI a preluat rolul de Dungeon Master (DM), coordonând povestea și interacțiunile din joc, în timp ce altele, împreună cu jucătorii umani, au acționat ca eroi. Denumit D&D Agents, acest cadru permite interacțiuni între diferite modele AI și jucători umani.
Simularea s-a concentrat pe întâlniri de luptă dintr-o aventură pre-scrisă, „Lost Mine of Phandelver”, testând trei modele AI: DeepSeek-V3, Claude Haiku 3.5 și GPT-4. Echipajul a evaluat modul în care aceste modele au demonstrat abilități de planificare pe termen mediu și lung, esențiale pentru aplicații din viața reală, precum gestionarea lanțului de aprovizionare.
Modelul Claude Haiku 3.5 a avut cele mai bune rezultate, având o utilizare eficientă a resurselor în scenarii mai dificile. De asemenea, a fost evaluată abilitatea modelelor de a rămâne în personaj pe durata jocului, utilizând un instrument denumit Acting Quality.
DeepSeek-V3 a generat reacții amuzante, dar a avut tendința de a reutiliza aceleași voci, în timp ce Claude Haiku 3.5 a adaptat discursul în funcție de rolul jucat. GPT-4 s-a situat între cele două, variind stilul de narațiune.
Studiul sugerează că acest tip de testare este vital pentru a înțelege cum AI poate funcționa independent și coerent. Cercetătorii intenționează să extindă cercetarea la campanii complete D&D, pentru a explora mai mult creativitatea și capacitatea AI de a improviza.








