Al treilea articol din seria Perceived AGI e despre adevăr
Al treilea articol din seria Perceived AGI e pe arXiv. În el mă întreb dacă putem face un asistent AI să spună când nu e sigur, de unde vine o informație și când s-a răzgândit.

Al treilea articol din seria Perceived AGI, Truth for Believable AI, este acum pe arXiv. Vine după Perceived AGI, articolul care pune bazele seriei, și după Entropy in Conversational AI.
Asistenții AI răspund la orice pe același ton sigur pe sine. Un lucru pe care îl știu ei și o presupunere sună la fel. Oamenii nu vorbesc așa. Spunem „nu sunt sigur”, spunem de unde am auzit ceva și ne răzgândim când cineva ne arată că am greșit.
În articol încerc să transform aceste trei obiceiuri în ceva ce se poate construi. Peste un model pe care nu îl modific pun un strat subțire. Pentru fiecare afirmație, stratul notează cât de sigur e modelul de ea și de unde vine informația: din ce știa deja modelul, din ceva ce a căutat, din ceva ce a dedus sau din ce i-ai spus tu. În funcție de asta, decide dacă răspunde direct, cu rezerve sau spune că nu știe. Mai ține minte corecțiile de la o conversație la alta, spune când s-a răzgândit și nu acceptă orice corecție i se dă.
Pe modelul mic pe care l-am testat, o parte a mers. Stratul a redus de aproximativ cinci ori răspunsurile greșite spuse cu convingere. Costul a fost că a răspuns la mai puține întrebări, iar răspunsurile pe care le-a dat au fost la fel de corecte. De fiecare dată când și-a schimbat părerea, a notat asta într-un jurnal care poate fi verificat. A acceptat corecțiile adevărate mai des decât pe cele false, deși multe corecții false tot au trecut. Altele n-au mers. Dacă te iei după probabilitățile pe care modelul le pune pe cuvintele lui, deosebești răspunsurile bune de cele greșite mai prost decât dacă ai da cu banul. O verificare pe care am adăugat-o ulterior a arătat că merge mai bine să pui aceeași întrebare de mai multe ori și să vezi dacă răspunsurile se potrivesc. Articolul spune deschis și ce n-a mers, iar înainte de un test cu oameni e nevoie de mult mai multe informații decât cele 60 pe care le-am folosit.
Vreau un asistent care spune sincer cât de sigur e: când se îndoiește, pe ce se bazează și când își schimbă părerea.
Seria ia pe rând câte o dimensiune a credibilității: timpul, entropia, adevărul și iubirea. Se încheie cu un studiu cu oameni, unde se vede dacă toate acestea chiar cresc încrederea. Codul și datele de test sunt publice, așa că oricine poate repeta testul pe un model mai mare.


