Sztuczna inteligencja coraz lepiej rozumie, co do niej mówimy. Ale czy równie dobrze rozumie, jak się czujemy? I czy możemy ufać jej ocenie na tyle, by na tej podstawie zmieniała sposób, w jaki z nami rozmawia? Badacze z zespołu Orange Research postanowili to sprawdzić.
Wyniki pokazują, że zanim pozwolimy AI interpretować nasze emocje, intencje czy zaangażowanie i dostosowywać do nich swoje zachowanie, warto zadać ważne pytanie. Czy AI, pytana kilka razy o to samo, za każdym razem odczytuje/ocenia z nas tak samo?
Jak analizują nas modele językowe
Wyobraźmy sobie rozmowę z wirtualnym asystentem. System nie tylko stara się zrozumieć treść wypowiedzi, ale mierzy sposób, w jaki mówimy. Na tej podstawie stwierdza, że jesteśmy zdenerwowani, znudzeni albo niezadowoleni i zmienia sposób prowadzenia rozmowy. Brzmi to jak krok w stronę bardziej naturalnej komunikacji człowieka z technologią. Problem pojawia się, gdy ta sama wypowiedź raz zostaje uznana przez AI np. za oznakę frustracji, a innym razem już nie.
To właśnie stabilność takich ocen zbadał zespół naszego Orange Research. Badacze analizowali trzy multimodalne duże modele językowe – GPT-4o Audio, Gemini 2.0 Flash oraz Gemini 2.5 Flash, sprawdzając powtarzalność ocen różnych stanów użytkownika.
Liczby pokazują skalę wyzwania. Spośród 213 analizowanych metryk opisujących stan użytkownika tylko 31 spełniło przyjęte przez badaczy kryteria niezawodności (minimum 90% stabilności). To ma znaczenie w przypadku systemów działających w czasie rzeczywistym. Jeśli AI ma zmienić sposób rozmowy dlatego, że rozpoznała u użytkownika określony stan, pojedyncza ocena musi być wystarczająco stabilna. Tymczasem badanie Orange Research pokazuje, że w wielu przypadkach nie powinniśmy przyjmować tego za pewnik.
Co ciekawe, nie oznacza to, że wszystkie niestabilne metryki są bezużyteczne. Część z nich zaczyna być wartościowa po zagregowaniu większej liczby obserwacji. Mogą więc pomagać np. w późniejszej analizie zależności między przebiegiem interakcji a satysfakcją, zaufaniem czy zaangażowaniem użytkowników. To jednak coś zupełnie innego niż podejmowanie decyzji o konkretnej osobie w trakcie trwania rozmowy.
Kiedy pomyłka zaczyna mieć znaczenie
Rozpoznawanie stanów użytkownika nie jest wyłącznie technologiczną ciekawostką. System, który potrafi właściwie odczytać sytuację, może lepiej dopasować komunikację do człowieka. Ale błędna interpretacja może działać dokładnie odwrotnie.
Jeśli AI uzna spokojnego użytkownika za zirytowanego albo zaangażowanego za znudzonego, może zacząć dostosowywać rozmowę do stanu, którego w rzeczywistości nie ma. Im większy wpływ takiej oceny na kolejne decyzje systemu, tym ważniejsza staje się pewność, że mierzymy rzeczywiście zachowanie człowieka, a nie zmienność samego modelu.