Określenie „bezkontaktowy wariograf” sugeruje, że kamera lub mikrofon wykonują tę samą pracę co klasyczny wariograf, tylko bez mankietu, pneumografów i elektrod. To myląca kategoria. Mikrofon rejestruje ciśnienie akustyczne, termowizor promieniowanie podczerwone, zwykła kamera zmiany światła odbitego od skóry, a okulometr położenie oka i źrenicy. Dopiero algorytm tworzy cechy, przypisuje im znaczenie psychologiczne i wydaje wynik. Żaden sensor nie obserwuje prawdy, zamiaru ani winy.

Zdalność może ułatwiać rejestrację i zmniejszać dyskomfort, ale usuwa również część kontroli. Nagranie zastane nie daje pewności co do mikrofonu, oświetlenia, stanu osoby, kolejności pytań ani przetwarzania pliku. Kamera może trafnie oszacować puls i jednocześnie nie wnosić nic do oceny prawdziwości wypowiedzi. System może odróżniać warunki laboratoryjne dzięki tłu, osobie pytającej albo długości zdań, zamiast dzięki badanemu konstruktowi.

Artykuł ocenia cztery rodziny pomiaru: analizę stresu głosowego, termografię twarzy, zdalną fotopletyzmografię oraz okulometrię. Pokazuje, jaki jest ich właściwy przedmiot, jakie artefakty powstają w łańcuchu przetwarzania i jak zaprojektować walidację, która nie myli sprawnego sensora z detektorem kłamstwa.

Cztery warstwy pytania

Przed badaniem trzeba rozdzielić co najmniej cztery poziomy:

  1. Pomiar fizyczny — czy urządzenie wiernie rejestruje dźwięk, temperaturę, modulację optyczną albo położenie źrenicy?
  2. Cecha fizjologiczna lub behawioralna — czy z danych można powtarzalnie odtworzyć wysokość głosu, zmianę temperatury, rytm serca, fiksację albo rozszerzenie źrenicy?
  3. Konstrukt psychologiczny — czy cecha jest w danych warunkach związana z pobudzeniem, wysiłkiem, uwagą lub rozpoznaniem?
  4. Hipoteza śledcza — czy obserwowany konstrukt pomaga rozróżnić konkurencyjne wyjaśnienia wypowiedzi konkretnej osoby?

Pozytywny wynik na wcześniejszym poziomie nie waliduje następnego. Zgodność rPPG z pulsoksymetrem potwierdza pomiar rytmu, nie swoistość rytmu dla oszustwa. Zmiana źrenicy po bodźcu może wskazywać uwagę lub wysiłek, ale nie określa źródła wiedzy ani prawdziwości odpowiedzi. Stres jest wspólnym skutkiem wielu stanów, w tym lęku niewinnej osoby przed błędnym oskarżeniem.

Wynik musi nazywać najbliższy uzasadniony poziom. Zdanie „w okresie odpowiedzi wzrosła estymowana częstość rytmu” jest sprawdzalne. Zdanie „kamera wykazała kłamstwo” pomija wszystkie pośrednie założenia.

Analiza stresu głosowego

Co znajduje się w nagraniu

Sygnał mowy łączy anatomię aparatu głosowego, fonację, artykulację, prozodię, język, treść, emocje, wysiłek, interakcję oraz właściwości kanału. System może wyznaczać częstotliwość podstawową, jitter, shimmer, energię, nachylenie widma, tempo, pauzy, formanty, współczynniki cepstralne albo reprezentacje uczone przez sieć. Każda z tych wielkości ma wiele możliwych przyczyn.

Napięcie, ból, wysiłek, odwodnienie, infekcja, leki, wiek i zmęczenie zmieniają głos. Podobnie działają mikrofon, odległość, pogłos, kodek telefoniczny, redukcja szumu, automatyczna regulacja wzmocnienia i kompresja. Model może bez trudu odróżnić rozmowę studyjną od połączenia GSM, a następnie pomylić różnicę kanału z różnicą prawdomówności.

Analiza wymaga zachowania oryginalnego strumienia, identyfikacji kodeka, częstotliwości próbkowania, historii transkodowania i segmentacji mówców. Gdy pytający i odpowiadający nakładają się na siebie, cechy mogą pochodzić od dwóch osób. Automatyczna diarization jest tylko hipotezą i wymaga kontroli odsłuchowej.

Mikrotremor i zmieniające się obietnice

Historyczne wersje voice stress analysis odwoływały się do domniemanego mikrotremoru mięśniowego, który miał zmieniać się pod wpływem stresu. Nawet gdyby stabilna akustyczna cecha stresu była dostępna, nie byłaby swoistym markerem kłamstwa. Spór dotyczył więc zarówno istnienia i mierzalności cechy, jak i nieuprawnionego przejścia od stresu do oszustwa.

Współczesne oferty częściej używają określeń „warstwy głosu”, „emocje”, „obciążenie poznawcze” albo „AI”. Zmiana nazwy konstruktu nie jest nowym dowodem. Dostawca powinien podać definicję wyniku, sposób etykietowania prawdy, wersję modelu, populację, kanały, języki, macierz pomyłek i odsetek wyników bez decyzji.

Badania terenowe NIJ

Raport Air Force Research Laboratory finansowany przez National Institute of Justice oddzielił klasyfikację niektórych rodzajów stresu od detekcji oszustwa. Nie wykazano, aby oceniane produkty potrafiły rozpoznać stres swoisty dla kłamstwa wobec stresu emocjonalnego lub fizycznego.

W terenowym badaniu NIJ z zatrzymanymi pytanymi o niedawne używanie narkotyków zewnętrznym kryterium było badanie moczu. LVA i CVSA nie wykrywały kłamstwa lepiej niż przypadek, a czułość wobec fałszywych zaprzeczeń była niska. Jednocześnie uczestnicy rzadziej zaprzeczali używaniu narkotyków niż w porównywalnym badaniu bez urządzenia. Jest to klasyczny problem bogus pipeline: przekonanie, że maszyna jest skuteczna, może zwiększyć ujawnienia mimo niewartościowego klasyfikatora.

Ujawnienie uzyskane pod wpływem autorytetu urządzenia nie waliduje urządzenia. Trzeba osobno ocenić prawdziwość informacji, etykę przedstawienia możliwości systemu i ryzyko, że operator zignoruje inne dowody po czerwonym albo zielonym sygnale.

Nagranie zastane

Analiza rozmowy wykonanej bez kontrolowanego protokołu ma dodatkowe ograniczenia. Nie wiadomo, co wydarzyło się przed fragmentem, jaki był stan osoby, czy pytanie było zrozumiałe i czy pauza pochodziła z namysłu, opóźnienia łącza albo montażu. Odszumianie może usuwać składowe wykorzystywane przez model, a przyspieszenie lub konwersja zmieniają parametry czasowe i widmowe.

Etykieta na poziomie osoby lub sprawy nie jest prawdą dla każdego zdania. Wyrok nie oznacza, że wszystkie wypowiedzi skazanego były fałszywe; uniewinnienie nie oznacza prawdziwości każdej deklaracji. Model trenowany na filmach sądowych może uczyć się roli procesowej, jakości nagrania, sali, stroju i sposobu zadawania pytań.

Termografia twarzy

Co mierzy kamera

Kamera długofalowej podczerwieni estymuje temperaturę powierzchni na podstawie rejestrowanego promieniowania i przyjętych parametrów. Badania wiarygodności obserwowały między innymi okolice okołooczodołowe, czoło, policzki i nos. Pobudzenie autonomiczne może zmieniać perfuzję i potliwość, a oddech wpływa na obszar nosa. Są to mechanizmy termoregulacji, nie odczyt intencji.

Wynik zależy od temperatury i wilgotności pomieszczenia, czasu aklimatyzacji, emisyjności, kąta, odległości, ostrości, rozdzielczości, ruchu, okularów, włosów, zarostu, kosmetyków, gorącego napoju, wysiłku i stanu zdrowia. Okulary są nieprzezroczyste w typowym paśmie LWIR, więc obszar okołooczodołowy może być fizycznie niedostępny. Zwykła kamera RGB nie staje się termowizorem dzięki oprogramowaniu.

Operator powinien zapisać model i kalibrację kamery, parametry otoczenia, czas adaptacji, geometrię, jakość ostrości i sposób śledzenia regionu. Gdy algorytm traci twarz przy obrocie, uśrednia inne piksele. Pozorna zmiana temperatury może pochodzić wyłącznie ze zmiany składu regionu zainteresowania.

Swoboda analityczna

Badanie może tworzyć dziesiątki kombinacji regionu, okna czasowego, filtra, normalizacji i linii bazowej. Wybór po obejrzeniu wyniku zwiększa ryzyko odkrycia przypadkowego efektu. Protokół powinien z góry określić regiony, sposób stabilizacji obrazu, czas odniesienia, kryterium ruchu, brak danych oraz regułę decyzji.

Walidacja przebiega dwuetapowo. Najpierw bada się metrologię i powtarzalność temperatury lub cechy między kamerami, operatorami i sesjami. Dopiero później ocenia się konstrukt oraz klasyfikację na nowych osobach. Losowy podział klatek tego samego filmu między trening i test jest przeciekiem: model może rozpoznawać osobę, tło i stan bazowy.

Użycie właściwe i skrót nieuprawniony

Termografia może być wartościowa w kontrolowanych badaniach perfuzji, termoregulacji albo reakcji na zadanie. Nie istnieje jednak swoisty „termiczny podpis kłamstwa”. Prawidłowy bliski wniosek opisuje zmianę danego ROI w konkretnych warunkach. Przejście do prawdomówności wymagałoby wykazania przyrostu ponad stres, trudność pytania, znaczenie emocjonalne i różnice indywidualne.

Zdalna fotopletyzmografia

Optyczny pomiar rytmu

Remote photoplethysmography wykorzystuje niewielkie okresowe zmiany światła odbitego od skóry, powiązane ze zmianą objętości krwi. Pipeline wykrywa i śledzi twarz, wybiera obszary skóry, łączy kanały barw, oddziela składowe ruchowe i estymuje przebieg. Z niego można obliczyć częstość rytmu, czasem oddech i niektóre miary zmienności.

Odtworzenie średniego tętna jest łatwiejsze niż uzyskanie kształtu fali odpowiedniego dla HRV. Krótkie okna dają niestabilne widmo, długie wygładzają reakcję i utrudniają powiązanie z pytaniem. Niska liczba klatek, kompresja, rolling shutter, migotanie lamp, ruch, automatyczna ekspozycja i balans bieli tworzą artefakty o częstotliwościach podobnych do rytmu.

Porównanie z kontaktowym PPG lub ECG powinno obejmować nie tylko korelację średnich. Potrzebne są błąd w uderzeniach na minutę, granice zgodności, pokrycie danych, zachowanie podczas ruchu oraz jakość miar pochodnych. Algorytm, który zwraca wynik tylko w najłatwiejszych fragmentach, może wyglądać dokładnie po usunięciu połowy materiału.

Odcień skóry i jakość wejścia

Jakość sygnału zależy od widma oświetlenia, czułości sensora, ekspozycji, właściwości skóry i sposobu wyboru ROI. Nierówność może powstać już w pomiarze, zanim zadziała klasyfikator. Raport powinien podawać SNR, pokrycie i błąd odniesienia według odcienia skóry, oświetlenia, ruchu, urządzenia, okularów, zarostu i makijażu.

Zmiana progu klasyfikacji nie odtwarza brakującego sygnału. Jeżeli określona grupa częściej otrzymuje wynik „brak danych”, wykluczenie tych osób z tabeli dokładności ukrywa nierówność systemu. Zasadą analizy powinno być ujęcie wszystkich osób skierowanych do testu, z osobną kategorią technicznego niepowodzenia.

Puls nie staje się prawdą

rPPG zmienia sposób pozyskania sygnału, nie jego psychologiczną swoistość. Pobudzenie może wynikać z lęku, gniewu, wysiłku, bólu, temperatury albo znaczenia pytania. Osoba kłamiąca może być spokojna, a osoba prawdomówna pobudzona. Multimodalny system dodający rPPG do obrazu i dźwięku ma więcej zmiennych, ale także więcej możliwości przeuczenia.

Okulometria i pupilometria

Pomiar spojrzenia

Okulometr szacuje kierunek spojrzenia, fiksacje, sakkady, mrugnięcia oraz średnicę źrenicy. Zwykle używa kamery i odbić podczerwieni. Nie wymaga elektrod, ale wymaga kalibracji, odpowiedniej pozycji i widocznych oczu. Okulary, soczewki, rzęsy, makijaż, anatomia, ruch głowy i światło wpływają na odsetek poprawnych próbek.

Źrenica reaguje przede wszystkim na luminancję. Bodźce porównywane w eksperymencie muszą mieć wyrównany rozmiar, jasność, kontrast i położenie. Odpowiedź jest opóźniona, więc zbyt krótkie odstępy powodują nakładanie reakcji. Zmiana ciemnego slajdu na jasny może całkowicie przykryć subtelny efekt poznawczy.

Wysiłek, czytanie i język

Średnica źrenicy, czas odpowiedzi, liczba ponownych odczytów i wzorzec fiksacji mogą wiązać się z wysiłkiem. Komercyjny test prezentujący zdania na ekranie nie jest biernym patrzeniem w oczy. Mierzy także czytanie, język, ostrość wzroku, interfejs i trudność treści.

Dysleksja, ADHD, wiek, zmęczenie, lęk, leki i słabsza znajomość języka mogą zmieniać wynik. Jeśli pytania krytyczne są dłuższe, rzadsze lub bardziej emocjonalne, system rozpoznaje konstrukcję testu. Tłumaczenie nie jest neutralne: zmienia długość, składnię, nacechowanie i czas przetwarzania.

Okulometryczny CIT

Badania nad ukrytą informacją używają spojrzenia i źrenicy do oceny, czy bodziec jest znany lub znaczący. To test rozpoznania, nie prawdomówności. Znajomość może wynikać ze sprawstwa, bycia świadkiem, dostępu do akt, mediów albo wcześniejszego ujawnienia przez organ. Brak reakcji może wynikać z zapomnienia, złej jakości sygnału albo słabego bodźca.

Sekwencja bodźców w okulometrycznym teście ukrytej informacji z twarzami

Sekwencja pojedynczej próby w laboratoryjnym okulometrycznym CIT: punkt fiksacji, twarz, odpowiedź o znajomości i ocena pewności. Taki protokół mierzy reakcję na rozpoznanie bodźca, a nie bezpośrednio prawdziwość wypowiedzi. Źródło: Millen i in., Cognitive Research: Principles and Implications, CC BY 4.0.

Projekt wymaga kilku równoważnych alternatyw, ochrony szczegółu przed ujawnieniem i dokumentacji źródła wiedzy. Wynik laboratoryjny rzędu kilkudziesięciu procent ponad przypadek jest hipotezą do replikacji, nie podstawą indywidualnego werdyktu. Należy podać pełną macierz, przedziały, wyniki nierozstrzygające i działanie w nowej populacji.

Nieprzypadkowy brak danych

Nieudana kalibracja i utrata próbek nie są losowe. Częściej dotyczą osób z określonymi okularami, anatomią, ruchem albo niepełnosprawnością. Raportowanie wyłącznie kompletnych zapisów zawyża skuteczność i tworzy system selekcyjny. Trzeba podać liczbę wszystkich skierowanych, nieukończonych, technicznie nieważnych i rozstrzygniętych.

System multimodalny

Połączenie głosu, twarzy, termografii, rPPG i spojrzenia może poprawić wynik na pojedynczym zbiorze, ponieważ system otrzymuje wiele korelatów osoby, sesji i warunku. Nie dowodzi to poznania uniwersalnego mechanizmu. Model może identyfikować rozmówcę, operatora, salę, kamerę albo typ pytania.

Każda modalność potrzebuje własnej kontroli jakości i znacznika braku. Fuzja wymaga jawnej synchronizacji, reguły pracy bez jednego sensora oraz badania ablacyjnego pokazującego, co naprawdę wnosi każdy kanał. Jeśli trafność znika po zmianie tła lub usunięciu głosu pytającego, model nie nauczył się deklarowanego konstruktu.

Podział trening–test musi przebiegać na poziomie osoby, sprawy, sesji, urządzenia i miejsca. Zewnętrzny test powinien pochodzić z innej instytucji i późniejszego czasu. Tysiące klatek nie zastępują liczby niezależnych ludzi.

Autentyczność pliku przed fizjologią

Analiza zdalna zakłada, że obraz i dźwięk są autentyczne, chronologiczne i odpowiednio zsynchronizowane. Montaż, filtry upiększające, stabilizacja, interpolacja klatek, generowanie twarzy i synteza głosu mogą zmienić cechy. Deepfake może usuwać albo tworzyć rPPG, ruchy twarzy i prozodię.

Przed klasyfikacją trzeba zbadać pochodzenie pliku, metadane, historię eksportu, kodek, ślady transformacji, ciągłość i sumy kontrolne. Detektor deepfake jest odrębnym modelem z własnym błędem. Brak alarmu nie dowodzi autentyczności, a alarm nie identyfikuje autora ani celu manipulacji.

W transmisji na żywo potrzebne są uwierzytelnienie urządzenia, zabezpieczenie strumienia, kontrola zegara i zapis wersji aplikacji. Mechanizm liveness ogranicza niektóre podstawienia, lecz nie nadaje pobudzeniu znaczenia prawdomówności.

Projekt walidacji operacyjnej

Zamrożone twierdzenie

Najpierw zapisuje się dokładne twierdzenie: sensor, cecha, konstrukt, populacja, warunki, jednostka wyniku i planowana decyzja. „92% skuteczności” nie ma znaczenia bez klasy dodatniej, częstości bazowej, liczebności, macierzy błędów i zasad wyłączenia.

Wynik należy przeliczyć na naturalne liczby. Przy rzadkim zdarzeniu nawet wysoka swoistość może wygenerować więcej fałszywych niż prawdziwych alarmów. Accuracy na zbalansowanej próbie nie odpowiada dodatniej wartości predykcyjnej w screeningu.

Siedem bramek

  1. Metrologia — porównanie sensora z urządzeniem odniesienia.
  2. Powtarzalność — sesje, operatorzy, urządzenia i typowe zakłócenia.
  3. Trafność konstruktu — wykazanie, co cecha rzeczywiście mierzy.
  4. Walidacja wewnętrzna — predefiniowany model na odseparowanych osobach.
  5. Walidacja zewnętrzna — nowa instytucja, język, sprzęt i czas.
  6. Wartość przyrostowa — porównanie z rozmową, treścią i prostym modelem bazowym.
  7. Wpływ — fałszywe oskarżenia, nierówności, zachowanie operatora i odwołanie.

Produkt sprawny na pierwszej albo czwartej bramce nie jest gotowy do decyzji o człowieku. Publikacja sensora nie waliduje usługi, a badanie algorytmu producenta nie zastępuje niezależnej replikacji.

Prospektywny test lokalny

Protokół ustala się przed zebraniem wyników: populację, kryterium prawdy, próg, kategorię nierozstrzygającą, minimalną jakość i analizę podgrup. Dostawca nie może po wyniku usuwać trudnych przypadków ani dostrajać modelu na zbiorze testowym.

Test powinien obejmować prawdomównych pod presją, różne języki, stany zdrowia, odcienie skóry, akcenty i typowe zakłócenia. Wynik porównuje się z najlepszą dostępną praktyką, samą treścią oraz prostym modelem. Mierzy się nie tylko klasyfikację, ale również zmianę decyzji operatorów.

Wersję modelu, preprocessing i próg blokuje się. Usługa chmurowa musi udostępniać identyfikator wersji, dziennik zmian, możliwość odtworzenia i eksport danych. Wynik bez wersji nie nadaje się do niezależnej kontroli.

Prawo i proporcjonalność

Techniczna możliwość obserwacji bez dotyku nie jest podstawą prawną. W polskim postępowaniu art. 171 § 5 pkt 2 KPK zakazuje stosowania środków technicznych kontrolujących nieświadome reakcje organizmu w związku z przesłuchaniem. Przewidziane badania z użyciem środków technicznych mają odrębne podstawy i warunki, w tym zgodę w art. 192a i 199a KPK. Zamiana elektrod na kamerę nie usuwa funkcji kontroli reakcji.

Głos i obraz mogą być danymi osobowymi; cechy fizjologiczne mogą ujawniać zdrowie. Potrzebne są cel, minimalizacja, ograniczenie retencji, kontrola dostępu, logi, informacja dla osoby i możliwość zakwestionowania wyniku. Surowe nagranie pozwala na więcej wtórnych analiz niż końcowa liczba, dlatego zakres przechowywania wymaga osobnej decyzji.

AI Act nie jest zezwoleniem na ocenę wiarygodności. Część zastosowań biometrycznych i organów ścigania podlega reżimowi wysokiego ryzyka, a określone systemy rozpoznawania emocji w pracy i edukacji są zakazane poza wąskimi wyjątkami. Zawsze pozostają przepisy procesowe, ochrona danych, prawo do obrony i zakaz automatycznego skracania oceny dowodów.

Raport i język opinii

Raport powinien podać status osoby, cel i podstawę; urządzenie i ustawienia; wersję programu i modelu; oryginalne pliki; kryteria jakości; preprocessing; utracone fragmenty; cechy; próg; wynik nierozstrzygający; źródło walidacji; zgodność domeny; błędy podgrup oraz alternatywne wyjaśnienia.

Bezpieczne zdanie brzmi: „W zarejestrowanym fragmencie algorytm oszacował wzrost częstości rytmu przy jakości sygnału określonej jako X”. Jeżeli model klasyfikuje warunek, trzeba dodać: „Klasa oznacza podobieństwo do etykiet zbioru i nie rozstrzyga prawdomówności ani źródła pobudzenia”.

Nie należy pisać, że oczy, temperatura albo głos „potwierdziły kłamstwo”. Nie wolno też łączyć wyniku z winą. Ocena wiarygodności wymaga treści relacji, pochodzenia wiedzy i niezależnych dowodów.

Lista kontrolna

Czy określono zjawisko fizyczne i urządzenie odniesienia?

Czy produkt mierzy stres, obciążenie, rozpoznanie, emocję czy deklarowane oszustwo?

Jak zdefiniowano prawdę dla każdego przykładu, nie tylko dla osoby lub sprawy?

Ile było niezależnych osób, a nie klatek, zdań i fragmentów?

Czy jedna osoba, sesja, sala lub urządzenie nie trafiły po obu stronach podziału?

Czy istnieje niezależna walidacja aktualnej wersji w języku i populacji użycia?

Czy podano techniczne niepowodzenia i wyniki nierozstrzygające?

Czy jakość pomiaru sprawdzono według odcienia skóry, akcentu, okularów, ruchu i urządzenia?

Czy pytania mają porównywalną długość, luminancję, trudność i znaczenie?

Czy oryginalny plik jest zachowany, autentyczność oceniona, a transformacje odtwarzalne?

Czy operator widzi niepewność i może wybrać brak decyzji?

Czy system dodaje wartość ponad treść rozmowy i dowody, czy tylko efektowny panel?

Czy wynik nie wpływa na prawa osoby przed ukończeniem prospektywnego pilotażu?

Czy istnieje podstawa prawna, ograniczenie celu, retencja i procedura odwołania?

Wnioski

Zdalne sensory mogą dobrze wykonywać własne zadania: rejestrować mowę, temperaturę, optyczny rytm i spojrzenie. Największa pewność dotyczy właśnie tych bliskich pomiarów. Każdy krok w stronę stresu, rozpoznania, intencji i prawdomówności wymaga kolejnej, odrębnej walidacji.

Voice stress analysis nie uzyskała potwierdzenia terenowego jako detektor kłamstwa. Termografia i rPPG obserwują nieswoiste procesy autonomiczne. Okulometria może wspierać badania uwagi lub rozpoznania w ściśle zaprojektowanym paradygmacie, ale nie ustala źródła wiedzy. Multimodalność zwiększa ilość informacji oraz ryzyko przecieku i przeuczenia.

Operacyjna jakość nie polega na tym, że urządzenie zawsze wydaje kolor. Polega na znanym zakresie, kontroli pomiaru, niezależnym teście, jawnej klasie „brak decyzji” i wniosku ograniczonym do tego, co sensor rzeczywiście obserwuje.

Źródła

Zastrzeżenie

Tekst służy do kwalifikacji i audytu technologii. Nie stanowi instrukcji obchodzenia testów ani podstawy do oceny prawdomówności konkretnej osoby bez pełnych danych, właściwej walidacji i aktualnej analizy prawnej.