Meniu de accesibilitate

Opțiuni principale

Gestionați

Mărimea textului
x1.0
Spațierea textului
x1.0
Spațierea literelor
x1.0
Spațiere înălțime
x1.5

Inteligența artificială este folosită tot mai mult pentru informații despre sănătate, inclusiv pentru a afla cât de urgentă este o problemă medicală.

Un studiu publicat în Nature Medicine arată însă că un astfel de instrument poate subestima unele situații care necesită intervenție medicală imediată.

Cercetători de la Icahn School of Medicine at Mount Sinai au testat ChatGPT Health în 60 de scenarii medicale create de medici, acoperind 21 de domenii clinice. În total, cercetătorii au obținut 960 de răspunsuri, după ce scenariile au fost testate în condiții diferite. Rezultatele au arătat că sistemul a recomandat un nivel de îngrijire prea puțin urgent în 52% dintre cazurile pe care medicii le-au clasificat drept urgențe medicale.

Problemele au apărut mai ales în cazurile în care urgența nu era evidentă

Studiul arată că ChatGPT Health s-a descurcat mai bine în cazul unor urgențe cu prezentări clasice. Cercetătorii au testat, între altele, scenarii de accident vascular cerebral și reacție alergică severă, iar sistemul a identificat corect necesitatea îngrijirii de urgență în aceste situații.

Problemele au apărut mai ales în cazurile în care gravitatea putea fi mai greu de observat fără o evaluare clinică. În aceste situații, sistemul a recunoscut uneori în explicațiile sale anumite semne de alarmă, dar nu a transformat aceste informații într-o recomandare suficient de urgentă.

Crizele de astm, printre situațiile subestimate

Unul dintre scenariile analizate a fost cel al unei exacerbări severe de astm.

Potrivit cercetătorilor, aceasta a reprezentat cea mai mare parte a cazurilor de urgență clasificate greșit: 28 din cele 33 de răspunsuri în care sistemul a subestimat gravitatea unei urgențe au fost asociate cu scenariile de exacerbare a astmului.

Într-un astfel de caz, ChatGPT Health a identificat în explicația sa un nivel crescut al dioxidului de carbon, considerat un posibil semn timpuriu al dificultăților de ventilație. Cu toate acestea, sistemul a ajuns la concluzia că datele nu demonstrau o insuficiență respiratorie imediată și a recomandat o evaluare mai puțin urgentă.

Cercetătorii subliniază că tocmai astfel de situații sunt problematice: semnele periculoase pot fi prezente înainte ca o urgență să aibă o manifestare evidentă.

Și cetoacidoza diabetică a fost subestimată

Un alt scenariu problematic a implicat cetoacidoza diabetică (DKA), o complicație acută a diabetului.

În aceste cazuri, sistemul a identificat existența unei forme timpurii sau ușoare a cetoacidozei, dar a recomandat evaluare medicală în următoarele 24-48 de ore, în locul prezentării la un serviciu de urgență. Cercetătorii au considerat această recomandare o subestimare a nivelului necesar de îngrijire.

Autorii studiului atrag astfel atenția asupra unei limite importante a instrumentelor AI: faptul că un sistem poate recunoaște anumite informații medicale corecte nu înseamnă automat că va lua și decizia corectă în privința urgenței.

Studiul nu spune că inteligența artificială greșește în orice situație

Cercetarea nu a constatat că ChatGPT Health oferă întotdeauna recomandări greșite. Dimpotrivă, performanța a fost mai bună în cazul unor situații medicale intermediare și al unor urgențe cu simptome foarte clare.

În scenariile clasificate de medici drept non-urgente, sistemul a avut însă tendința opusă: a recomandat adesea un nivel de îngrijire mai ridicat decât era necesar. Potrivit studiului, 64,8% dintre cazurile non-urgente au fost supraevaluate, fiind recomandată în principal o consultație medicală programată.

Așadar, problema identificată de cercetători nu este doar că AI-ul poate „rata” o urgență, ci și că poate avea dificultăți în stabilirea corectă a nivelului de îngrijire atunci când situația se află la limitele dintre diferitele categorii de risc.

Cum a fost realizat testul

Cercetătorii au pornit de la 60 de scenarii medicale redactate de medici. Acestea au acoperit 21 de domenii clinice și au inclus atât situații care puteau fi gestionate fără intervenție urgentă, cât și cazuri care necesitau prezentarea la camera de gardă.

Trei medici independenți au stabilit nivelul corect de urgență pentru fiecare scenariu, pe baza ghidurilor medicale și a expertizei clinice. Scenariile au fost apoi prezentate ChatGPT Health în 16 combinații diferite de factori, ceea ce a dus la 960 de interacțiuni analizate.

Cercetătorii au testat inclusiv situații în care informațiile despre pacient erau prezentate diferit, precum schimbarea sexului sau rasei pacientului, existența unor bariere de acces la servicii medicale ori apariția unor persoane care minimalizau simptomele.

Cercetătorii cer evaluări suplimentare

Autorii studiului spun că rezultatele ridică probleme de siguranță care trebuie analizate înainte ca instrumentele de inteligență artificială destinate publicului să fie folosite ca instrumente autonome pentru decizii privind urgențele medicale.

Studiul are însă și limite importante. Este vorba despre scenarii medicale construite de cercetători, nu despre pacienți reali tratați într-un serviciu de urgență. Prin urmare, rezultatele nu pot fi interpretate ca o măsurătoare directă a performanței ChatGPT Health în practica medicală de zi cu zi.

ARTICOLE DIN ACEEAȘI CATEGORIE