Избрани новини
Актьорът от "Джурасик парк" Сам Нийл почина на 78 годишна възраст
Бейби бумъри, зумъри и милениали: Кой наистина живее като загубеняк?
Фен зона
По-добре да не питате! Половината от отговорите на AI на здравни въпроси са грешни, дори и да звучат убедително
Ако използвате някой от чатботовете за медицински съвети, проверявайте фактите във всяко здравно твърдение, което той прави!
Снимка: Image by rawpixel.com
Представете си, че току-що ви е поставена диагноза рак в ранен стадий и преди следващия ви лекарски преглед питате чатбот с изкуствен интелект: „Кои алтернативни клиники могат успешно да лекуват рак?“. В рамките на секунди получавате изпипан отговор с връзки, които изглеждат сякаш са написани от лекар. Само че някои от твърденията са необосновани, връзките не водят доникъде и чатботът никога не намеква, че самият въпрос може да е неуместен.
Този сценарий не е хипотетичен, пише The Conversation. Това е общото заключение, до което стигна група от седем изследователи, след като подложиха пет от най-популярните чатботове в света на систематичен стрес тест за обработка на медицинска информация. Резултатите бяха публикувани в списание BMJ Open .
На чатботовете ChatGPT, Gemini, Grok, Meta AI и DeepSeek бяха зададени по 50 въпроса за здравето и медицината, обхващащи рак, ваксини, стволови клетки, хранене и спортни постижения. Двама експерти оцениха независимо всеки отговор. Те установиха, че близо 20% от отговорите са силно проблематични, половината са проблематични, а 30% са донякъде проблематични. Нито един от чатботовете не предостави надеждно напълно точни списъци с литература и само два от 250 въпроса бяха категорично отхвърлени.
Като цяло, петте чатбота се представиха приблизително еднакво. Grok се представи най-зле: 58% от отговорите му бяха маркирани като проблемни, следван от ChatGTP с 52% и Meta AI с 50%.
Ефективността на чатботовете обаче варира в зависимост от темата. Те се представиха най-добре по отношение на ваксините и рака – области с обширни, добре структурирани изследвания – но все пак предоставиха проблематични отговори в около една четвърт от случаите. Най-често грешаха по отношение на храненето и спортните постижения – области, изобилстващи от противоречиви онлайн съвети и където има далеч по-малко убедителни доказателства.
Проблеми възникнаха и при въпросите с отворен отговор: 32% от отговорите бяха оценени като силно проблематични, в сравнение със само 7% при въпросите със затворен отговор. Това разграничение е важно, защото повечето въпроси за здравето в реалния свят са с отворен отговор. Хората не задават на чатботовете прости въпроси от типа „вярно/невярно“. Те питат например: „Кои добавки са най-добри за цялостното здраве?“. Това са видовете въпроси, които водят до уверен, неясен, но потенциално вреден отговор.
Когато изследователите поискали от всеки чатбот десет научни препратки, средният процент на извикване бил само 40%. Нито един чатбот не успял да извлече нито един напълно коректен списък с препратки от 25 опита. Грешките варирали от неправилни автори и неработещи връзки до напълно изфабрикувани статии. Това е особено опасно, защото препратките изглеждат като доказателства. Неексперт, който вижда спретнато форматиран списък с цитати, няма почти никаква причина да се съмнява в съдържанието.
Защо чатботовете правят грешки?
Има една проста причина, поради която чатботовете дават неправилни медицински отговори. Езиковите модели не знаят нищо. Те предсказват най-статистически вероятната следваща дума въз основа на данни за обучение и контекст. Те не претеглят доказателства, нито правят ценностни преценки. Те използват рецензирани научни статии, както и дискусии в Reddit, здравни блогове и дебати в социалните медии, като учебни материали.
Изследователите не задавали неутрални въпроси. Те умишлено създали подкани, предназначени да подтикнат чатботовете към подвеждащи отговори – стандартен метод за стрес-тестиране в изследванията за безопасност на изкуствения интелект, известен като „червен екип“. Това означава, че процентите на грешки вероятно са завишени в сравнение с това, което би се получило с по-неутрална формулировка. Проучването тества и безплатни версии на всеки модел, достъпни през февруари 2025 г. Платените версии и по-новите издания може да дадат по-добри резултати.
Въпреки това, повечето хора използват тези безплатни версии и повечето здравни въпроси не са внимателно формулирани. Условията на изследването, ако не друго, отразяват как хората всъщност използват тези инструменти.
Констатациите на доклада не съществуват изолирано; те се вписват в нарастващ набор от доказателства, които, взети заедно, създават съгласувана картина.
Проучване, публикувано през февруари 2026 г. в списанието Nature Medicine, разкри изненадващи резултати. Самите чатботове успяха да предоставят правилния медицински отговор в почти 95% от случаите. Но когато същите тези чатботове бяха използвани от реални хора, те получиха правилния отговор в по-малко от 35% от случаите – не по-добре от тези, които изобщо не ги използваха. Просто казано, проблемът не е само дали чатботът предоставя правилния отговор. Въпросът е дали обикновените потребители могат да разберат и използват този отговор правилно.
Скорошно проучване , публикувано в списанието Jama Network Open, тества 21 водещи модела с изкуствен интелект. Изследователите ги помолили да идентифицират възможни медицински диагнози. Когато на моделите били предоставени само основни данни – като възраст, пол и симптоми на пациента – те се затруднили, като не успявали да предложат правилния набор от възможни заболявания в повече от 80% от случаите. След като изследователите добавили резултати от прегледи и лабораторни изследвания, точността скочила до над 90%.
Междувременно, друго проучване, проведено в САЩ и публикувано в списанието Nature Communications Medicine, установи, че чатботовете лесно повтарят и дори допълват измислени медицински термини, вмъкнати в подканите.
Взети заедно, тези проучвания показват, че недостатъците, установени в проучването на BMJ Open, не са характерни само за един експериментален метод, а отразяват нещо по-фундаментално относно текущото състояние на технологиите.
Тези чатботове няма да стигнат до никъде и не би трябвало да стигат. Те могат да обобщават сложни теми, да помагат за формулирането на въпроси към лекарите и да служат като отправна точка за изследвания. Но изследването ясно показва, че не трябва да се третират като независими медицински авторитети.
Ако използвате някой от тези чатботове за медицински съвети, проверявайте фактите във всяко здравно твърдение, което той прави, третирайте препратките към него като препоръки за проверка, а не като факт, и обръщайте внимание, когато отговорът звучи уверено, но не включва никакви уговорки.
Четете LifeOnline.bg където ви е удобно Telegram , Instagram , Facebook
Коментари (0)
Добави коментар