ChatGPT, Gemini i Claude dostały test z finansów. Nie zdały


ChatGPT, Gemini i Claude dostały test z finansów. Nie zdały

Firma technologiczna Saturn przeanalizowała, jak dobrze najpopularniejsze modele sztucznej inteligencji radzą sobie z zadaniami finansowymi. W badaniu wzięły udział ChatGPT, Claude, Copilot, Grok, Gemini i kilka innych popularnych systemów.

W odpowiedzi na przeciętne, stosunkowo proste pytania, sieci neuronowe popełniały błędy w 57% przypadków. W przypadku bardziej złożonych zadań finansowych wskaźnik błędów wzrósł do 99%. Eksperci zauważają, że koszt błędu jest szczególnie wysoki w finansach, dlatego poleganie na odpowiedziach sieci neuronowych bez dalszej weryfikacji jest przedwczesne.

Jak podaje Financial Times, powołując się na badania firmy technologicznej Saturn, wykorzystanie sieci neuronowych w finansach może skutkować dużymi stratami finansowymi. Według Saturna, najpopularniejsze modele sztucznej inteligencji – ChatGPT, Claude, Copilot, Grok i Gemini – generowały nieprawidłowe odpowiedzi na pytania finansowe średnio w 57% przypadków. W przypadku bardziej złożonych zapytań wymagających wielu obliczeń, wskaźnik błędów wzrósł średnio do 88%, a niektóre modele popełniały błędy nawet w 99% przypadków.

Ponad 10 tys. pytań do modeli AI

W badaniu wykorzystano ponad 100 różnych pytań finansowych. Zadano je zarówno darmowym, jak i płatnym modelom sztucznej inteligencji ChatGPT, Gemini, Claude i Copilot. Każde pytanie powtórzono maksymalnie pięć razy. Łącznie zadano ponad 10 000 pytań 18 różnym modelom sztucznej inteligencji.

AI potrafi wymyślić nieistniejący przepis

Odpowiedzi zawierały błędy obliczeniowe, modele ignorowały nadchodzące zmiany w przepisach podatkowych lub tworzyły nieistniejące przepisy. W najgorszym przypadku poleganie na takich odpowiedziach podatkowych mogłoby prowadzić do poważnych strat finansowych, zauważają autorzy raportu.

Dyrektor generalny Saturna, Amal Jolly, podkreślił: „Miliony ludzi ufają modelom sztucznej inteligencji w kwestii porad finansowych, ale otrzymują błędne odpowiedzi, które mogą kosztować ich duże straty finansowe”.

Błąd w darmowym modelu sztucznej inteligencji Claude Haiku 4.5 w przepisach dotyczących podatku emerytalnego mógł spowodować, że brytyjski emeryt zostanie obciążony dodatkową kwotą 17 500 funtów przez HM Revenue & Customs. W innym przypadku, gdy zapytano Claude'a o pożyczki studenckie, „wymyślił” zasadę, zgodnie z którą absolwent mógł rzekomo zaprzestać spłacania rat po przeprowadzce za granicę.

Płatne modele wypadają lepiej, ale nadal popełniają błędy

Płatne wersje generalnie udzielały dokładniejszych odpowiedzi niż darmowe, a nowe modele sztucznej inteligencji radziły sobie znacznie lepiej niż starsze. Claude Opus 5 wypadł najlepiej w trybie „rozumowania”, ze wskaźnikiem błędu na poziomie 39%. Nawet ten wskaźnik pozostaje jednak wysoki w przypadku doradztwa finansowego.

Jednocześnie eksperci zauważają, że chatboty mogą być nadal przydatne w przypadku prostszych zadań, takich jak ustalanie budżetu lub analizowanie sytuacji, w których ludzie mają tendencję do wydawania zbyt dużych kwot w stosunku do swoich dochodów i wydatków.

Brytyjski Urząd ds. Postępowania Finansowego (FCA) poinformował wcześniej, że co piąty dorosły Brytyjczyk jest skłonny pozwolić sztucznej inteligencji podejmować decyzje za siebie. Popyt jest szczególnie wysoki w złożonych obszarach, takich jak zadłużenie, emerytury i inwestycje. Młodzi inwestorzy chętniej ufają sztucznej inteligencji niż influencerom finansowym czy programom telewizyjnym: dwie trzecie spodziewa się, że do 2027 roku będą częściej korzystać z takich narzędzi IT.

 

Spodobało Ci się? Podziel się ze znajomymi!

Pokaż / Dodaj komentarze do:

ChatGPT, Gemini i Claude dostały test z finansów. Nie zdały
 0