Firma technologiczna Saturn przeanalizowała, jak dobrze najpopularniejsze modele sztucznej inteligencji radzą sobie z zadaniami finansowymi. W badaniu wzięły udział ChatGPT, Claude, Copilot, Grok, Gemini i kilka innych popularnych systemów.
W odpowiedzi na przeciętne, stosunkowo proste pytania, sieci neuronowe popełniały błędy w 57% przypadków. W przypadku bardziej złożonych zadań finansowych wskaźnik błędów wzrósł do 99%. Eksperci zauważają, że koszt błędu jest szczególnie wysoki w finansach, dlatego poleganie na odpowiedziach sieci neuronowych bez dalszej weryfikacji jest przedwczesne.
Jak podaje Financial Times, powołując się na badania firmy technologicznej Saturn, wykorzystanie sieci neuronowych w finansach może skutkować dużymi stratami finansowymi. Według Saturna, najpopularniejsze modele sztucznej inteligencji – ChatGPT, Claude, Copilot, Grok i Gemini – generowały nieprawidłowe odpowiedzi na pytania finansowe średnio w 57% przypadków. W przypadku bardziej złożonych zapytań wymagających wielu obliczeń, wskaźnik błędów wzrósł średnio do 88%, a niektóre modele popełniały błędy nawet w 99% przypadków.
Ponad 10 tys. pytań do modeli AI
W badaniu wykorzystano ponad 100 różnych pytań finansowych. Zadano je zarówno darmowym, jak i płatnym modelom sztucznej inteligencji ChatGPT, Gemini, Claude i Copilot. Każde pytanie powtórzono maksymalnie pięć razy. Łącznie zadano ponad 10 000 pytań 18 różnym modelom sztucznej inteligencji.
AI potrafi wymyślić nieistniejący przepis
Odpowiedzi zawierały błędy obliczeniowe, modele ignorowały nadchodzące zmiany w przepisach podatkowych lub tworzyły nieistniejące przepisy. W najgorszym przypadku poleganie na takich odpowiedziach podatkowych mogłoby prowadzić do poważnych strat finansowych, zauważają autorzy raportu.
Dyrektor generalny Saturna, Amal Jolly, podkreślił: „Miliony ludzi ufają modelom sztucznej inteligencji w kwestii porad finansowych, ale otrzymują błędne odpowiedzi, które mogą kosztować ich duże straty finansowe”.
Błąd w darmowym modelu sztucznej inteligencji Claude Haiku 4.5 w przepisach dotyczących podatku emerytalnego mógł spowodować, że brytyjski emeryt zostanie obciążony dodatkową kwotą 17 500 funtów przez HM Revenue & Customs. W innym przypadku, gdy zapytano Claude'a o pożyczki studenckie, „wymyślił” zasadę, zgodnie z którą absolwent mógł rzekomo zaprzestać spłacania rat po przeprowadzce za granicę.
Płatne modele wypadają lepiej, ale nadal popełniają błędy
Płatne wersje generalnie udzielały dokładniejszych odpowiedzi niż darmowe, a nowe modele sztucznej inteligencji radziły sobie znacznie lepiej niż starsze. Claude Opus 5 wypadł najlepiej w trybie „rozumowania”, ze wskaźnikiem błędu na poziomie 39%. Nawet ten wskaźnik pozostaje jednak wysoki w przypadku doradztwa finansowego.
Jednocześnie eksperci zauważają, że chatboty mogą być nadal przydatne w przypadku prostszych zadań, takich jak ustalanie budżetu lub analizowanie sytuacji, w których ludzie mają tendencję do wydawania zbyt dużych kwot w stosunku do swoich dochodów i wydatków.
Brytyjski Urząd ds. Postępowania Finansowego (FCA) poinformował wcześniej, że co piąty dorosły Brytyjczyk jest skłonny pozwolić sztucznej inteligencji podejmować decyzje za siebie. Popyt jest szczególnie wysoki w złożonych obszarach, takich jak zadłużenie, emerytury i inwestycje. Młodzi inwestorzy chętniej ufają sztucznej inteligencji niż influencerom finansowym czy programom telewizyjnym: dwie trzecie spodziewa się, że do 2027 roku będą częściej korzystać z takich narzędzi IT.
Spodobało Ci się? Podziel się ze znajomymi!

Pokaż / Dodaj komentarze do:
ChatGPT, Gemini i Claude dostały test z finansów. Nie zdały