영국 핀테크 업체 새턴(Saturn)에 따르면, 주류 인공지능 모델은 개인 금융 답변의 57%에서 실패했습니다. 더 어렵고 다단계인 질문에서는 실패율이 88%까지 올랐습니다.
챗봇에 돈에 대한 질문을 맡기는 소비자가 크게 늘어난 가운데 이 같은 결과가 나왔습니다.
더 어려운 질문에서 거의 모든 모델이 무너졌습니다
이번 연구는 총 121개의 질문을 챗GPT(ChatGPT), 제미나이(Gemini), 클로드(Claude)와 코파일럿(Copilot) 등 18개의 무료 및 유료 모델에서 실행했습니다. 각 질문은 최대 5번씩 반복 질문되며 1만 개가 넘는 답변이 생성되었습니다.
답변에 사실 오류가 있거나, 중요한 내용을 누락하거나, 필수 경고를 생략하면 실패로 간주했습니다.
무료 모델은 가장 성적이 안 좋아, 63%가 오답이었고, 유료 모델은 49%였습니다. 가장 어려운 질문에서는 무료 모델이 93%의 확률로 실패했습니다.
클로드 오퍼스5(Claude Opus 5) 의 추론 모드는 분야 내에서 가장 뛰어났습니다. 하지만 이 역시 39%의 답변에서 실패했습니다. 오류는 계산착오, 세금 변경점 미반영, 존재하지 않는 규정 안내 등이 포함됐습니다.
연금 세금 관련 한 답변은 한 저축자가 영국 국세청(HM Revenue and Customs)으로부터 1만7,500파운드의 과태료를 부과받을 수 있게 했습니다.
“수백만 명이 돈 문제 해결을 위해 인공지능 모델에 의존하고 있지만, 이로 인해 잘못된 답을 받고 재산을 잃을 수 있습니다.” – 아말 졸리(Amal Jolly), 새턴(Saturn) 최고경영자
AI 챗봇에 대한 신뢰는 계속 높아지고 있습니다
한편, 시장과 세대 전반에서 AI 활용이 확대되고 있습니다. EY가 전 세계 1만8,000명의 소비자를 조사한 결과, 49%가 저축 및 투자 결정을 위해 AI를 이용한 경험이 있다고 답했습니다.
영국 금융감독청(FCA)은 지난 8월, 투자 경험이 적은 투자자 5명 중 4명이 투자를 위해 AI를 활용했다고 밝혔습니다. 이 중 56%는 해당 도구를 신뢰한다고 답해, TV와 라디오(47%)보다 더 높았습니다.
같은 조사에서 44%는 AI가 생성한 금융 정보가 규제받는다고 잘못 알고 있었습니다.
펜션비(PensionBee)가 미국 성인 1,000명을 대상으로 실시한 설문 결과, 거의 10명 중 6명이 AI가 제시한 금융 조언을 추가로 확인하지 않고 따르겠다고 밝혔습니다. 4명 중 1명꼴로 챗봇이 자신의 재정 관련 잘못된 정보를 제공한 적이 있다고 답했습니다.
졸리(Jolly)는 인공지능이 제공하는 재정 조언이 규제를 받지 않으며, 이로 인해 소비자는 실제 상담사에게 보장되는 보상권에서 제외된다고 강조했습니다. 그는 금융감독청(FCA)에 신속한 대응을 촉구했습니다.
전문가와 저널리스트의 인사이트를 보려면 유튜브 채널을 구독하십시오









