英国金融科技公司 Saturn 的研究显示,主流 AI 模型在个人理财问答中出错率高达 57%,面对更为复杂、多步骤的问题时,出错率更是飙升至 88%。
随着越来越多用户依赖聊天机器人解答财务问题,这一现象引发了行业广泛关注。
复杂问题几乎难倒所有 AI 模型
此次研究共向 18 款主流免费及付费 AI 模型提出 121 个问题,涵盖 ChatGPT、Gemini、Claude 和 Copilot 等平台。每个问题最多重复测试 5 次,总计生成超过 10,000 条答案。
测试将包含事实性错误、遗漏关键信息或缺乏必要风险提示的答案判定为失败案例。
数据显示,免费 AI 模型表现最差,答案错误率高达 63%,而付费版为 49%。针对难度最高的问题,免费模型的失败率甚至高达 93%。
Claude Opus 5 在推理模式下表现最佳,但仍有 39% 的答案存在失误,主要包括计算错误、忽略税法更新及虚构规定等问题。
例如,其中一项养老金税务回答若被用户采纳,可能导致其被英国税务及海关总署(HM Revenue and Customs)额外征收 17,500 英镑的费用。
“数以百万计的人正在依赖 AI 模型获取理财建议,但得到的却是不正确的答案,最终可能导致实际经济损失。”Saturn 首席执行官 Amal Jolly 表示。
尽管如此,用户对 AI 机器人信任度仍持续攀升
与此同时,AI 理财助手的使用覆盖各年龄层及全球各大市场。安永(EY)一项针对 18,000 名消费者的全球调研显示,49% 的受访者曾利用 AI 辅助储蓄及投资决策。
英国金融监管机构2023 年 8 月发布的数据显示,五分之四经验较浅的投资者使用 AI 辅助投资。在受访者中,56% 的人表示信任AI工具,高于对电视和广播等传统媒体的信任度(47%)。
但同一研究也发现,仍有 44% 的受访者错误认为 AI 生成的金融信息已受到监管。
PensionBee 对 1,000 名美国成年人发起的一项调研显示,近 60% 的受访者会在未自行核实的情况下,直接采纳理财建议。还有近 1/4 的人表示,聊天机器人曾向其提供过错误的财务信息。
Jolly 表示,人工智能提供的金融建议尚未受到监管,消费者无法享有与真人顾问同等的赔偿权益。他呼吁美国金融监管局(FCA)应尽快采取行动。
订阅我们的 YouTube 频道,第一时间获取行业领袖与资深记者的深度见解









