最新最快科技资讯
太阳能光伏网

大模型幻觉成应用落地难题 最新评测文心一言解决幻觉能力最好

“林黛玉倒拔垂杨柳”、“月球上面有桂树”、“宋江字武松”……相信经常使用大语言模型都会遇到这样“一本正经胡说八道”的情况。这其实是大模型的“幻觉”问题,大模型行业落地的核心挑战之一例如幻觉会影响生成内容的可靠性对于法律、金融、医疗等专业要求高的领域难以完成实际场景任务。因此,大模型幻觉问题也被认为是制约大模型广泛应用的一大难题

如何准确评估和解决大语言模型中的幻觉问题已经成为一个至关重要的挑战。近日,复旦大学与上海人工智能实验室构建针对中文大模型的幻觉评测数据集HalluQA对业界主流的大模型进行评估。

HalluQA采用无幻觉率来评估大模型的优劣。无幻觉率越高代表模型幻觉越低,事实准确性越高。在评测的24个主流大模型中,包括百度文心一言ERNIE-Bot百川Baichuan、智谱ChatGLM、阿里通义千问和GPT-4等

中文大模型幻觉评数据集HalluQA对24个主流大模型进行评测

从评测结果来看,幻觉问题对大模型来说尚有困难,有18个模型的无幻觉率低于50%在幻觉消除上,具备检索增强能力的大模型优势明显,在所有模型评测中,文心一言在整体幻觉问题解决方面表现突出,排名第一,整体无幻觉率为69.33%GPT-4整体无幻觉率为53.11%,排名第六。

HalluQA:不同类型模型在不同类型的问题上的平均非幻觉率

行业普遍认为,幻觉问题对于大模型在多个领域的落地都可能产生严重影响,包括客户服务、金融服务、法律决策和医疗诊断等。因此解决幻觉问题越好的大模型,才具备更强的产业落地价值

最新相关
秘塔AI x 优刻得,让搜索回归本质

秘塔AI x 优刻得,让搜索回归本质

成长在互联网刚刚兴起的年代,我们的小时候,"微机课"比体育课还要令人期待。课间早早计划好玩哪个Flash小游戏,奔向"微机房"要给好朋友占个座,按下台式机的电源键,等待Windows系统缓缓加载……...

iPadOS26发布 多任务处理向macOS看齐

[太平洋科技快讯]6月10日,在 WWDC25 开发者大会上,苹果正式发布了全新的 iPadOS 26 系统。此次更新不仅带来了全新的设计语言,更在多任务处理和文件管理方面进行了“史诗级”的革新,...

macOS 26 Tahoe发布 Spotlight聚焦升级

[太平洋科技快讯]6月10日,苹果在WWDC25全球开发者大会上正式推出了全新操作系统macOS 26 Tahoe。最引人注目的变化莫过于其全新的系统设计语言。苹果引入了名为“液体玻璃”的半透明...

iOS26正式发布 采用全新液态玻璃设计语言

[太平洋科技快讯]6月10日,苹果在 WWDC25 上宣布迄今规模最大的设计更新,命名为“Liquid Glass(液态玻璃)”,且将所有系统统一为年份命名,因为该系统将应用到明年,因此尾缀为26。iOS ...