OpenAI发布SimpleQA基准：能否有效治理大模型“信口开河”现象？-DS2M

更新时间：2024-11-16 15:00:01来源：互联网

OpenAI于近日推出了一项名为SimpleQA的新基准，旨在评估语言模型在回答简短事实寻求问题时的准确性。这一举措是AI领域追求更高事实正确性的重要一步。

据悉，SimpleQA通过一系列严格的标准来确保评估的公正性和有效性。其中包括高正确性，即参考答案需经两名独立AI训练师验证；多样性，涵盖从科学技术到娱乐等多个主题；以及前沿挑战性，相比早期的基准，SimpleQA更能测试出前沿模型的实力。

OpenAI发布SimpleQA基准：能否有效治理大模型“信口开河”现象？

SimpleQA还注重高效用户体验，问题与答案设计得简洁明了，便于快速操作和评分。通过OpenAI API等工具，用户可以轻松地进行模型评估。

OpenAI表示，尽管SimpleQA在短查询的受限设置中测量事实准确性，但其希望这一基准的开源能够推动AI研究在更广泛领域的应用和发展。同时，SimpleQA也揭示了当前语言模型在生成事实正确回答方面仍面临的挑战，即如何减少错误输出和未经证实的答案，这一问题也被称为“幻觉”。

通过SimpleQA的推出，OpenAI期望能够进一步促进语言模型的优化和完善，使其在更多场景中发挥出更大的价值。