什么是图灵测试?
图灵测试是评测人工智能模仿人类智能能力的常用方法。它定义了评测人工智能的能力(主要是其进行智能且类似人类回复的交流能力)的可重复流程。虽然传统上,它被用作常用的人工智能性能基准,但在生成式人工智能时代,其相关性有所降低。
图灵测试是如何运作的?
图灵测试旨在回答“回复我的是人还是机器?”这个问题。 它评测人类是否能分辨出屏幕背后回答其问题的是机器还是人类。如果人类无法将机器(或软件系统)与另一个人类区分开来,那么该机器就通过了图灵测试。
由于人类评判者可以提出任何问题,因此图灵测试既是对计算机本身的考验,也是对人类能否比计算机更具思考能力的考验。
设置
图灵测试涉及一个人(标记为 X)、一台机器(标记为 Y)和一名人类评判者,他们在不同的房间里,通过电传打字机进行交流。在测试中,人类评判者向 X 和 Y 提问,试图判断 X 和 Y 中哪一个是人,哪一个是机器。人类评判者有五分钟的时间来得出判断结果。
通过测试
机器或软件系统可以通过紧密模仿人类行为来通过测试。例如,图灵测试论文中的一个示例问题是:
问:34957 加 70764 等于多少?
答:(停顿约 30 秒后回答)105621。
这里 30 秒的停顿至关重要:机器可以立即回复,但为了模仿人类,它应该留出“思考”的停顿时间。
示例
作为图灵测试在现代的另一个示例,有人向企业发送电子邮件咨询其服务。这封邮件被转发给一个大语言模型(LLM),该模型结合收件人的个人写作风格以及发件人的原始查询,生成自动生成的独特内容。回复电子邮件会在五到十分钟后发出,这大致是人类查看收件箱后回复所需的时间。在这种情况下,发件人可能会因为回复具有个人风格且有延迟,而认为回复是由人类生成的。
扩展
图灵测试有许多变体——例如:
- 五级图灵测试在原始测试的基础上进行了扩展,分为五个级别,涵盖从基本的符号操作到具有类人智能的完整机器人实体。
- 最小智能信号测试(MIST)检查人工智能是否能产生被视为智能所需的最低限度的智能行为。
- 洛夫莱斯测试衡量人工智能是否能创造出其设计者无法解释的真正新颖且有创意的内容。
- 马库斯测试通过让人工智能观看视频并回答有关内容的问题来评测其理解能力。
- 反向图灵测试与原始图灵测试相反,要求人类证明自己不是机器,比如网站上的验证码。
谁设计了图灵测试?
Alan Turing 是一位数学家、科学家和哲学家,他设计了图灵测试。他是早期的机器智能专家,热衷于实践实验。例如,Turing 撰写了关于“通用机器”的著作,随后还参与建造了首批自动计算机之一。
1950 年 10 月,Alan Turing 在《心灵:心理学与哲学季刊》上发表了《计算机器与智能》。这篇论文描述了模仿游戏,也就是后来人们所知的图灵测试。图灵测试论文开篇写道:“我提议探讨这个问题:‘机器能思考吗?’” — 这指的就是我们现在所说的人工智能。
Turing 深刻的哲学思考以及扎实的数学和科学背景,使他成为早期人工智能和机器智能讨论中的关键人物。在随后的几十年里,通过图灵测试成为了许多人和组织的目标。虽然 Turing 于 1954 年去世,但在生成式人工智能广泛普及之前,图灵测试在计算机领域一直极具影响力。
为什么图灵测试很重要?
图灵测试重新定义了衡量智能的方式。它为评测人工智能提供了一个具体框架,将讨论从抽象的哲学辩论转向实证验证。几十年来,它一直被用作测试人工智能系统能力的主要工具,并取得了巨大成功。
对人工智能发展的影响
Turing 的设想预见了随后人工智能领域的许多发展,包括自然语言处理、机器学习以及对通用人工智能的追求。图灵测试为人工智能研究人员提供了一个衡量类人性能的基准,激发了早期创造能够模仿人类对话的机器的尝试。
早期的系统只是将用户输入重新表述为问题,尽管依赖简单的模式匹配规则,却营造出理解用户的假象。例如,在 20 世纪 90 年代,研究人员开发了 ALICE(人工语言互联网计算机实体),它使用更复杂的模式识别技术来生成回复。ALICE 标志着对话式人工智能向前迈进了一步,并多次赢得勒布纳奖竞赛,这是一项基于图灵测试评估聊天机器人的年度竞赛。
有没有人工智能通过图灵测试?
在最初的图灵测试论文中,Alan Turing 表示:“我相信,大约 50 年内,将有可能编写计算机程序,使其在模仿游戏中获得出色表现,使普通询问者在五分钟的提问后,做出正确判断的概率不会超过 70%。”
那么,Turing 的预测正确吗?
ELIZA
1966 年,早期的自然语言聊天机器人 ELIZA 成功让参与者误以为他们在与心理学家交谈。它努力成功通过了图灵测试,但只是严格限定在特定领域内基于规则进行回复。
Goostman
2014 年,计算机程序 Eugene Goostman 通过了图灵测试,不过它是通过模仿一个 13 岁的乌克兰男孩实现的。然而,通过取巧的方式通过图灵测试并没有真正达到其初衷。
现代 LLM
现代 LLM 图灵测试调查显示,人们无法区分人类和人工智能的回复。例如,在 2024 年一项严格的图灵测试研究中,有 54% 的情况下人工智能的回复被认为是人类回复。2023 年的另一项图灵测试研究表明,人们将 LLM 误判为人类的概率为 49.7%。
图灵测试有哪些限制?
现代人工智能专家认为,图灵测试并不是评测人工智能能力的最佳方法。现代生成式人工智能解决方案可以生成高度连贯且具有上下文感知的回复。尽管它们能够进行复杂的对话,但无法复制代表人类智能的复杂学习和处理行为。现代人工智能专家指出,通过图灵测试并不能真正表明具备智能,而仅仅意味着具备模仿人类对话的能力。
在后生成式人工智能时代,研究人员更关注人类在核实人工智能生成内容时存在的局限性。例如,人工智能产生的幻觉会“编造”信息,而人类可能会将其解读为准确信息。人工智能系统中的偏见会生成数据,可能使某些群体比其他群体获得更多优势。因此,对于现代环境而言,图灵测试过于简单。
生成式人工智能的图灵测试替代方案有哪些?
对于那些希望部署 LLM 解决方案的人来说,基准测试和人机协同方法是比图灵测试更好的选择。
LLM 基准测试
通过基准测试,您可以使用标准化数据集和指标进行客观的性能评测。您可以确保模型满足特定的准确性、连贯性和公平性标准。例如,
- 自然语言处理基准测试,如通用语言理解评估(GLUE)和超级通用语言理解评估(SuperGLUE),用于评测模型在语法、语义和逻辑推理方面的性能。
- ImageNet 等计算机视觉基准测试为评测物体识别模型提供了广泛认可的标准,而上下文常见物体(COCO)则用于衡量更复杂的图像分割和图像字幕生成任务。
- 负责任的人工智能基准测试,如 AI 公平性 360,用于识别和减轻机器学习模型中的偏见。
通过这些标准化评估,开发人员可以客观地比较模型,跟踪其随时间的改进情况,并确保人工智能系统在部署前符合可靠性和道德标准。
人机协同
人际协同系统将专家监督整合到人工智能决策过程中,根据现实世界的反馈优化响应,并减少偏见。例如
- 人工智能选择不确定的案例供人工审核,利用专家标注的数据提高模型准确性。
- 在基于人类反馈的强化学习(RLHF)中,人工智能根据用户偏好和专家纠正优化响应。
- 人工审核人工智能决策,以检测和减轻预测或推荐中的偏见。
- 人工智能将不确定或高风险的决策提交给人类专家进行最终判断。
- 专家和人工智能协同工作,人工智能在医疗诊断或内容审核等任务中提供辅助。
这些方法提供了更实际、可衡量的方式来评测人工智能的能力。它们不仅仅模仿人类对话,还会评估实用性、可靠性以及与预期任务的契合度。
AWS 如何支持您的人工智能评估需求?
Amazon Bedrock 评估和 Amazon SageMaker Clarify 能帮助您评测生成式人工智能模型,包括自定义和导入模型,以找到符合需求的模型。例如,您可以
- 使用精选和自定义数据集,针对准确性、可靠性和毒性等预定义指标,设置自动模型评测。
- 使用 LLM-as-a-judge 模式,让一个人工智能评测另一个人工智能的正确性、完整性和可信性(幻觉)等指标。
- 通过几个简单步骤设置人工评估工作流程。
- 您可以使用自己的数据集并定义自定义指标,如相关性、风格以及与品牌风格的一致性。人工评估工作流程可以让您的员工担任评审员,或者让 AWS 聘请专业评估人员并代您管理整个工作流程。通过我们的控制面板,您可以比较多个评估作业的结果,以更快做出决策。
立即创建免费账户,开始在 AWS 上使用人工智能模型评测。
Browse all cloud computing concepts
Browse all cloud computing concepts content here:
Did you find what you were looking for today?
Let us know so we can improve the quality of the content on our pages