AI 胜利简史:哪里有评分体系,哪里就有 AI 入侵
BiRun 消息,作者:Robonaissance 编译:深潮 TechFlow 深潮导读: 围棋、国际象棋、蛋白质折叠——这些看似需要人类直觉和创造力的领域,为什么一个接一个被 AI 攻破?本文揭示了一个被忽略的规律:决定 AI 能否超越人类的,不是任务难度,而是能否给成功打分。当一个领域建立了评分标准,它就为自己的被攻克设下了倒计时。 选自《Whatever You Ask For》系列,关于那个机器无法替我们做的唯一工作。 万分之一 2016 年 3 月 10 日,首尔一家酒店里,一台机器下出了房间里所有人都看不懂的一步棋,而它的对手当时不在场。 李世石出去抽烟了。他当时 33 岁,手握 18 个世界冠军头衔,公认是那一代最强的围棋选手。他在前一天的第一局输了,进入第二局时比赛前的自信收敛了不少,心态更加谨慎。他在外面时,AlphaGo 选择了第 37 手,DeepMind 研究员黄士杰代替机器,安静地把棋子放在了棋盘上。 棋子落在了第五线。 对不懂围棋的人来说,这没什么意义。对懂的人来说,这近乎胡闹。在开局和中盘阶段,离边缘那么远的位置被认为效率低下,既拿不到实地,也守不住地盘,等于白送分给对手。这是老师会纠正初学者的那种下法。解说席上,顶级职业棋手 Michael Redmond 在直播比赛时,一开始以为是棋盘信号出错了。他拿起一颗棋子,又放了下来。 李世石回来坐下,盯着棋盘看了很久没动。各种说法从大约 12 分钟到 15 分钟不等。五个月前被 AlphaGo 击败的欧洲冠军樊麾当时在楼里观战。他盯着看了很久后的判断是:"这不是人类的下法。我从没见人这么下过。" 他说得对,而且对得可以量化。DeepMind 的系统内部有一个估算机制,通过学习大量人类对局,估计在任何局面下人类下出某一手棋的概率。对于第 37 手,这个估算值大约是万分之一。 机器还是下了,而这手棋赢下了整盘。 对这个故事有一种舒服的解读,说机器非常努力地学习人类大师,最终赶上了他们中最强的。这种解读是错的,万分之一这个数字恰恰说明了为什么错。一个学习模仿人类下法的系统有天花板,天花板就是人类的下法。首尔发生的事情是,一个系统不再被那个天花板约束,因为它被给定的追求目标不是人类大师的认可,而是赢棋。 这个区别指向的方向比赞叹更有用。如果你想知道哪些人类活动在纯粹能力维度上已经输了,哪些是下一个,要问的问题不是这个活动有多难,有多需要创造力,或需要多少直觉。问题比那无聊得多。 问题是,成功能不能打分。 一盘接一盘国际象棋在 19 年前就输了,输的方式完全不同。 深蓝在 1997 年击败卡斯帕罗夫,用的架构本质上是一次巨大的人类表达行为。它的评估函数——看一个局面并给出有多好的数字的组件——是在特级大师顾问的帮助下组装和调优的。人类的象棋知识被辛苦地从人类棋手那里提取出来,写进了机器。机器增加的是搜索能力:更快地向前看更多步,不知疲倦,不会因注意力涣散而丢棋。 这是一次真正的胜利,应该算作一次胜利。但注意它的形态。深蓝对象棋的理解是人类的理解。它的优势是速度。如果你问它为什么那样评估一个局面,答案最终会落到某个告诉它这么做的人身上。 20 年后,DeepMind 发布了一个叫 AlphaZero 的系统,形态变了。 AlphaZero 被给定了象棋规则。它没有被给定开局库——每个严肃程序都依赖的研究过的首着目录。它没有被给定残局表。它没有被给定一盘人类对局。它自己和自己下,从随机走法开始,根据什么能赢来调整自己。 大约四小时后,DeepMind 估计它的等级分超过了当时最强的传统程序 Stoc
免责声明:本文内容仅供参考,不构成任何投资建议。
更多快讯