中文自动转SQL,准确率高达92%,这位Kaggle大师刷新世界纪录
作者头像
  • AI广仁
  • 2020-07-18 09:36:30 5

在由追一科技主办的首届中文NL2SQL挑战赛上,诞生了一项超越国际水平的自然语言处理(NLP)研究成果。

比赛中,最佳成绩达到了92.19%的准确率,超过了目前英文数据集WikiSQL在完全匹配精度(86.0%)和执行匹配精度(91.8%)上的最高记录。

此次比赛的获胜队伍名为“不上90不改名字”,团队成员包括国防科技大学的博士张啸宇、硕士赛斌以及来自昂钛客AI的王苏宏,他们最终赢得了8万元奖金。

比赛吸引了来自国内外多所知名高校和企业的1457支队伍参与,最终脱颖而出的冠军队伍凭借超过92%的准确率让评委们感到惊喜不已。评委之一、复旦大学教授肖仰华表示,比赛结果远超预期。

追一科技的CTO刘云峰指出,从比赛初期的60%左右准确率提升至超过92.19%,其进步幅度令人惊讶。此外,本次比赛使用的中文数据集难度高于WikiSQL英文数据集,这也表明在同等条件下,冠军团队的解决方案已经超越了国外机构的最佳算法在中文任务上的表现。

NL2SQL最佳方法揭秘

NL2SQL即把自然语言转化为机器可理解的SQL语句,在人机交互中具有重要意义。这意味着,在92.19%的情况下,机器能够准确理解人的语言并给出相应答案。

肖仰华教授认为,目前阻碍大数据价值实现的主要障碍在于访问数据的门槛过高,依赖于数据库管理员编写复杂SQL语句。考虑到中文表达的多样性,中文NL2SQL比英文更加困难。

解决从中文自然语言到SQL语句的转换问题,可以显著提高AI系统的智能水平,使其更容易理解用户的问题并找到答案。在本次比赛中,冠军团队的张啸宇详细介绍了他们的解决方案。

冠军团队介绍

冠军团队“不上90不改名字”的队长张啸宇是国防科技大学的博士生,同时也是一位热衷于NLP领域的竞赛爱好者。他曾多次在各类比赛中获奖,包括2018年莱斯杯军事阅读理解挑战赛第二名和2019年Kaggle PetFinder比赛金牌。

另一位队员赛斌是张啸宇的同窗,而王苏宏则是在Kaggle社区结识的队友,目前也是Kaggle排行榜上前1000名的用户。

尽管他们在准备比赛的时间上比其他队伍短,但他们依然取得了第一名的好成绩。他们总结的经验是:多写代码,多读论文。

帮技术的“锤子”,找场景的“钉子”

追一科技总部位于深圳,在北京、上海、南京、香港、新加坡、白俄罗斯等地设有研发团队或分公司。成立三年以来,追一科技已完成四轮融资,累计融资额达7000万美元,主要客户包括招商银行信用卡、中国移动、南方电网、中国人保、腾讯等。

追一科技在多项NLP任务中取得突破,包括CoQA、CMRC2018中文机器阅读理解等挑战赛的冠军。刘云峰表示,希望通过这次比赛推广中文NL2SQL技术,促进技术的实际应用。

从NLP到计算机视觉

值得一提的是,尽管比赛属于NLP领域,但仍然吸引了不少计算机视觉(CV)领域的研究者参与。进入决赛的队伍“大佬带我飞”中就有两名成员是CV方向的研究生。

评委之一、追一科技CTO刘云峰认为,工业界的应用趋势正朝着多模态融合的方向发展,视觉和NLP的结合日益紧密。追一科技作为一家专注于NLP的公司,也在积极发展视觉和语音技术。

刘云峰预计,未来头部AI公司将具备全栈AI能力,涵盖多种技术领域。同时,比赛的数据集将在未来公开,可能成为NLP领域新的竞争焦点。

传送门

冠军团队的解决方案可以在以下链接查看:

https://github.com/nudtnlp/tianchi-nl2sql-top1

更多相关信息可参阅以下链接:

https://tianchi.aliyun.com/competition/entrance/231716/introduction

https://github.com/salesforce/WikiSQL


以上是改写后的文章内容,旨在保留原文核心信息的同时提高可读性和独特性。

    本文来源:图灵汇
责任编辑: : AI广仁
声明:本文系图灵汇原创稿件,版权属图灵汇所有,未经授权不得转载,已经协议授权的媒体下载使用时须注明"稿件来源:图灵汇",违者将依法追究责任。
    分享
准确率世界纪录中文刷新高达这位大师自动KaggleSQL
    下一篇