“中文十级”难题,AI怎样解读产业界
2018-08-07 10:27:58AI云资讯1331
在人工智能领域,“懂语言者得天下”是普遍的共识。其中,可帮助人工智能识别人类语言的自然语言处理(NLP)被誉为人工智能语言“皇冠上的明珠”。
当人工智能自然语言处理技术遇到“要你管和不要你管”“掉地上和掉地下”“我一把把把把住了”等中文“绕口令”,“小意思”“意思意思”等多义词时,及“俺们那疙”“中不中”等方言时,该怎样“听懂”这些“中文十级”语句呢?日前在成都举办的科大讯飞未来科栈活动上,记者采访了相关专家。

能分词会断句 机器尚在努力
NLP就是机器让计算机来理解和处理人类自然语言的技术,它和计算机视觉、语音处理的区别在于信息处理的类型。
“计算机视觉主要处理图像,语音技术处理声音,而NLP主要是对文字的理解。”云浮科技的创始人兼CEO张文斌说,在人工智能中,语音识别是耳朵,语音合成是嘴巴,计算机视觉是眼睛,而NLP则负责将抽象的文字符号转化为计算机能理解的语言。
“‘中文十级’的某些语句,人类去理解都有很大难度,何况是计算机。”张文斌说,在口语和书写上,汉字往往没有词与词之间的边界,即便机器能够准确识别文字,但理解它的意思却很难;再比如各种五花八门的地方口音和方言,也是“绊脚石”。
“自然语言处理一般从最小的语意单位‘词’开始,即分词算法。这最简单,也最成熟。”张文斌说, NLP的算法分为语法级别、句子级别分析等,其中分词就是将字词切开,让机器明白哪几个字组成一个词,哪几个词组成一句话,从而理解整句、整段的意思。但在“分词”实际的应用过程中,仍有各种问题。
张文斌解释,首先是分词标准不确定、存在歧义,及新词和实体词困扰等问题。如“乒乓球,拍卖完了”和“乒乓球拍,卖完了”无论怎么切分都正确,这就要依赖上下文语境。其次,每年都会涌现出的网络词汇,“神马”“不明觉厉”“佛系”等原来不存在的词也需要计算机理解。
听语气判关系 AI有新招
如何让机器读懂上下文语境,从而进一步了解整段话的含义?
“我们会尝试利用听人类说话时的停顿信息,作为一种分词算法的辅助。”讯飞翻译业务负责人翟吉博说。
对于AI工程师们来说,更重要的是深层次的算法,如实体识别、属性抽取等。“就是把人名、地名、机构名等实体识别出来后,再抽取实体之间的关系,搞清楚不同实体在句子中的不同属性。”张文斌说,五花八门的算法还有很多,比如情感分析,分析文本里面蕴藏了什么样的情感,是正面、负面还是中性的;文档摘要,把长文生成一两百字简短的摘要等。而基于这些算法层,又可以做很多NLP的衍生应用,包括自动问答、机器翻译等。
那如何识别方言呢?在科大讯飞的新款翻译机设备中,首次推出方言翻译功能,实现河南话、东北话、粤语等方言互译,或将之翻译成外语。翟吉博说,针对不同类型方言,机器采用不同翻译流程——对同属北方方言区的河南话、东北话等,可先翻译成普通话再翻译成外语;对于粤语等南方语言,则建立独立的语料库,直接从粤语到外语进行翻译。“考虑到方言中带有许多地方特色的说法、语言、词汇,‘雄起’‘中不中’等也可以作为独立的语料,由机器单独学习。”他说,人工智能的优势是在自然语言处理方面能够不断从用户处积累语料,学习新的词汇和表达方式,不断完成自身数据库和语料库的更新。
相关文章
- 天翼云息壤2500万Tokens免费送,打通国产AI落地“最后一公里”
- “码”上有礼!仅需1元!跟随联通元景即刻解锁GLM-5,畅享AI编程新体验
- IBM推出AI智能体驱动的FlashSystem全闪存产品组合,开启“自主存储”新时代
- 查体智能辅助诊疗系统PC版正式发布暨AI中医应用示范医院挂牌
- AI问答正在取代搜索,品牌曝光逻辑彻底变了,软文街GEO帮你抢占新入口
- 爆火Elys + 声网对话式AI引擎,把社交交给AI赛博分身
- 陪伴机器人塞满马年购物车,涂鸦智能打造“AI新年货”
- 艾利特机器人发布“Elite PAI”具身智能大模型,定义工业场景的“有效智能”
- 思博伦通信推出首款面向网络测试与保障的Agentic AI解决方案
- AI中医可视化,把脉是否雷同心电图,看舌头可否归为影像学
- 中昊芯英“刹那®”TPU AI芯片Day0适配智谱GLM-5
- 五载同行!LED+AI+XR,揭秘2026春晚视觉幕后的“洲明力量”
- 500万用户追捧!百度地图岳云鹏文心AI副驾对话破亿,春节互动数据亮眼
- 安徽电信携手华为打造5G-A x AI大上行样板,助力合肥骆岗公园大型无人机灯光秀精彩呈现
- 白龙马变身文心AI副驾?岳云鹏携手百度地图上天津春晚,送出2亿红包!
- 山东移动携手中兴通讯:AI主动治盲,打造地下停车场感知标杆
人工智能企业
更多>>人工智能硬件
更多>>人工智能产业
更多>>人工智能技术
更多>>- 云知声Unisound U1-OCR大模型发布!首个工业级文档智能基础大模型,开启OCR 3.0时代
- 基石智算上线 MiniMax M2.5,超强编程与智能体工具调用能力
- 昇腾原生支持,科学多模态大模型Intern-S1-Pro正式发布并开源
- 百度千帆深度研究Agent登顶权威评测榜单DeepResearch Bench
- 在MoltBot/ClawdBot,火山方舟模型服务助力开发者畅享模型自由
- 教程 | OpenCode调用基石智算大模型,AI 编程效率翻倍
- 全国首个!上海上线规划资源AI大模型,商汤大装置让城市治理“更聪明”
- 昇思人工智能框架峰会 | 昇思MindSpore MoE模型性能优化方案,提升训练性能15%+









