文本挖掘的分词原理

在做文本挖掘的时候,首先要做的预处理就是分词。英文单词天然有空格隔开容易按照空格分词,但是也有时候需要把多个单词做为一个分词,比如一些名词如“New York”,需要做为一个词看待。而中文由于没有空格,分词就是一个需要专门去解决的问题了。无论是英文还是中文,分词的原理都是类似的,本文就对文本挖掘时的分词原理做一个总结。……

阅读更多

《基于 PyTorch 的自然语言处理》pdf

本书适用于自然语言处理(NLP)和深度学习的新手学习两个领域中的一些重要的知识点。这两个领域研究热点都呈指数增加。由于本书强调深度学习和自然语言处理中的代码实现,这些代码都是基于PyTorch实现的,因此它也适用于有一定NLP和深度学习基础的人。……

阅读更多

《自然语言处理综论》

《Speech and Language Processing (3rd ed. draft)》是一本全面系统地讲述计算机自然语言处理的优秀教材。本书出版之后好评如潮,国外许多著名大学纷纷把本书选为自然语言处理和计算语言学课程的主要教材,该书被誉为该领域教材的“黄金标准”。……

阅读更多