ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

VnCoreNLP是什么?越南语NLP工具包完整入门指南:分词、词性标注、NER与依存解析4大核心功能一次看懂

2026/8/21 18:58:49 拓冰建站 浏览量
VnCoreNLP是什么?越南语NLP工具包完整入门指南:分词、词性标注、NER与依存解析4大核心功能一次看懂 VnCoreNLP是什么越南语NLP工具包完整入门指南分词、词性标注、NER与依存解析4大核心功能一次看懂【免费下载链接】VnCoreNLPA Vietnamese natural language processing toolkit (NAACL 2018)项目地址: https://gitcode.com/gh_mirrors/vn/VnCoreNLPVnCoreNLP是一个快速且精准的越南语自然语言处理NLP工具包发表于 NAACL 2018它通过越南语分词、词性标注、命名实体识别NER和依存句法解析四大核心功能为越南语文本提供完整的语言学标注流水线。本文将用最通俗的方式带你快速看懂 VnCoreNLP 是什么、能做什么、如何安装与使用帮助新手一步完成越南语 NLP 入门。什么是VnCoreNLP越南语NLP工具包的核心定位VnCoreNLP 是越南语领域最著名的开源 NLP 工具包之一由研究团队开发并发表于 NAACL 2018 论文 VnCoreNLP: A Vietnamese Natural Language Processing Toolkit。它的核心卖点有三个✅开箱即用无需安装任何外部依赖下载 jar 包和模型文件即可直接运行✅又快又准四大 NLP 组件均达到当时最先进的精度同时保持极高的处理速度✅覆盖全面从分词到句法分析一条流水线完成越南语文本的深度语言学标注。你可以把 VnCoreNLP 理解为越南语版的斯坦福 CoreNLP。它既支持命令行一键批处理也提供 Java 与 Python API学术研究和工业落地都能胜任。VnCoreNLP 4大核心功能详解越南语分词Word Segmentation把词拼回原形越南语以空格分隔音节一个词常常由多个音节组成例如 làm việc工作由两个音节构成一个词。分词组件的任务就是把它们正确地合并为 làm_việc。VnCoreNLP 的分词器基于 RDRRipple Down Rules规则学习算法模型文件为models/wordsegmenter/wordsegmenter.rdr并内置越南语词典models/wordsegmenter/vi-vocab辅助判断核心实现位于src/main/java/vn/corenlp/wordsegmenter/WordSegmenter.java。越南语词性标注POS Tagging给每个词打上语法标签词性标注为每个词标注名词、动词、形容词等词性采用 VLSP2013 标注体系共 22 种标签如 Np专有名词、V动词、A形容词、E介词等。VnCoreNLP 使用基于感知器Perceptron的标注器模型文件为models/postagger/vi-tagger核心实现位于src/main/java/vn/corenlp/postagger/PosTagger.java完整标签对照表可查看项目根目录的TagsetDescription.md。越南语命名实体识别NER自动找出人名、地名、机构名NER 组件能自动识别文本中的**人名PER、地名LOC、机构名ORG**及其他专有实体MISC采用 BIO 格式输出如 B-PER、I-PER。它借助 500 类 Brown 聚类特征和预训练词向量进一步提升精度用到的模型文件包括模型文件用途models/ner/vi-ner.xzNER 主模型models/ner/vi-500brownclusters.xz500 类 Brown 聚类特征models/ner/vi-pretrainedembeddings.xz预训练词向量核心实现位于src/main/java/vn/corenlp/ner/NerRecognizer.java。越南语依存句法解析Dependency Parsing还原句子结构依存解析能还原句子中词与词之间的语法关系如主语sub、宾语dob、修饰语nmod等输出一棵完整的依存树模型文件为models/dep/vi-dep.xz核心实现位于src/main/java/vn/corenlp/parser/DependencyParser.java。这一功能对机器翻译、信息抽取等下游任务尤其重要。VnCoreNLP快速安装两步搞定环境安装 VnCoreNLP 非常简单只需要两步准备 Java 环境VnCoreNLP 基于 Java 开发需要 Java 1.8 及以上版本获取 jar 包与模型clone 仓库后将VnCoreNLP-1.2.jar约 27MB与models文件夹约 115MB放在同一工作目录即可git clone https://gitcode.com/gh_mirrors/vn/VnCoreNLPVnCoreNLP使用教程Python 一行代码调用对于 Python 用户官方提供了py_vncorenlp封装库安装与调用都非常简单import py_vncorenlp # 自动下载模型组件并保存到本地目录 py_vncorenlp.download_model(save_dir/absolute/path/to/vncorenlp) # 加载 VnCoreNLP默认启用分词、词性标注、NER、依存解析 model py_vncorenlp.VnCoreNLP(save_dir/absolute/path/to/vncorenlp) # 对一段越南语文本进行标注 model.print_out(model.annotate_text(Ông Nguyễn Khắc Chúc đang làm việc tại Đại học Quốc gia Hà Nội.))如果只需要分词可以只加载 wseg 组件速度更快rdrsegmenter py_vncorenlp.VnCoreNLP(annotators[wseg], save_dir/absolute/path/to/vncorenlp) print(rdrsegmenter.word_segment(Ông Nguyễn Khắc Chúc đang làm việc tại Hà Nội.))VnCoreNLP使用教程Java 命令行与 API命令行一键批处理# 分词 词性标注 NER 依存解析 java -Xmx2g -jar VnCoreNLP-1.2.jar -fin input.txt -fout output.txt # 只做分词和词性标注 java -Xmx2g -jar VnCoreNLP-1.2.jar -fin input.txt -fout output.txt -annotators wseg,posJava API 调用示例参考官方示例src/test/java/VnCoreNLPExample.java核心代码如下String[] annotators {wseg, pos, ner, parse}; VnCoreNLP pipeline new VnCoreNLP(annotators); Annotation annotation new Annotation(Ông Nguyễn Khắc Chúc đang làm việc tại Đại học Quốc gia Hà Nội.); pipeline.annotate(annotation); System.out.println(annotation.toString());输出结果怎么看6 列注释格式解析VnCoreNLP 的输出采用统一的 6 列 TSV 格式每一列含义如下列含义示例1词序号12词形下划线连接的多音节词Nguyễn_Khắc_Chúc3词性标注 POS tagNp4NER 标签B-PER5依存解析父节点序号16依存关系类型nmod实际输出效果1 Ông Nc O 4 sub 2 Nguyễn_Khắc_Chúc Np B-PER 1 nmod 3 đang R O 4 adv 4 làm_việc V O 0 root 5 tại E O 4 loc可以看到工具正确识别出 Nguyễn_Khắc_Chúc 是专有名词Np且为人名B-PER并还原了整句话的依存结构一条命令就完成了全部四大任务。VnCoreNLP 源码结构快速导航整个流水线的主入口是src/main/java/vn/pipeline/VnCoreNLP.java它负责协调四个核心组件组件源码位置模型目录分词src/main/java/vn/corenlp/wordsegmenter/WordSegmenter.javamodels/wordsegmenter/词性标注src/main/java/vn/corenlp/postagger/PosTagger.javamodels/postagger/NERsrc/main/java/vn/corenlp/ner/NerRecognizer.javamodels/ner/依存解析src/main/java/vn/corenlp/parser/DependencyParser.javamodels/dep/VnCoreNLP 常见问题FAQQVnCoreNLP 支持中文或英文吗A不支持VnCoreNLP 专为越南语设计。不过流水线内置了语言检测功能会自动跳过非越南语内容。Q运行需要 GPU 吗A不需要。VnCoreNLP 对 CPU 非常友好普通机器即可流畅运行。Q如何只使用其中的某一个功能A通过-annotators参数命令行或annotators数组API自由组合 wseg、pos、ner、parse 即可按需加载还能进一步提速。总结VnCoreNLP 值得用吗如果你需要处理越南语文本VnCoreNLP 几乎是绕不开的选择。它一次集成了越南语分词、词性标注、命名实体识别、依存句法解析四大核心功能安装简单、开箱即用、精度业界领先并且同时提供 Java 与 Python 接口。无论是做越南语情感分析、机器翻译还是信息抽取从 VnCoreNLP 入门都是最高效的路径。【免费下载链接】VnCoreNLPA Vietnamese natural language processing toolkit (NAACL 2018)项目地址: https://gitcode.com/gh_mirrors/vn/VnCoreNLP创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考