ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

从0到1掌握bert-portuguese-ner:葡萄牙语NER模型的安装与快速上手

2026/8/14 7:28:37 拓冰建站 浏览量
从0到1掌握bert-portuguese-ner:葡萄牙语NER模型的安装与快速上手

从0到1掌握bert-portuguese-ner:葡萄牙语NER模型的安装与快速上手

【免费下载链接】bert-portuguese-ner项目地址: https://ai.gitcode.com/hf_mirrors/lfcc/bert-portuguese-ner

bert-portuguese-ner是一个基于BERT架构的葡萄牙语命名实体识别(NER)模型,专为处理葡萄牙语档案文献设计。它能够精准识别文本中的日期、职业、人物、地点和组织等关键实体,为葡萄牙语文本分析提供强大支持。

🌟 模型核心优势

高准确率的实体识别能力

该模型在评估集上达到了97.00%的准确率93.12%的F1分数,能够有效识别以下5类实体:

  • B-Data(日期)和I-Data(日期内部)
  • B-Local(地点)和I-Local(地点内部)
  • B-Organizacao(组织)和I-Organizacao(组织内部)
  • B-Pessoa(人物)和I-Pessoa(人物内部)
  • B-Profissao(职业)和I-Profissao(职业内部)

专为葡萄牙语优化

基于neuralmind/bert-base-portuguese-cased预训练模型微调,针对葡萄牙语语法特点和档案文献领域进行了专项优化,词汇表规模达29794个,支持葡萄牙语特有词汇和拼写。

🚀 快速安装指南

1. 克隆项目仓库

git clone https://gitcode.com/hf_mirrors/lfcc/bert-portuguese-ner cd bert-portuguese-ner

2. 安装依赖环境

确保已安装Python 3.7+,然后安装必要依赖:

pip install transformers==4.10.0.dev0 torch==1.9.0+cu111 datasets==1.10.2 tokenizers==0.10.3

💡 模型使用教程

加载模型和分词器

from transformers import BertTokenizer, BertForTokenClassification tokenizer = BertTokenizer.from_pretrained("./") model = BertForTokenClassification.from_pretrained("./")

实体识别示例

text = "João Silva trabalhou na Universidade de Lisboa em 2020." inputs = tokenizer(text, return_tensors="pt") outputs = model(**inputs) predictions = outputs.logits.argmax(dim=2) # 将预测结果转换为实体标签 id2label = model.config.id2label tokens = tokenizer.convert_ids_to_tokens(inputs["input_ids"][0]) for token, prediction in zip(tokens, predictions[0]): if token not in ["[CLS]", "[SEP]", "[PAD]"]: print(f"{token}: {id2label[prediction.item()]}")

📊 模型性能表现

关键评估指标

  • 准确率(Accuracy):97.00%
  • 精确率(Precision):91.47%
  • 召回率(Recall):94.83%
  • F1分数:93.12%

训练过程表现

训练轮次训练损失验证损失F1分数
1-0.14380.9148
20.24540.12220.9196
30.05260.10980.9312
40.03720.11400.9312

⚙️ 模型配置详解

核心参数

  • 隐藏层大小:768
  • 注意力头数:12
  • 隐藏层层数:12
  • 最大序列长度:512
  • 优化器:Adam(学习率2e-05)

实体标签映射

完整的实体标签定义可在config.json中查看,包含11种标签类型,其中以B-开头的表示实体开始,I-开头的表示实体内部,O表示非实体。

📚 数据集来源

模型训练数据来自葡萄牙档案文献标注语料库,可通过http://ner.epl.di.uminho.pt/获取完整数据集。该语料库包含大量历史档案文献,标注精细,适合葡萄牙语NER任务训练。

📄 引用与致谢

如果使用本模型,请引用以下论文:

@Article{make4010003, AUTHOR = {Cunha, Luís Filipe and Ramalho, José Carlos}, TITLE = {NER in Archival Finding Aids: Extended}, JOURNAL = {Machine Learning and Knowledge Extraction}, VOLUME = {4}, YEAR = {2022}, NUMBER = {1}, PAGES = {42--65}, DOI = {10.3390/make4010003} }

模型基于neuralmind/bert-base-portuguese-cased预训练模型开发,感谢原作者团队的贡献。

🎯 应用场景

  • 葡萄牙语历史文献数字化处理
  • 档案管理系统实体提取
  • 葡萄牙语新闻自动摘要
  • 学术论文实体标注辅助工具
  • 多语言NER系统构建组件

【免费下载链接】bert-portuguese-ner项目地址: https://ai.gitcode.com/hf_mirrors/lfcc/bert-portuguese-ner

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考