ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

AWED-FiNER框架详解:SampurNER_Bengali_MuRIL作为专家检测器的应用

2026/8/8 20:38:27 拓冰建站 浏览量
AWED-FiNER框架详解:SampurNER_Bengali_MuRIL作为专家检测器的应用 AWED-FiNER框架详解SampurNER_Bengali_MuRIL作为专家检测器的应用【免费下载链接】SampurNER_Bengali_MuRIL项目地址: https://ai.gitcode.com/hf_mirrors/prachuryyaIITG/SampurNER_Bengali_MuRILSampurNER_Bengali_MuRIL是基于Google MuRIL模型在孟加拉语SampurNER数据集上微调的细粒度命名实体识别NER模型作为AWED-FiNER框架中的专家检测器专为解决低资源语言的细粒度实体识别挑战而设计。该模型通过EaMaTa框架构建利用Few-NERD数据集的标签体系实现对孟加拉语文本中复杂实体类型的精准识别。什么是AWED-FiNER框架AWED-FiNERAgents, Web applications, and Expert Detectors for Fine-grained Named Entity Recognition是一个创新的多语言细粒度命名实体识别框架旨在为全球66亿 speakers 提供跨36种语言的实体识别能力。框架的核心组件包括智能代理Agents协调不同语言专家模型的任务分配与结果整合网络应用Web applications提供用户友好的交互界面与API服务专家检测器Expert Detectors针对特定语言优化的细粒度NER模型如SampurNER_Bengali_MuRIL该框架的技术细节在论文《AWED-FiNER: Agents, Web applications, and Expert Detectors for Fine-grained Named Entity Recognition across 36 Languages for 6.6 Billion Speakers》中有详细阐述为多语言NLP任务提供了全新的解决方案。SampurNER_Bengali_MuRIL模型核心特性细粒度实体标签体系基于Few-NERD数据集构建的标签系统将实体分为8个大类和数十个子类实现前所未有的识别精度LocationGPE国家/城市、水体、岛屿、山脉等Person演员、艺术家/作家、运动员、政治家等职业细分ORG公司、教育机构、政府组织、媒体等Building机场、医院、酒店、体育设施等Art音乐、电影、文学作品、绘画等Product飞机、汽车、食品、软件等Event攻击、选举、自然灾害、体育赛事等Misc天文、奖项、生物、疾病等特殊类别模型配置文件[config.json]中定义了133种实体标签包括B/I/O标记完整覆盖了复杂场景下的实体识别需求。性能表现在孟加拉语SampurNER数据集上的评估结果显示Precision: 66.54Recall: 70.08F1 Score: 68.26这一性能在低资源语言的细粒度NER任务中处于领先水平证明了模型在处理孟加拉语复杂实体时的有效性。技术架构模型基于[google/muril-large-cased]预训练模型构建采用BertForTokenClassification架构关键参数包括隐藏层大小1024注意力头数量16隐藏层数量24词汇表大小197285训练过程使用AdamW优化器学习率5e-5权重衰减0.01在64 batch size下训练6个epochs确保模型充分收敛。快速开始使用指南环境准备首先安装必要的依赖库pip install smolagents gradio_client基本使用示例通过AWED-FiNER工具类加载并使用模型from tool import AWEDFiNERTool # 初始化工具指定模型空间ID tool AWEDFiNERTool( space_idprachuryyaIITG/AWED-FiNER ) # 处理文本并获取实体识别结果 result tool.forward( textজুড বেলিংহাম 2023 সালে রিয়াল ম্যাড্রিডে যোগ দিয়েছেন।, languageBengali ) print(result)完整项目获取要获取完整的模型和代码请克隆仓库git clone https://gitcode.com/hf_mirrors/prachuryyaIITG/SampurNER_Bengali_MuRIL应用场景与价值SampurNER_Bengali_MuRIL作为AWED-FiNER框架的关键组件在多个领域具有重要应用价值多语言内容分析为跨语言信息检索提供实体级理解社交媒体监控精准识别孟加拉语社交内容中的人物、组织和事件新闻自动化处理自动提取新闻文章中的关键实体支持内容分类与推荐低资源NLP研究为其他低资源语言的NER模型开发提供参考范式引用与贡献如果您在研究中使用了SampurNER_Bengali_MuRIL请引用以下论文inproceedings{kaushik2026sampurner, title{SampurNER: Fine-Grained Named Entity Recognition Dataset for 22 Indian Languages}, volume{40}, url{https://ojs.aaai.org/index.php/AAAI/article/view/40405}, DOI{10.1609/aaai.v40i37.40405}, number{37}, journal{Proceedings of the AAAI Conference on Artificial Intelligence}, author{Kaushik, Prachuryya and Anand, Ashish}, year{2026}, month{Mar.}, pages{31410-31418} } misc{kaushik2026awedfineragentswebapplications, title{AWED-FiNER: Agents, Web applications, and Expert Detectors for Fine-grained Named Entity Recognition across 36 Languages for 6.6 Billion Speakers}, author{Prachuryya Kaushik and Ashish Anand}, year{2026}, eprint{2601.10161}, archivePrefix{arXiv}, primaryClass{cs.CL}, url{https://arxiv.org/abs/2601.10161}, }该项目由Prachuryya Kaushik和Ashish Anand教授共同开发是SampurNER系列研究的重要组成部分也是AWED-FiNER多语言实体识别生态的关键一环。更多信息可访问项目的交互式演示空间和GitHub仓库获取。【免费下载链接】SampurNER_Bengali_MuRIL项目地址: https://ai.gitcode.com/hf_mirrors/prachuryyaIITG/SampurNER_Bengali_MuRIL创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考