☰
SinLlama -- A Large Language Model for Sinhala
2026/9/29 8:00:40 网站建设 项目流程

SinLlama相关总结与翻译

一、文章主要内容

(一)研究背景

低资源语言(如僧伽罗语)常被开源大型语言模型(LLMs)忽视,现有多语言LLM(如Llama、Gemma)在低资源语言上表现欠佳,且部分支持僧伽罗语的模型(如MaLA-500、Aya-101)要么性能不如主流模型,要么规模过大、内存需求高,加剧了数字鸿沟。僧伽罗语作为仅约2000万人使用的印欧语系语言,被归为低资源语言,此前相关NLP技术多为规则式、统计式或早期深度学习方法,已显陈旧。

(二)研究目标

将现有多语言LLM(Llama-3-8B)进行扩展,提升其对僧伽罗语的支持,打造专门针对僧伽罗语、性能更优且资源需求合理的开源LLM。

(三)研究过程

  1. 模型选择:对比12种开源多语言LLM(如Llama-3-8B、MaLA-500等),基于多语言能力、参数规模(80亿以下)、僧伽罗语代表性及性能指标,选定Llama-3-8B作为基础模型。
  2. 数据集构建
    • 预训练数据:融合MADLAD-400和CulturaX的僧伽罗语数据,经启发式过滤(如移除非僧伽罗语句子、URL等)和去重,得到含10730154个句子、303958959个token的数据集。
    • 微调数据:选取3个僧伽罗语文本分类公开数据集(新闻

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询