最新动态
KazLLM:哈萨克斯坦主权大语言模型开启中亚人工智能新纪元
来源:
ISSAI (纳扎尔巴耶夫大学)
由纳扎尔巴耶夫大学 ISSAI 团队打造的 KazLLM 大语言模型,标志着哈萨克斯坦在数字主权和自主人工智能技术领域迈出战略性一步,原生支持哈萨克语、俄语、英语及土耳其语。
哈萨克斯坦自研主权人工智能:KazLLM 正式发布
在人工智能迅速改变全球产业布局的背景下,哈萨克斯坦凭借由纳扎尔巴耶夫大学智能系统与人工智能研究所(ISSAI)研发的 ISSAI KazLLM(哈萨克语大语言模型),迈出了实现国家数字技术主权的关键一步。
该项目得到了 Astana Hub、QazCode (Beeline Kazakhstan) 以及 NU 基金会的大力支持。KazLLM 旨在改变当地此前高度依赖西方基础模型且需经过二次翻译的现状,为哈萨克斯坦及中亚地区提供本土化、高安全的底层 AI 技术支撑。
核心技术优势与参数规格
- 多语言架构设计: KazLLM 重点针对哈萨克语、俄语和英语进行了深度优化,同时扩展支持土耳其语,为未来整个突厥语系的通用 AI 基础设施奠定了基础。
- 海量本土语料库: 训练数据集包含超过 1500 亿 Token,其中 95% 的语料由 ISSAI 团队从哈萨克斯坦公共领域档案、学术文献、新闻报道和法律文本中精心筛选与标注。
- 灵活的部署规格: 提供 8B(80亿参数) 与 70B(700亿参数) 两种版本,并包含 4-bit 量化版本,既能在普通企业本地服务器上轻量化运行,也可部署于大型数据中心处理复杂任务。
- 先进的算力支撑: 模型基于 Meta 的 Llama 3.1 架构开发,并在 NVIDIA DGX H100 超级计算集群上完成训练与对齐。
推动技术独立与文化保护
KazLLM 的原生能力避免了传统模型在处理中亚低资源语言时出现的语义偏离与文化脱节问题。目前,该模型的权重文件与测试数据集已在 Hugging Face 平台向开发者及研究机构开源,为政务自动化、企业智能化及哈萨克语数字化保护提供了重要工具。