Reaching 成为 AI 产业观察信号
Reaching Across the Isles: UK-LLM Brings AI to UK Languages With NVIDIA Nemotron: Celtic languages — including Cornish, Irish, Scottish Gaelic and Welsh — are the U.K.’s oldest living languages. To empower their speakers

正文
凯尔特语系语言——包括康沃尔语、爱尔兰语、苏格兰盖尔语和威尔士语——是英国现存最古老的语言。为赋能这些语言的使用者,UK-LLM sovereign AI initiative 正在基于 NVIDIA Nemotron 构建一款 AI 模型,使其能够用英语和威尔士语进行推理。威尔士语如今约有 850,000 名使用者,主要分布在威尔士。
让 AI 在威尔士语中实现高质量推理,将有助于以该语言提供包括医疗、教育和法律资源在内的公共服务。
“我希望英国的每个角落都能利用人工智能带来的好处。通过让 AI 能够用威尔士语进行推理,我们正在确保从医疗到教育等公共服务,所有人都能以自己日常使用的语言获得这些服务,”英国首相 Keir Starmer 表示。“这是一个有力的例子,说明最新的 AI 技术——在布里斯托尔英国最先进的 AI 超级计算机上训练——如何能够服务公共利益、保护文化遗产,并为全国各地释放机遇。”
UK-LLM 项目成立于 2023 年,最初名为 BritLLM,由伦敦大学学院牵头,此前已发布两款面向英国各语言的模型。其最新的威尔士语模型由该项目与威尔士的班戈大学和 NVIDIA 合作开发,并与威尔士政府推动提升该语言实际使用率的努力相一致;该政府的目标是在 2050 年前实现 100 万使用者,这一倡议被称为 Cymraeg 2050。
总部位于英国的 AI 云服务提供商 Nscale 将通过其应用程序接口向开发者提供这款新模型。
Canolfan Bedwyr 是该大学的威尔士语服务、研究与技术中心,担任该中心语言技术部门负责人兼首席术语学家的 Gruffudd Prys 说:“我们的目标是确保威尔士语始终是一门鲜活、不断发展的语言,能够与时俱进。” “AI 在帮助学习者习得威尔士语作为第二语言方面,以及帮助母语者提升语言能力方面,都显示出巨大潜力。”
这个新模型也有望提升威尔士语资源的可访问性,使在威尔士运营的公共机构和企业能够翻译内容,或提供双语聊天机器人服务。这有助于医疗机构、教育工作者、广播机构、零售商和餐馆经营者等群体,确保他们的书面内容像英文内容一样,也能方便地以威尔士语获取。
除了威尔士语之外,UK-LLM 团队还计划将新模型采用的相同方法,应用到开发英国境内其他语言的 AI 模型上,例如康沃尔语、爱尔兰语、苏格兰语和苏格兰盖尔语;同时还将与国际合作伙伴合作,为非洲和东南亚的语言构建模型。
“与 NVIDIA 和班戈大学的这次合作,使我们能够在创纪录的时间内创建新的训练数据并训练出一个新模型,加速了我们打造有史以来最好的威尔士语语言模型的目标,”伦敦大学学院自然语言处理教授、人工智能中心副主任 Pontus Stenetorp 表示。“我们的目标是把从威尔士语模型中获得的洞见应用到其他少数语言上,无论是在英国还是全球范围内。”
这个新的威尔士语模型基于 NVIDIA Nemotron,这是一个开源模型家族,提供开放权重、数据集和 recipes。英国-LLM 开发团队采用了 490 亿参数的 Llama Nemotron Super 模型和 90 亿参数的 Nemotron Nano 模型,并用威尔士语数据对它们进行了后训练。
与英语或西班牙语等语言相比,威尔士语可用于 AI 训练的源数据要少得多。因此,为了创建足够大的威尔士语训练数据集,团队使用了 NVIDIA NIM 微服务中的 gpt-oss-120b 和 DeepSeek-R1,将包含超过 3000 万条记录的 NVIDIA Nemotron 开放数据集从英语翻译成威尔士语。
他们通过 NVIDIA DGX Cloud Lepton 平台使用了一个 GPU 集群,并且正在借助位于伊斯塔姆巴德-AI(Isambard-AI)上的数百颗 NVIDIA GH200 Grace Hopper Superchips 来加速翻译和训练工作负载;Isambard-AI 是英国最强大的超级计算机,由政府投资 2.25 亿英镑支持,部署在布里斯托大学。
这份新数据集补充了团队此前工作中已有的威尔士语数据。
位于圭内斯郡的班戈大学——该郡是威尔士语使用者占比最高的地区——正以语言和文化方面的专业支持,协助新模型的开发。
来自该大学威尔士语中心的 Prys 为这项合作带来了近二十年的威尔士语语言技术经验。他和团队正在协助核实机器翻译训练数据和人工翻译评估数据的准确性,并评估该模型如何处理 AI 通常难以把握的威尔士语细微差别——例如威尔士语单词开头的辅音会根据相邻单词而发生变化的现象。
该模型以及威尔士语训练和评估数据集,预计将向企业和公共部门开放使用,支持进一步研究、模型训练和应用开发。
“有 AI 能力以威尔士语存在是一回事,但让它对所有人开放并且可访问则是另一回事,”Prys 说。“这种微妙的区别,可能就是这项技术最终被使用与否的分水岭。”
用于开发 UK-LLM 威尔士语模型的框架,可以作为全球多语言 AI 开发的基础。
顶尖的 Nemotron 模型、数据和配方已向开发者公开,便于构建几乎适用于任何语言、领域和工作流的推理模型。作为 NVIDIA NIM 微服务打包提供后,Nemotron 模型针对高性价比算力进行了优化,可在从笔记本电脑到云端的任何环境中运行。
欧洲企业将能够在由 Perplexity AI 驱动的搜索引擎上运行开放、主权模型。
立即开始使用 NVIDIA Nemotron。
这款新模型由伦敦大学学院、NVIDIA 和班戈大学联合开发,并在 Isambard-AI 超级计算机上完成训练。它利用 NVIDIA Nemotron 的开源技术和数据集,为威尔士语及英国其他语言的人工智能推理能力提供支持,面向包括医疗、教育和法律资源在内的公共服务。
凯尔特语系语言——包括康沃尔语、爱尔兰语、苏格兰盖尔语和威尔士语——是英国现存最古老的活语言。为赋能其使用者,英国主权 AI 计划 UK-LLM 正在构建一个基于 NVIDIA Nemotron 的 AI 模型,该模型不仅能用英语进行推理,也能用威尔士语进行推理;威尔士语如今在威尔士约有 85 万人使用。
让威尔士语具备高质量的 AI 推理能力,将有助于以该语言提供包括医疗、教育和法律资源在内的公共服务。
“我希望英国各地都能充分利用人工智能的好处。通过让人工智能能够用威尔士语进行推理,我们确保公共服务——从医疗到教育——都能以人们生活所在的语言向所有人开放,”英国首相 Keir Starmer 说。“这有力地说明了,经过训练的最新技术,借助英国在布里斯托最先进的人工智能超级计算机,如何能够服务公共福祉、保护文化遗产,并在全国各地释放机会。”
UK-LLM 项目于 2023 年以 BritLLM 之名成立,由 University College London 牵头,此前已发布两款面向英国各语言的模型。其面向威尔士语的新模型由 Bangor University Wales 与 NVIDIA 合作开发,与威尔士政府推动语言实际使用的努力相呼应,目标是到 2050 年实现 100 万名使用者——这项倡议名为 Cymraeg 2050。
英国人工智能云服务提供商 Nscale 将通过其应用程序编程接口(API)向开发者提供这款新模型。
“目标是确保威尔士语继续作为一门鲜活、不断呼吸、并随时代持续发展的语言存在,”贝德维尔中心(Canolfan Bedwyr)语言技术单元高级术语学家兼负责人 Gruffudd Prys 表示。该中心是该大学面向威尔士语服务、研究和技术的机构。“人工智能在帮助把威尔士语作为第二语言习得方面展现出巨大潜力,同时也能帮助母语者提升语言能力。”
这款新模型还可能通过帮助在威尔士运营的公共机构和企业翻译内容,或提供双语聊天机器人服务,从而提升威尔士语资源的可访问性。这有助于医疗服务提供者、教育工作者、广播机构、零售商和餐馆经营者等群体,确保其书面内容像英文一样,能够同样便捷地以威尔士语获取。
除了威尔士语之外,UK-LLM 团队还希望将用于其新模型的同一方法推广到英国境内其他地区使用的语言,如康沃尔语、爱尔兰语、苏格兰盖尔语和苏格兰语;同时也会与国际合作伙伴协作,为非洲和东南亚的语言构建模型。
“与 NVIDIA 和班戈大学的这次合作,使我们能够在创纪录的时间内创建新的训练数据并训练出一个新模型,加速了我们打造有史以来最好的威尔士语语言模型这一目标,”伦敦大学学院自然语言处理教授、人工智能中心副主任 Pontus Stenetorp 说。“我们的目标是把从威尔士语模型中获得的洞见应用到其他少数语言上,无论是在英国还是全球各地。”
这款新的威尔士语模型基于 NVIDIA Nemotron,这是一套开源模型家族,包含权重、数据集和开放配方。DU-LLM 开发团队利用了 490 亿参数的 Llama Nemotron Super 和 90 亿参数的 Nemotron Nano,并在威尔士语数据上对它们进行了后训练。
与英语或西班牙语等语言相比,可用于人工智能训练的威尔士语源数据要少得多。因此,为了构建足够大的威尔士语训练数据集,团队使用了 NVIDIA NIM 微服务中的 gpt-oss-120b 和 DeepSeek-R1,将 NVIDIA 的开放数据集中的 3000 多万条记录从英语翻译成威尔士语。
他们通过 NVIDIA DGX Cloud Lepton 平台使用 GPU 集群,并调用 Isambard-AI 上的数百颗 NVIDIA GH200 Grace Hopper 超级芯片——这台超算是英国最强大的超级计算机,获得了政府 2.25 亿英镑投资支持,位于布里斯托大学——来加速其翻译和训练工作负载。
这个新数据集是对团队此前努力积累的威尔士语数据的补充。
位于圭内斯郡的班戈大学——该郡拥有最高比例的威尔士语使用者——正以语言和文化方面的专业知识支持这一新模型的开发。
来自大学威尔士语中心的 Prys 为这项合作带来了近二十年的威尔士语语言技术经验。他和团队协助核验机器翻译生成的训练数据以及人工翻译的评估数据是否准确,并评估模型如何处理 AI 通常难以应对的威尔士语细微差别——例如威尔士语词首辅音会根据相邻词而发生变化的现象。
预计该模型,以及威尔士语的训练和评估数据集,将向企业和公共部门开放使用,以支持进一步研究、模型训练和应用开发。
“让这种人工智能能力以威尔士语存在是一回事,但让它开放并让所有人都能访问又是另一回事,”Prys 说道。“这种微妙的差别,可能就是这项技术最终会不会被采用的分界线。”
用于为威尔士语开发 DU-LLM 模型的框架,也可以成为全球多语言人工智能开发的基础。
Nemotron 的模型、数据和配方都已开源给开发者,让他们能够构建几乎适用于任何语言、领域和工作流的定制推理模型。作为 NVIDIA NIM 微服务打包后,Nemotron 模型针对高性价比计算进行了优化,可在从笔记本到云端的任何环境中运行。
欧洲企业将能够在由 AI 驱动的 Perplexity 搜索引擎上运行开放、主权模型。
让我们从 NVIDIA Nemotron 开始。
AI解读
这是一条雷达解读:它可能反映 AI 产品、开发者工具、模型基础设施或研究方向的新变化。
对开发者来说,可以作为后续选题、产品观察或技术调研的线索。
建议打开原文核对细节,并观察是否有同类信号在其他来源重复出现。