国内多数模型训练使用的中文数据占比超60%
发布时间 - 2026-09-19 18:53:39 点击率:次
原标题:国内多数模型训练使用的中文数据占比超60% 记者从国家数据局获悉,中文数据在国内大模型的训练性能提升方面发挥着重要作用。国内多数模型训练使用的中文数据占比已经超过60%,有的模型达到80%。中文高质量数据的开发和供给能力持续增强,推动我国人工智能模型性能快速提升。 在人工智能时代,Token(通常所说的“词元”)是处理文本的最小数据单元。国家数据局局长刘烈宏介绍,2024年初,我国日均Token的消耗量为1000亿,截至今年6月底,日均Token消耗量已经突破30万亿,1年半时间增长了300多倍,反映了我国人工智能应用规模的快速增长。(王云杉)
上一篇:织密织牢种粮增收的政策“保护网”
下一篇:卢拉祝贺中国车企巴西工厂投产
最新文章
济南最大多式联运铁路物流园开通运营
特写:送菜人的“空菜盘”
王新彪:“我是党员,我不去谁去?”
各地区各部门保障生产加强监管 同心协力守
湖南一家5人确诊,因为聚集!敲警钟:别乱
我国华东地区最长高铁隧道首段贯通
2020年度张家界全市招商引资工作会议召
浙江金华中亚班列年开行数首次达百列
海南公开宣判两起毒品案件 主犯一审均被判
冬季室内外温差大 专家提示突发心梗应牢记
多措并举抓扶贫 江西古县渡镇用真情干出真
沈阳师范大学举行2020届毕业生大型就业
赣皖两地干旱蔓延 干部群众多举措抗旱“解
云冠 云蜜 云栗 云腿 4个南瓜新品种通
四川丹棱设“信访说事室”让村民放心说事
26卷本《莫言作品典藏大系》在京发布
铿锵木兰 初心不改——86岁老党员马旭节
南洞庭湖全面清理“湿地杀手”欧美黑杨萌芽
细胞还存在另一套“攻防系统” 曹雪涛等首
2019年全国青少年校园足球夏令营在哈尔
上一篇:织密织牢种粮增收的政策“保护网”
下一篇:卢拉祝贺中国车企巴西工厂投产

