欢迎您访问欢迎来到沄森网,沄森智能旗下资讯平台!今天是:2026年08月04日 星期二 农历:丙午(马)年-六月-廿二
您现在的位置是:首页 > 热点

贵州语料平台上架118套高质量数据集 构建多层次语料资源体系

创始人2026-08-04 21:02:42
贵州省大数据发展管理局近日公布,贵州数据集服务平台已上架118个高质量数据集,总数据规模突破700TB,吸引了240余家生态伙伴入驻共建,形成了覆盖多领域、多模态的多层次语料资源体系

贵州省大数据发展管理局近日公布,贵州数据集服务平台已上架118个高质量数据集,总数据规模突破700TB,吸引了240余家生态伙伴入驻共建,形成了覆盖多领域、多模态的多层次语料资源体系。该平台由贵州省大数据发展管理局指导,贵州大数据集团建设运营,定位为“语料超市、语料加工厂、语料生态枢纽”,旨在一站式补齐人工智能产业高质量数据供给短板,为全国大模型训练和行业AI应用提供合规、可溯源的数据支撑。

贵州语料平台上架118套高质量数据集

当前AI产业普遍存在供需痛点:持有原始数据的机构缺乏标准化加工和合规流通渠道,而研发行业大模型的企业和科研院所则面临优质语料难以获取的问题。该平台打通了从数据资源到AI落地的全链条,提供包括资源汇聚、数据治理、多模态标注、合规审查、交易交付、模型微调及应用孵化等全流程服务,推动贵州从“数据仓库”向“数据工厂”转型。

贵州语料平台上架118套高质量数据集 构建多层次语料资源体系

平台依托贵州山地、民族、产业的独特禀赋,搭建了公共、产业、科研三大数据矩阵,覆盖十余个核心赛道。政务板块汇集了521万条民生热线知识库和千万级城市运行事件数据;少数民族语种板块储备了苗、布依、侗、水等稀缺双语平行语料;山地气象拥有超9TB喀斯特卫星遥感数据;智慧“三农”集成29万张农作物标注图像;医疗板块提供脱敏临床病历和5TB医学影像;司法领域储备了2000万份裁判文书。此外,平台还提供智能工业、文化教育、智慧交通以及月球科学、人口迁徙等特色稀缺数据集。数据形态涵盖文本、表格、图像、音频、视频和多模态融合六大门类,适配预训练、微调、计算机视觉、语音识别等各类研发场景。

所有文章未经授权禁止转载、摘编、复制或建立镜像,违规转载法律必究。

举报邮箱:1002263188@qq.com