站内关键词搜索入口

AI大模型训练难?全国性语料创新生态联盟启动,解决科技高质量数据

在9月29号这一天, 北京举办了一场很重要的会议, 这场会议把来自全国的五十家不同的单位聚集到了一起, 让大家都参与到同一件事中去, 这件事具体指的就是给人工智能提供质量好的高质量数据内容供其学习使用, 这个情况发生在国内科技语料领域里面, 是前所未有第一次出现这种全国范围内建立统一联盟的做法。

中科院牵头拉的全员局

发起方是中科院文献情报中心

在9月29日这一天, 语料创新生态联盟启动会是在北京这个地方召开了。这个会是由中国科学院文献情报中心发起的, 并且是依托了中国科学院以及全国范围内科研和产业方面的优势力量。说得更直白一点就是, 中国科学院把自己的资源作为基础平台拉出了一批合作伙伴, 联合了50家单位一起开展行动。

从国家实验室到AI公司全覆盖

首批的50家共建单位, 它们涵盖了国家实验室、科研院所、国家级科学数据机构、地方政府, 还包括了人工智能领域的骨干企业, 以及数据基建方面的骨干企业, 还有出版与知识服务领域的骨干企业。从生产到使用这一条链条, 全都给通顺了, 这就不是哪一个部门在里面单打独斗了。

50家名单里藏着什么信号

科研端和数据端都坐进来了

这50家单位并不是纯粹的学术圈子, 同时地方政府也出现在了名单之中, 这说明当地的科技产业布局已经被牵扯进来了。谁负责出资、谁提供数据、谁去进行应用开发, 这些角色的分工是比较清晰的, 并不是简单地挂一个名字就结束了。

产业端重点盯住AI和数据基建

人工智能领域的相关公司、数据基础设施的构建企业还有出版机构, 这些单位全都包含在其中了。所打通的是这样一条完整的产业链条, 这条链条是从语料供给开始经过技术研发再到模型训练最后到达行业应用的整个环节。

需要特别关注到的是在这一轮变革里把“料”和“用”这两个部分揉合在了一起, 在以前的时候这些环节其实是各自为战互不干涉的。

模型再聪明也得靠好料

卢方军把话说明白了

AI大模型训练难?全国性语料创新生态联盟启动,解决科技高质量数据(图1)

中国科学院科技基础能力局的局长卢方军表示, 科技语料是把原始科研资源和AI模型连接在一起的东西, 它构成了支撑模型训练以及科学推理的重要基础部分, 所以建设高质量科技语料已经是发展科学智能的基础性工作之一。

用大家能听懂的大白话来说就是, AI模型的设计就算再怎么花里胡哨也显得多余, 要是没有足够好的数据去喂给它进行训练那也是完全没用的, 照样发挥不了应有的价值。

国内AI卡在"料"上

通用大模型在一般情况下的表现确实相当不错, 不过当涉及到科学推理以及相关专业知识领域的时候, 数据的质量就直接决定了最终的效率上限。

目前来看, 行业所缺乏的并不是算法本身, 而是那些高质量的、并且具备完整体系特征的、以及可以进行重复使用的科技语料数据。针对上述数据缺口应该由谁来进行填补的问题, 此次成立联盟的目标就是为了解决这一核心事项。

42条规矩一次定完

五类42项标准管的是怎么喂

在本次会议中, 集中发布了涵盖语料建设、工具平台、业务流程以及运营管理这五个方面共计42个项目的科技创新语料标准, 这意味着过去各机构在格式上缺乏统一性且存在标准冲突的问题得到了解决, 如今通过共同确立这42项标准, 就像是为输入数据的处理工作立下了一体化的规范, 要求各方均不得再自行制定所谓的私有化格式规定。

敖仓平台和国际期刊同步上线

本次大会上正式发布了名为敖仓语料社区服务平台的产品, 该平台的功能是支持众多不同的主体能够以非常便捷的方式去提供语料、工具以及知识方面的内容。

与此同时, 国际期刊Data in AI也就是《人工智能语料研究》这本刊物宣布了创刊的消息。这个平台的定位主要是负责国内的协同工作, 而该国际期刊的定位则是主要负责国际方面的交流活动, 这两种方式是并行发展的两条腿共同推进相关事务。

孙凝晖那句话说得透

院士把定位讲明白了

AI大模型训练难?全国性语料创新生态联盟启动,解决科技高质量数据(图2)

联盟发起人是中国工程院院士孙凝晖, 他说这个联盟要推动科技语料资源和加工能力的基础设施化模式, 要建立国家级的高质量科技语料的战略保障基地, 还要建智能就绪语料集成服务的协同枢纽。

把他这句翻译成大白话就是别把它当成一次性项目去做, 要把他当成像公路、电网那样的基础设施来建设, 要做好长期维护工作, 并且要实现持续不断的供给。

曲建升把拼图补完整了

中国科学院文献情报中心主任,此人乃是曲建升。他提出一个观点, 语料库负责夯实数据的基础, 社区平台致力于推动多元主体的共同建设, 国际期刊则紧抓前沿领域的传播力。

这三样事物聚合在一起, 唯有如此, 才能支撑起一个具有开放性与协同特性的科技语料生态圈。其最终目的, 是为科学智能的发展提供强大的支撑与赋能作用。

50家能不能真跑起来

联盟最怕挂牌不干活

名单已经出来了, 标准也已经发布了, 平台也上线了, 看着情况好像是挺齐全的。但是大家最害怕的就是在挂牌之后, 每个人或者每个单位都各行其事, 互不相干。接下来的工作当中, 必须盯着语料贡献量、平台活跃度以及标准执行率这几个非常硬的指标, 仅仅拥有框架是没用的。

一个问题留给你

如果在五十家机构之中, 你认识的某一家机构开始往平台上提交语料数据了, 你认为哪一类人工智能应用将会最先获得好处, 请在评论区域交流一下看法, 顺手点赞转发给关心人工智能方面的朋友。

更多精彩文章请关注=>金色港湾资讯网 www.fzjsgw.com

分享更多
赞
0

同栏推荐

跨栏推荐

跨栏精选