穿越:2014

猪熊

首页 >> 穿越:2014 >> 穿越:2014全文阅读(目录)
大家在看 全球高武 我的1979 饲养全人类 万族之劫 信息全知者 重生之财源滚滚 高考以后,我才重生 重塑千禧年代 渔人传说 我家老婆来自一千年前 
穿越:2014 猪熊 - 穿越:2014全文阅读 - 穿越:2014txt下载 - 穿越:2014最新章节 - 好看的都市生活小说

第348章 巨额的隐形财富(续)

上一章 目 录 下一章 阅读记录

之所以说不夸张有两方面的原因:

一、即便是在前世,数据标注也是在对偶学习之类的特殊学习技巧问世后成本才大幅下降。

而在此之前,涉及到数据标注从来就跟“便宜”两个字不沾边。

同样拿此前林灰所列出的例子作为援引:

在前世2017年1000万条双语互译标注的成本约为2200万美元;

注意这仅仅是双语互译的标注。

“双语互译”只是某两种语言之间的互译标注。

只是两种语言之间的互译标注就需要两千多万美元?

那涉及到上百种语言的互译需要多少钱呢?

这个问题并不复杂,简单的排列组合问题:

C(100,2)== 4950; 4950*0.22亿美元==1089亿美元;

不难看出若需支持上百种语言的互译,人工标注训练集的成本将达到上千亿美元。

而这仅仅是理想情况下的估算,如果真要按部就班进行这样的标注实际成本远不止于此。

毕竟很多小语种之间的互译成本显然相比于主流语言之间的互译价格还要更高。

虽然实际操作中不会真的有大怨种按部就班进行上百种语言互译的数据标注。

但这个估算也充分说明了数据标注在相当长的一段时间内都很昂贵。

同样的道理,在现在这个时空数据标注方面的成本也依然是昂贵的。

而且因为这个时空机器学习方面研究进展的滞后,现在涉及到数据标注这方面的成本甚至还要高于前世同一时期的。

二、时代是在飞速发展的,要知道现在随便一个文体店就能很方便买到的科学计算器其实际效率、可靠程度、易用性甚至可以全方位吊打上个世纪五六十年代花费上千万美元搞出来的占地几百甚至是上千平方米的计算机。

这种情况下后世很便宜的计算器拿到几十年前纵然是要价上百万美元同样是有市场的,而且可能还会相当有竞争力。

举这个例子并不是说林灰要再往前几十年去卖计算器。

林灰只是想藉此说明时代的车轮是向前的,科技也是在飞快发展的。

尤其是在中后互联网时代,科技的发展说是日新月异也丝毫不为过。

在这种情况下,往后几年一些不怎么被人过分重视的技术在几年前能够换取大额的财富是很正常的。

更何况还是利用数据标注这个相当长一段历史时期内都只能是土豪公司才玩得转的东西去换取财富?

总之,林灰没觉得“在现在1000万条双语标注数据怎么着也得要个两三亿美元”这个估算的有什么问题。

甚至于,即便是“两三亿美元的价格”给旁人一种很夸张的感觉。

但实际上林灰这个价格估算的可能还有点保守。

在人工智能的产业结构中,主体包含有应用层、技术层和基础层。

应用层包含有解决方案和产品服务。

技术层包含有应用技术、算法理论和平台框架。

而基础层则包含有基础设施和数据。

从这个角度来衡量的话,某种程度上甚至可以将数据是人工智能的基石。

事实也正是如此。

涉及到人工智能的三驾马车算法、算力、算据(数据)。

算法看起来很重要,但要知道很多时候,没有优质数据存在,就很难训练出优质的算法。

数据这东西虽然通常情况下看不见摸不着,但任谁也不能忽视数据的重要性。

尤其是标注数据更是相当重要。

在时下有监督的机器学习仍然是当前神经网路学习训练的主要方式。

而有监督的机器学习是离不开标注数据的。

有监督的机器学习需要被标注数据作为先验经验。

在有监督的机器学习里未被标注的数据和被标注数据以比例划分为训练集和测试集。

机器通过对训练集的学习得到一个模型,再对测试集进行识别,就可以到的该模型的准确率。

算法人员根据测试结果找到模型的短板,并将数据问题反馈给数据标注人员,再重复流程,直到得到的模型指标符合上线需求……

在时下几乎没啥无监督学习的应用的情况下,大规模、高质量的人工标注数据集甚至可以说是现在机器学习产业发展的刚需。

在这种情况下,把数据以及标注数据看得再重要也不为过。

因此才有了林灰所谓的估值估低了的说法。

不过所谓的估值也不重要了,真涉及到标注数据的出售的话具体价格完全可以慢慢谈。

林灰是需要很多钱,但如果是将来同一些超级巨头进行谈判的话,林灰也未必一心要钱。

用林灰感兴趣的资源进行交换也不是不可以。

说实话这些顶尖巨头的部分资源对林灰还是相当有诱惑力的。

具体到林灰现在所拥有的标注数据。

曾经涉及到网文翻译的时候,林灰当初几乎是第一时间想到了前世那部手机里SimpleT这个软件。

SimpleT这个软件是前世林灰所在公司开发测试的一款软件。

这个软件不怎么为人所知是因为该软件还处于a内测阶段。

a测试的目的是评价软件产品的功能、局域化、可用性、可靠性、性能和支持。

尤其注重产品的界面和特色。

a测试的时间可以从软件产品编码结束之时开始。

也可以在模块(子系统)测试完成之后开始。

还可以在确认测试过程中产品达到一定的稳定和可靠程度之后再开始。

SimpleT这款软件的a内测就是在确认SimpleT达到一定的稳定和可靠程度之后才开始的。

所以说虽然SimpleT尚在内测。

但这款软件的技术水平也是相当成熟了,几乎离正式面世只差一轮公测。

林灰原本想过待时机合适将这样一个软件复刻出来去进军软件翻译市场的。

在留心到标注数据所拥有的特殊价值的情况下。

林灰同样差不多是第一时间想到了SimpleT这一软件。

毕竟作为一个主打AI翻译的软件,其训练过程中自然是同样用到大量的双语互译标注数据的。

而SimpleT这款未正式上市的软件作为前世公司寄予厚望的产品之一。

对这款软件在实际开发中所用到的标注数据林灰相信肯定能在前世企业数据里翻找到的。

这种情况下似乎现在直接拿曾经公司在调教SimpleT这款软件所用到的标注数据去换钱岂不是事半功倍?

喜欢穿越:2014请大家收藏:(m.shaonianshuwu.com)穿越:2014少年书屋更新速度全网最快。

上一章 目 录 下一章 存书签
站内强推 遮天 吞噬星空 诡秘之主 大道争锋 轮回乐园 大奉打更人 天启预报 全球高武 蛊真人 完美世界 超神机械师 唐砖 惊悚乐园 绍宋 谍影风云 诸天投影 无敌剑域 精灵掌门人 修仙狂徒 全职高手 
经典收藏 我的艺人天天想退出娱乐圈 无奈闯入娱乐圈 在太平间当保安的日子 和明星老婆离婚之后 娱乐之天皇 娱乐:演员的自我修养 全球娱乐公敌 娱乐哈哈哈哈哈 大王饶命 一开始,我只想做演员 我的娱乐那个圈 全球高武 国产球王的娱乐圈二三事 从现在开始拍电影 明星养成系统 妖孽至尊兵王 我女儿想当明星怎么办 中国龙组2 全球修行纪元 在地球修仙 
最近更新 全球高武 我的1979 饲养全人类 腾飞我的航空时代 万族之劫 修真聊天群 俗人回档 信息全知者 重生之财源滚滚 老衲要还俗 高考以后,我才重生 重生工业帝国 重塑千禧年代 渔人传说 我家老婆来自一千年前 穿越八年才出道 华娱1997 华娱从1980开始 出名太快怎么办 大医凌然 
穿越:2014 猪熊 - 穿越:2014txt下载 - 穿越:2014最新章节 - 穿越:2014全文阅读 - 好看的都市生活小说