其他新闻

其他新闻

亚马逊关键词搜索排名追踪(亚马逊关键词搜索器)

时间:2023-11-09 信途科技其他新闻
作者 | 西西编辑 | 陈彩娴众所周知,算法、算力与数据是人工智能(AI)发展的“三驾马车”,吴恩达等学者也常说:以数据为中心的AI,或数据驱动的AI。由此可见,近年来激增的数据量是 AI 腾飞的源动力之一,数据在 AI 中扮演重要角色。那么,人们口中常说的“大数据”,规模究竟有多大呢?出于好奇心,一位意大利物理研究者 Luca Clissa 调查了 2021 年几个知名大数据源(谷歌搜索、Facebook、Netflix、亚马逊等等)的规模大小,并将它们与大型强子对撞机(LHC)的电子设备所检测到的数据做了对比。地址:https://arxiv.org/pdf/2202.07659.pdf毫无疑问,LHC 的数据量是惊人的,高达 40k EB。但商业公司的数据量也不容小觑,比如,亚马逊S3存储的数据量也达到了大约 500 EB,大致相当于谷歌搜索(62 PB)的 7530 倍。此外,流数据在大数据市场中也占有一席之地。Netflix 和电子通信等服务产生的流量比单纯的数据生产者要多一到两个数量级。

1LHC 的数据量根据 Luca Clissa 的调查,2021年各大知名数据源的体量大约如下:

图注:2021年的大数据规模右上角(灰色部分)是欧洲核子研究组织(CERN)大型强子对撞机(LHC)实验的电子设备所检测到的数据,规模最大。在上一次运行(2018 年)中,LHC 在四个主要实验(ATLAS、ALICE、CMS 和 LHCb)中的每一个实验里,每秒产生大约 24 亿次粒子碰撞,每次碰撞可以提供约 100 MB 数据,因此预计年产原始数据量约为 40k EB(=10亿千兆字节)。但根据目前的技术和预算,存储 40k EB 数据是不可能的。而且,实际上只有一小部分数据有意义,因此没有必要记录所有数据。记录的数据量也降低到了每天大约 1 PB,2018 年的最后一次真实数据只采集了 160 PB,模拟数据 240 PB。此外,收集的数据通过 WLCG (全球LHC计算网络)不断传输,2018 年产生了 1.9k PB 的年流量。不过,欧洲核子研究组织(CERN)正在努力加强 LHC 的能力,进行 HL-LHC 升级。这个过程预计生成的数据量将增加 5 倍以上,到 2026 年,每年估计产生 800 PB的新数据。2大厂数据量对比大公司的数据量很难追踪,且数据通常不会公开。对此,Luca Clissa 采用了费米估算法(Fermi estimation),将数据生产过程分解为其原子组成部分,并做出合理的猜测。比如,针对特定数据源,检索在给定时间窗口内产生的内容量。然后通过对这些内容的单位大小的合理猜测来推断数据总量,例如平均邮件或图片大小,1 小时视频的平均数据流量等等。他对谷歌搜索、YouTube、Facebook等等数据源进行了估算,结论如下:谷歌搜索:最近的一项分析估计,Google 搜索引擎包含 30 到 500 亿个网页。根据 Web Almanac 所提供的信息,假设谷歌的年度平均页面大小约为 2.15 MB,截至 2021 年,Google 搜索引擎的数据总规模应约为 62 PB。YouTube:根据 Backlinko 的数据,2021 年用户每天在 YouTube 上上传的视频时长为 72 万小时。假设平均大小为 1 GB(标准清晰度),2021年 YouTube 的数据大小约为 263 PB。Facebook 与 Instagram:Domo 的 Data Never Sleeps 9.0 报告估计,2021 年 Facebook 与 Instagram 每分钟上传的图片数量分别为 240k 和 65k。假设平均大小为 2 MB,则总共大约为 252 PB 和 68 PB。DropBox:虽然 Dropbox 本身不产生数据,但它提供了云存储解决方案来托管用户的内容。2020年,公司宣布新增用户 1 亿,其中付费订阅用户达到 117 万。通过推测免费和付费订阅的占用率分别为 75%(2 GB)和 25%(2 TB),Dropbox 用户在 2020 年所需的存储量约为733 PB。电子邮件:根据 Statista 的数据,从 2020 年 10 月到 2021 年 9 月,用户大约传送了近 131,000 亿次电子通信(包含 71,000 亿封电子邮件和 60,000 亿封垃圾邮件)。假设标准邮件和垃圾邮件的平均大小分别为 75 KB 和 5 KB ,我们可以估计电子邮件的总流量约为 5.7k PB。Netflix:Domo 估计,2021 年 Netflix 用户每天消耗 1.4 亿小时的流媒体播放,假设每小时 1 GB(标准定义),总计大约 51.1k PB。亚马逊:亚马逊网络服务 (AWS) 的首席布道师 Jeff Barr称,截至 2021 年,亚马逊 S3 (Simple Storage Service)中存储了超过 100 万亿个对象。假设平均每桶的对象大小为 5 MB ,那么存储在 S3 中的文件的总大小则约等于 500 EB。总的来说,科学数据可以在数量上与商业数据源相媲美。参考链接:1.https://towardsdatascience.com/how-big-are-big-data-in-2021-6dc09aff5ced2.https://firstsiteguide.com/google-search-stats/3.https://backlinko.com/4.https://mms.businesswire.com/media/20210929005835/en/911394/5/data-never-sleeps-9.0-1200px.jpg?download=15.https://backlinko.com/dropbox-users6.https://xintu.statista.com/7.https://aws.amazon.com/cn/blogs/aws/amazon-s3s-15th-birthday-it-is-still-day-1-after-5475-days-100-trillion-objects/8.https://atlas.cern/

扫描二维码推送至手机访问。

版权声明:本文由信途科技转载于网络,如有侵权联系站长删除。

转载请注明出处https://www.xintukeji.cn/xintu/56557.html

相关文章

h5一键建站(临沂h5建站)

随着互联网的发展,越来越多的企业和个人想要制作自己的H5网站。你真的了解它吗?又该如何制作呢?下面就跟大家解答一下关于h5网页的相关问题。1.H5到底是什么?通俗地讲,H5是一个网页,就像一个很大的容...

「纸业关键词排名优势」纸业的龙头企业

本文目录一览: 1、华丰纸业竞争优势有哪些呢 2、竹浆纸品牌十大排名是怎样的? 3、太阳纸业的公司优势 4、太阳纸业在行业内排名怎么样?太阳纸业东方财富股吧讨论?太阳纸业 2021分红?...

关于以下哪一个不是网络营销优势的信息

应该是多选题了吧A使用方便,省去车马劳力跑市场B信息量大,那是非常非常的大,坐在电脑前发信息,可比步兵出去跑传播的信息量大很多C争辩少,这个是必须的,因为你没。以下哪个选项不属于网络营销的特点这是一个...

济南四合一建站平台(济南模板建站平台哪家好)

我们都知道有免费的模板网站供用户使用,但是考虑到其功能是否满足我们使用的问题,很多人不想用免费的模板网站,但是对于刚起步的小企业来说,免费网站提供的功能足够使用了。 首先,先解释一下什么是免费模板...

江苏经贸 网络营销大赛的简单介绍

5月21日下午,由创新创业学院主办,大学生创业协会承办的江苏经贸第五届“互联网+”大学生创新创业大赛校内决赛暨省赛选拔赛在180创业园3D影院举。各二级院系江苏经贸第五届“互联网+”大赛自3月份发布海...

关键词优化排名合体(关键词优化排名软件选超牛百度推广软件)

周洁琼甩锅?周洁琼和徐正溪那部作品扑街了,刚刚有点小爆的徐正溪利用自己的余热都救不活这部戏…...对此周洁琼也挺懊恼的。对于这部戏的扑街,周洁琼和徐正溪两个人都不愿意承担责任,徐正溪那边认为是周洁琼演...

现在,非常期待与您的又一次邂逅

我们努力让每一次邂逅总能超越期待

  • 效果付费
    效果付费

    先出效果再付费

  • 极速交付
    极速交付

    响应速度快,有效节省客户时间

  • 1对1服务
    1对1服务

    专属客服对接咨询

  • 持续更新
    持续更新

    不断升级维护,更好服务用户