Hadoop创始人Doug Cutting谈未来大数据的技术

Author Tanmer Tanmer
Tanmer · 2024-10-18发布 · 706 次浏览

在Doug Cutting十年前创建Hadoop架构的时候,他从未想过这会为企业界带来如此超大规模的计算。“毫无疑问,我当初预想的情况比我们现在所看到的要...

       Cloudera首席架构师就内存及云计算相关技术发表讨论,Hadoop将如何在大数据方面发挥更大价值。
       在Doug Cutting十年前创建Hadoop架构的时候,他从未想过这会为企业界带来如此超大规模的计算。“毫无疑问,我当初预想的情况比我们现在所看到的要稍微保守一些。“他在近期伦敦的Strata+Hadoop World大会上说。
       在今天,Hadoop被很多家喻户晓的名字使用,它帮助Facebook分析其每月超过16亿的用户流量,帮助VISA发现了数十亿美元的金融欺诈。
       Hadoop的吸引力在于,它使大数据处理更便宜,从某些方面来说,更加简单。这个平台提供了一系列技术,允许大型数据集分布在商业服务器的大型集群中,对数据进行并行处理。
       然而该平台还有一定的局限性。如今,Hadoop集群能处理大型数据集的速度受到二级存储(SSD或更慢的旋转磁盘)与计算机内存及CPU之间的数据传递率的限制。这种输入/输出(I/O)瓶颈的发生,是因为处理器速度和效率的增长要快于存储读写速度。
       内存中的PB数据
       但是现在的存储技术将经历一次重大变革,对此Doug Cutting表示这将有利于释放大数据处理的潜力。
       今年,Intel计划发布其3D XPoint存储芯片,可以比通常用于SSD中的NAND闪存快1000倍的速度来检索数据,同时也能以超过现今常用的内存类型DRAM 十倍的密度存储数据。
       Xpoint将在一开始以Optane品牌SSD的形式提供存储,而Intel也计划推出XPoint内存模块以便跟进。由于Xpoint以比传统DRAM有更高的密度来存储数据,这些模块将会使服务器具备远远大于现今标准的内存空间。Intel将在明年推出Intel Xeon服务器,含6TB内存,由DDR4 DRAM和Xpoint结合组成。也就是说,Xpoint在性能上并不会与DDR4 DRAM相匹配。预发行的Xpoint SSD有七微秒延迟以及78,000读/写IOPS,要慢于DRAM,并且据估计比高性能SSD快不到20倍。
       Doug Cutting预测,尽管如此,Xpoint的使用以及Hadoop集群的其他非挥发性内存将会使Hadoop平台面向更多新的用例,允许用户在内存中处理更大的数据集,这样也可以分流从磁盘获取数据的过程中的延迟。
      “如果内存中有1PB的数据,并且可以从循环中的任一节点访问这些数据,如果是用于各种算法的,这就会是跨越几个级别的性能提升。”Doug Cutting如此说道,他目前是Cloudera的首席架构师,Cloudera提供自有版本的Hadoop,即非常流行的CDH。
      “图像运算等等各种五花八门的迭代机器学习算法、集群等这些在传统上意义上花费了很长时间、非常昂贵的事物,现在都能基于大量的数据快速实现。
      “过大的数据集以及太慢的计算依然存在,但我认为现在已经有了很大的改变。“Doug Cutting补充说道,远程直接管理访问及千兆以太网交换也能减少与网络流量有关的延迟。
       2014年,Intel对Cloudera进行了大约7.4亿美元的投资。作为双方合作的一部分,Intel会告知Cloudera其在研发安排中新的特性和硬件,确保Cloudera的Hadoop版本能够充分利用这些新技术。
       “对于在内存中访问数据架构方面,我们非常努力的令CPU使用达到最小。”Doug Cutting说道,并指出Cloudera尽量防止不必要的操作,这些操作会引起CPU成为内存数据处理的瓶颈。
       Hadoop和云计算
       Doug Cutting也希望简化Hadoop集群在云计算中的部署,让更广泛的人群能够使用Hadoop。在各种云平台上构建Hadoop集群已经成为可能。举例来说,运行CDH(Cloudera的Hadoop发行版),就可以使用Cloudera Director来部署AWS和Google云平台上的虚拟服务器集群。
       然而,Doug Cutting也说到,如何使处理进程变的更为简单,仍然有很多限制需要解决,而Cloudera也在计划改进从AWS S3及其他云存储向Hadoop数据处理引擎中输入数据的支持。
      “我们需要对Hadoop做一些调整,使其能够更好地适应云计算。我们需要重视像亚马逊S3这样的存储,配合HDFS(Hadoop分布式文件系统)来进行输入输出,这样人们就可以动态地部署集群。”他说。
       在云计算环境中,集群更有可能被启动和关闭,Cloudera还要改进缩短启动时间。
       另一个需要解决的问题,在于简化Hadoop在不同云平台之间的迁移,Doug Cutting对现阶段的云平台锁定表示失望。
     “我们应该让人们在云供应商之间能够实现转移,这在我们看来是非常有价值的。现在,如果你开始是在某云平台上开发的应用,那么很快就被锁定在这个云平台上了。”
       Doug Cutting表示,在CDH上,Cloudera正在构建“一个软件层,可以决定工作负载是运行在本地,还是放到亚马逊、谷歌、微软或其他云供应商上”。
       今天,这一功能在某种程度上来说可通过Cloudera Director实现,他说,“这正是我们要继续推进并使其更加无缝”。
       Doug Cutting相信,最终,Hadoop的传承将会扮演重要角色,让大数据成为常态、让开源成为软件的标准选择,让关系型数据库逐渐成为小众市场。
 
       “我们将不会再讨论大数据,而是探讨数据系统。开源架构将不再是新鲜事物,它将成为主流。关系型系统将基本等同于Cobol语言,而成为历史。我们在十年的时间中向前迈出了一大步。“
 
提交反馈

博客 博客

专注数字内容治理,助力数字体验升级

信息管理与知识管理的区别:企业为何需要两者兼顾

信息管理与知识管理的区别:企业为何需要两者兼顾

信息管理与知识管理常被混为一谈,实则差异显著。本文通过生活案例引入,从导向性、知识类型、可复制性、技术与人本侧重、衡量指标五个维度剖析两者区别,并说明企业为何需要将二者结合,以Baklib为例展示如何落地知识管理。

Author information-management-vs-knowledge-management
By Lisa
发布:2026-06-29
组织信息孤岛:利与弊的平衡艺术

组织信息孤岛:利与弊的平衡艺术

组织孤岛既带来专业化与问责优势,也可能造成沟通断裂与效率下降。本文解析孤岛的利弊两面,并介绍以 Baklib 为代表的知识管理方案,帮助企业实现平衡管理。

Author organizational-silos-balancing-act
By Lisa
发布:2026-06-29
知识中心支持 KCS :知识驱动客户成功

知识中心支持 KCS :知识驱动客户成功

知识中心支持(KCS)是以知识为核心资产的客户服务方法论,通过持续捕获、组织、复用、改进知识,帮助团队更快解决客户问题,降本增效,提升客户满意度。

Author knowledge-centered-support
By Lisa
发布:2026-06-18
如何打破信息孤岛以及这样做的好处

如何打破信息孤岛以及这样做的好处

信息孤岛会降低企业效率、造成重复劳动。本文介绍信息孤岛的成因、早期信号,并分享打破孤岛的实用方法:如5W1H分析、共享公司愿景、团队协作、培训、知识库(如Baklib)等。打破孤岛能提升生产力、协作能力和投资回报率。

Author break-down-information-silos-benefits
By Lisa
发布:2026-06-11
最全TOP 50 大模型 AI 知识库软件厂商排名汇总

最全TOP 50 大模型 AI 知识库软件厂商排名汇总

编者按:千行百业都在上大模型上 AI;同时我们也发现大模型+知识库是企业落地 AI 的最佳路径。所以我们通过汇总收集大模型+知识库的软件厂商,方便用户一窥究竟。内容持续更新中,排名不分先后~

Author top50
By 巴克励步
发布:2026-06-02
Baklib|为什么企业需要API驱动战略

Baklib|为什么企业需要API驱动战略

现代交易涉及35个系统组件,API成为连接关键。企业采用API驱动战略可降低开发成本、缩短上市时间、优化数字体验。本文解析API定义、商业价值及实施路径,助力企业赢在API经济时代。

Author api-driven-strategy-business
By Lisa
发布:2026-05-09
2026 年每个团队都需了解的 AI 文档的发展趋势

2026 年每个团队都需了解的 AI 文档的发展趋势

2026年AI文档将从静态转向自适应系统,包括MCP实时同步、多智能体协作、多模态内容、行业专用模型和集中治理。团队需防范AI幻觉、保持人工审核、管控文化差异,打好基础后再逐步引入新能力。

Author ai-documentation-trends-2026
By Lisa
发布:2026-05-08
AI时代,信任架构管理的复杂性

AI时代,信任架构管理的复杂性

AI时代,信任成为企业核心竞争力。真正的挑战不是技术老旧,而是系统复杂。AI会放大现有问题,信任必须从设计阶段融入架构。通过Baklib帮助企业打通数据、体验与治理,构建可信数字环境。

Author trust-architecture-ai-complexity
By Lisa
发布:2026-04-27