Hadoop创始人Doug Cutting谈未来大数据的技术

Author Tanmer Tanmer
Tanmer · 2024-10-18发布 · 646 次浏览

在Doug Cutting十年前创建Hadoop架构的时候,他从未想过这会为企业界带来如此超大规模的计算。“毫无疑问,我当初预想的情况比我们现在所看到的要...

       Cloudera首席架构师就内存及云计算相关技术发表讨论,Hadoop将如何在大数据方面发挥更大价值。
       在Doug Cutting十年前创建Hadoop架构的时候,他从未想过这会为企业界带来如此超大规模的计算。“毫无疑问,我当初预想的情况比我们现在所看到的要稍微保守一些。“他在近期伦敦的Strata+Hadoop World大会上说。
       在今天,Hadoop被很多家喻户晓的名字使用,它帮助Facebook分析其每月超过16亿的用户流量,帮助VISA发现了数十亿美元的金融欺诈。
       Hadoop的吸引力在于,它使大数据处理更便宜,从某些方面来说,更加简单。这个平台提供了一系列技术,允许大型数据集分布在商业服务器的大型集群中,对数据进行并行处理。
       然而该平台还有一定的局限性。如今,Hadoop集群能处理大型数据集的速度受到二级存储(SSD或更慢的旋转磁盘)与计算机内存及CPU之间的数据传递率的限制。这种输入/输出(I/O)瓶颈的发生,是因为处理器速度和效率的增长要快于存储读写速度。
       内存中的PB数据
       但是现在的存储技术将经历一次重大变革,对此Doug Cutting表示这将有利于释放大数据处理的潜力。
       今年,Intel计划发布其3D XPoint存储芯片,可以比通常用于SSD中的NAND闪存快1000倍的速度来检索数据,同时也能以超过现今常用的内存类型DRAM 十倍的密度存储数据。
       Xpoint将在一开始以Optane品牌SSD的形式提供存储,而Intel也计划推出XPoint内存模块以便跟进。由于Xpoint以比传统DRAM有更高的密度来存储数据,这些模块将会使服务器具备远远大于现今标准的内存空间。Intel将在明年推出Intel Xeon服务器,含6TB内存,由DDR4 DRAM和Xpoint结合组成。也就是说,Xpoint在性能上并不会与DDR4 DRAM相匹配。预发行的Xpoint SSD有七微秒延迟以及78,000读/写IOPS,要慢于DRAM,并且据估计比高性能SSD快不到20倍。
       Doug Cutting预测,尽管如此,Xpoint的使用以及Hadoop集群的其他非挥发性内存将会使Hadoop平台面向更多新的用例,允许用户在内存中处理更大的数据集,这样也可以分流从磁盘获取数据的过程中的延迟。
      “如果内存中有1PB的数据,并且可以从循环中的任一节点访问这些数据,如果是用于各种算法的,这就会是跨越几个级别的性能提升。”Doug Cutting如此说道,他目前是Cloudera的首席架构师,Cloudera提供自有版本的Hadoop,即非常流行的CDH。
      “图像运算等等各种五花八门的迭代机器学习算法、集群等这些在传统上意义上花费了很长时间、非常昂贵的事物,现在都能基于大量的数据快速实现。
      “过大的数据集以及太慢的计算依然存在,但我认为现在已经有了很大的改变。“Doug Cutting补充说道,远程直接管理访问及千兆以太网交换也能减少与网络流量有关的延迟。
       2014年,Intel对Cloudera进行了大约7.4亿美元的投资。作为双方合作的一部分,Intel会告知Cloudera其在研发安排中新的特性和硬件,确保Cloudera的Hadoop版本能够充分利用这些新技术。
       “对于在内存中访问数据架构方面,我们非常努力的令CPU使用达到最小。”Doug Cutting说道,并指出Cloudera尽量防止不必要的操作,这些操作会引起CPU成为内存数据处理的瓶颈。
       Hadoop和云计算
       Doug Cutting也希望简化Hadoop集群在云计算中的部署,让更广泛的人群能够使用Hadoop。在各种云平台上构建Hadoop集群已经成为可能。举例来说,运行CDH(Cloudera的Hadoop发行版),就可以使用Cloudera Director来部署AWS和Google云平台上的虚拟服务器集群。
       然而,Doug Cutting也说到,如何使处理进程变的更为简单,仍然有很多限制需要解决,而Cloudera也在计划改进从AWS S3及其他云存储向Hadoop数据处理引擎中输入数据的支持。
      “我们需要对Hadoop做一些调整,使其能够更好地适应云计算。我们需要重视像亚马逊S3这样的存储,配合HDFS(Hadoop分布式文件系统)来进行输入输出,这样人们就可以动态地部署集群。”他说。
       在云计算环境中,集群更有可能被启动和关闭,Cloudera还要改进缩短启动时间。
       另一个需要解决的问题,在于简化Hadoop在不同云平台之间的迁移,Doug Cutting对现阶段的云平台锁定表示失望。
     “我们应该让人们在云供应商之间能够实现转移,这在我们看来是非常有价值的。现在,如果你开始是在某云平台上开发的应用,那么很快就被锁定在这个云平台上了。”
       Doug Cutting表示,在CDH上,Cloudera正在构建“一个软件层,可以决定工作负载是运行在本地,还是放到亚马逊、谷歌、微软或其他云供应商上”。
       今天,这一功能在某种程度上来说可通过Cloudera Director实现,他说,“这正是我们要继续推进并使其更加无缝”。
       Doug Cutting相信,最终,Hadoop的传承将会扮演重要角色,让大数据成为常态、让开源成为软件的标准选择,让关系型数据库逐渐成为小众市场。
 
       “我们将不会再讨论大数据,而是探讨数据系统。开源架构将不再是新鲜事物,它将成为主流。关系型系统将基本等同于Cobol语言,而成为历史。我们在十年的时间中向前迈出了一大步。“
 
提交反馈

博客 博客

专注数字内容治理,助力数字体验升级

Baklib|为什么企业需要API驱动战略

Baklib|为什么企业需要API驱动战略

现代交易涉及35个系统组件,API成为连接关键。企业采用API驱动战略可降低开发成本、缩短上市时间、优化数字体验。本文解析API定义、商业价值及实施路径,助力企业赢在API经济时代。

Author api-driven-strategy-business
By Lisa
发布:2026-05-09
2026 年每个团队都需了解的 AI 文档的发展趋势

2026 年每个团队都需了解的 AI 文档的发展趋势

2026年AI文档将从静态转向自适应系统,包括MCP实时同步、多智能体协作、多模态内容、行业专用模型和集中治理。团队需防范AI幻觉、保持人工审核、管控文化差异,打好基础后再逐步引入新能力。

Author ai-documentation-trends-2026
By Lisa
发布:2026-05-08
AI时代,信任架构管理的复杂性

AI时代,信任架构管理的复杂性

AI时代,信任成为企业核心竞争力。真正的挑战不是技术老旧,而是系统复杂。AI会放大现有问题,信任必须从设计阶段融入架构。通过Baklib帮助企业打通数据、体验与治理,构建可信数字环境。

Author trust-architecture-ai-complexity
By Lisa
发布:2026-04-27
公共部门数字化转型的10个关键能力

公共部门数字化转型的10个关键能力

本文基于公共部门面临的数字化挑战,提出10项关键平台能力,涵盖多站点管理、低代码、自助服务、个性化、云端部署等,帮助政府提升服务效率与用户体验。

Author public-sector-digital-transformation-10-keys
By Lisa
发布:2026-04-20
DXP与最佳组合:赋能IT团队

DXP与最佳组合:赋能IT团队

数字体验平台(DXP)和“最佳组合”方法可帮助IT团队高效构建解决方案。DXP集成多种技术,支持多通道交付、分析和个性化,提升灵活性和效率。采用DXP并搭配最佳组合策略,企业无需替换现有系统即可实现未来创新。

Author dxp-best-of-breed-it-teams
By Lisa
发布:2026-04-18
Baklib|DXP对数字化转型至关重要的9个理由

Baklib|DXP对数字化转型至关重要的9个理由

本文从全渠道管理、消除信息孤岛、统一品牌形象、提升用户体验、个性化服务、自动化流程、易于采用、灵活扩展、远程办公安全等9个方面,阐述Baklib这类DXP如何助力企业成功实现数字化转型。

Author 9-reasons-why-dxps-are-essential-for-digital-transformation
By Lisa
发布:2026-04-09
自助服务门户:4大策略提升客户体验

自助服务门户:4大策略提升客户体验

81%的客户在联系人工客服前会先尝试自助解决问题。有效的自助服务门户不仅能降低成本,还可创造收入、统一支持中心、构建用户社区并推动主动响应。企业应基于组织目标与客户需求,制定清晰的自助服务策略。

Author 4-ways-you-can-improve-cx-with-digital-self-service
By Lisa
发布:2026-04-01
词元经济到来,AI 主导世界

词元经济到来,AI 主导世界

在数字化的浩瀚星空中,我们正见证着一场前所未有的范式转移。如果说互联网时代的核心是“连接”,那么人工智能(AI)时代的核心则是“理解”与“重构”。

Author ciyuan
By 巴克励步
发布:2026-03-27