国内Hadoop应用现状

时间:2024-04-01 19:37:02

Hadoop在国内主要以互联网公司为主,下面主要介绍大规模使用Hadoop或研究Hadoop的公司。

1. 百度
百度在2006年就关注了Hadoop并开始调研和使用,截止2012年,总的集群规模超过7个集群,单集群超过2800台机器节点,Hadoop机器总数超过15000台机器,总的存储容量超过100PB,已经使用的超过74PB,每天提交的作业数目超过6600个,每天的输入数据量已经超过7500TB,输出超过1700TB。
百度的Hadoop集群为整个公司的数据团队大搜索团队社区产品团队广告团队,以及LBS团体提供统一的计算和存储服务,主要应用包括:
 数据挖掘与分析
 日志分析平台
 数据仓库系统
 推荐引擎系统
 凤巢广告特征抽取与建模
 点击计费和反作弊
 用户行为分析系统
 网盟策略的流式计算
同时百度在Hadoop的基础上还开发了自己的日志分析平台、数据仓库系统,以及统一C++编程接口,并对Hadoop深度改造,开发了Hadoop C++扩展HCE系统。
2. 阿里巴巴
阿里巴巴的Hadoop集群截止2012年大约3200台服务器,物理CPU大约30000核心,总的内存100TB,总的存储容量超过60PB,每天的作业数目超过150000个,每天hive
query查询大于6000,每天扫描数据量约为7.5PB,每天扫描文件数约为4亿,存储利用率大概为80%,CPU利用率平均65%,峰值可以达到80%。阿里的Hadoop集群拥有150个用户组,4500个集群用户,为淘宝、天猫、一淘、聚划算、CBU、支付宝提供底层的基础计算和存储服务,主要应用包括:
 数据平台系统
 搜索支撑
 广告系统
 数据魔方
 量子统计
 淘数据
 推荐引擎系统
 搜索排行榜
同时为了便于开发,还开发了WEB IDE继承开发环境,使用的相关系统包括:Hive,Pig,Mahout,Hbase等。
3. 腾讯
腾讯也是使用Hadoop最早的中国互联网公司之一,截止2012年底,腾讯的Hadoop集群机器总量超过5000台,最大单集群约为2000个节点,并利用Hadoop-hive构建了自己的数据仓库系统TDW,同时还开发了自己的TDW-IDE基础开发环境。腾讯的Hadoop为腾讯各个产品线提供基础云计算和云存储服务,支撑的领域包括以下产品:
 腾讯社交广告平台
 搜搜SOSO
 拍拍网
 腾讯微博
 腾讯罗盘
 QQ会员
 腾讯游戏支撑
 QQ空间
 朋友网
 腾讯开放平台
 财付通
 手机QQ
 QQ音乐
4. 奇虎360
奇虎360主要使用Hadoop-hbase作为其搜索引擎so.com的底层网页存储架构系统,360搜索的网页可到千亿记录,数据量在PB级别。截止2012年底,其Hbase集群规模超过300节点,region个数大于10万个,使用的平台版本为:
 HBase版本:facebook 0.89-fb
 HDFS版本: facebook Hadoop-20
奇虎360在Hadoop-Hbase方面的工作主要为了优化减少Hbase集群的启停时间,并优化减少RS异常退出后的恢复时间。
5. 华为
华为公司也是Hadoop重要贡献公司之一,排在Google和Cisco的前面,华为在Hadoop的HA方案,以及HBASE领域有深入研究,并已经向业界推出了自己的基于Hadoop的大数据解决方案。
6. 中国移动
中国移动于2010年5月正式推出大云BigCloud1.0,集群节点达到了1024。中国移动的大云基于Hadoop的MapReduce实现了分布式计算,并利用了HDFS来实现分布式存储,并开发了基于Hadoop的数据仓库系统HugeTable,并行数据挖掘工具集BC-PDM,以及并行数据抽取转化BC-ETL,对象存储系统BC-ONestd等系统,并开源了自己的BC-Hadoop版本。
中国移动主要在电信领域应用Hadoop,其规划的应用领域包括:
 经分KPI集中运算
 经分系统ETL/DM
 结算系统
 信令系统
 云计算资源池系统
 物联网应用系统
 Email
 IDC服务等
7. 盘古搜索
盘古搜索主要使用Hadoop集群作为搜索引擎的基础架构支撑系统,截止2013年初,集群中机器数量总计超过380台,存储总量总计3.66PB,主要的应用包括:
 网页存储
 网页解析
 建索引
 Pagerank计算
 日志统计分析
 推荐引擎等
8. 即刻搜索(人民搜索)
即刻搜索也使用Hadoop作为其搜索引擎的支撑系统,截止2013年,其Hadoop集群规模总计超过500台节点,配置为双路6核心CPU,48G内存,11*2T存储,集群总容量超过10PB,使用率在78%左右,每天处理读取的数据量约为500TB,峰值大于1P,平均约为300TB。
即刻搜索在搜索引擎中使用sstable格式存储网页并直接将sstable文件存储在HDFS上面,主要使用Hadoop pipes编程接口进行后续处理,也使用streaming接口处理数据,主要的应用包括:
 网页存储
 解析
 建索引
 推荐引擎

版权声明:本文为博主原创文章,未经博主允许不得转载。