数据中心交易平台建设

大家好,今天小编来为大家解答以下的问题,关于数据中心交易平台建设,怎样选择数据平台的建设方案这个很多人还不知道,现在让我们一起来看看吧!

本文目录

  1. 哪里的数据中心管理
  2. 工信部等三部门联合发文:大型和超大型数据中心PUE值不高于1.4
  3. 怎样选择数据平台的建设方案

一、哪里的数据中心管理

随着智慧城市的发展,各省市逐渐设立了大数据管理局,各部门之间的信息互通随之更加便捷。同时,当数据实现了互联互通之后,将更有效地利用和挖掘数据价值。如今,我国已有数十个省级以上大数据管理局。

隶属机构:北京市经济和信息化局

办公地址:北京市朝阳区北辰西路12号数字北京大厦

1.负责研究提出本市大数据管理规范和技术标准建议;

2.负责本市政务数据和相关社会数据的汇聚、管理、共享、开放和评估;

3.负责市级政务云、大数据管理平台等数据基础设施的建设、运维和应用支撑;

4.负责社会信用数据应用服务;承担社会信用体系建设辅助性、事务性工作;

5.负责“互联网+政务服务”信息化基础支撑平台的建设、运维和保障;

6.承担政府投资信息化项目技术性审核的支撑服务工作;

7.承担组织重大信息化项目技术论证和评估验收的支撑服务工作。

办公地址:上海市静安区寿阳路99弄15号

1.贯彻执行国家大数据发展的方针政策;

2.承担政务数据、行业数据、社会数据等各方数据归集和应用融合工作;

3.研究数据采集、传输、存储、挖掘、展现等技术;

4.承担本市政务信息系统整合相关工作;

5.承担上海政务“一网通办”总门户、政务云、政务外网、大数据平台、电子政务灾难备份中心等建设和运维管理;

6.承担市委、市政府和市政府办公厅交办的其他工作。

办公地址:天津市河西区尖山天津数字电视大厦

1.按照中央和市委、市政府关于加强网络安全和信息化工作的有关要求;

2.全力做好市级信息系统建设统筹规划和顶层设计;

3.加强数据资源整合,强化集中式运维管理体系的配套建设。

党委委员、副主任:金双龙、肖斌

官网:

办公地址:重庆市渝北区星光大道1号星光大厦A座

1.组织起草全市大数据、人工智能、信息化相关地方性法规、规章草案;

2.研究拟订全市大数据、人工智能、信息化发展战略;

3.负责全市数据资源建设、管理,促进大数据政用、商用、民用。负责推进全市政府数据采集汇聚、登记管理、共享开放;

4.负责全市大数据应用发展管理;

5.负责推进全市信息化应用工作;

6.负责协调全市信息基础设施建设;

7.负责推动大数据、人工智能、信息化领域对外交流合作;

8.完成市委和市政府交办的其他任务。

党组书记、局长:代小红(正厅级)

党组成员、副局长:李斌、景根元、胡军国(副厅级)

办公地址:贵州省贵阳市云岩区北京路225号

1.负责起草相关地方性法规、规章草案;

2.负责统筹政务数据采集汇聚、登记管理;

3.负责统筹协调全省政务信息化、电子政务建设;

4.负责研究拟订全省信息化建设、信息基础建设、大数据发展规划、政策措施和评价体系并组织实施;

5.负责统筹推进信息化发展和大数据融合应用;

6.负责数据中心规划建设与集约利用;

7.负责全省大数据相关产业发展和行业管理,推进数字经济产业化、产业数字化发展;

8.负责提出大数据、信息化领域投资规模及方向;

9.承担大数据、信息化领域对外交流合作;

10.承担大数据、信息化人才队伍建设工作。

党组书记、局长:景亚萍(正厅级)

党组成员、副局长:胡建华、娄松、李刚、张晓辉(副厅级)

隶属机构:福建省发展和改革委员会

办公地址:福建省福州市湖东路78号

1.贯彻落实国家有关信息化的政策和法律法规;

2.具体统筹福建省信息化工作,推进重点领域信息化应用;

3.统筹规划和协调推进重大信息化基础设施和公共平台建设;

4.负责福建省公共信息资源综合管理和开发利用;

5.组织编制数字福建建设投资计划,负责相关项目管理;

6.负责福建省互联网经济牵头抓总、宏观指导、统筹协调和组织推进相关工作;

7.承担省数字福建建设领导小组和省互联网经济联席会议日常工作。

官网:

办公地址:山东省济南市省府前街1号山东省大数据局

1.牵头实施大数据战略,推进数字山东建设;

2.负责实施省电子政务外网、电子政务云平台的建设和运维管理工作;

3.负责实施省级政务服务、业务协同等综合业务平台的建设和运维管理工作;

4.负责实施省级政务信息资源共享交换公共数据资源开放、大数据管理等平台及相关信息资源库。

党组书记、局长:马越男(正厅级)

党组成员、副局长:廉凯、顾卫东、禹金涛(副厅级)

办公地址:浙江省杭州市西湖区体育场路487号

1.组织、指导、协调公共数据和政府系统电子政务发展管理工作;

2.落实支撑改革相关的信息系统建设任务;

3.负责省政府门户网站建设与管理,指导各级政府门户网站建设管理;

4.组织协调公共数据资源整合、归集、应用、共享、开放;

5.统筹推进政府系统电子政务基础设施建设管理;

6.统筹协调政府系统电子政务网络、电子政务云平台等重大基础设施建设管理工作;

7.负责局自建系统、公共应用基础支撑平台和归集数据的安全管理工作;

8.完成省委、省政府交办的其他任务。

党组成员、局长:金志鹏(正厅级)

副局长:蒋汝忠、陈瑜(副厅级)

办公地址:广东省广州市东风中路305号

1.组织起草全省政务服务和政务信息化相关政策和地方性法规、规章草案并组织实施;

2.拟订建设规划和年度建设计划并组织实施,负责“数字政府”平台建设运维资金管理工作;

3.负责对省级政务信息化项目建设实施集约化管理;

4.负责全省行政审批制度改革、审批服务便民化相关工作;

5.统筹协调省级部门业务应用系统建设;

6.负责政务服务、电子政务标准体系建设和相关标准规范的制定;

7.统筹政务数据资源的采集,分类、管理、分析和应用工作;

8.统筹全省电子政务基础设施、信息系统、数据资源等安全保障工作;

9.负责公共资源交易平台管理相关工作;

10.统筹推进全省政务服务体系建设;

11.完成省委、省政府和国务院办公厅交办的其他任务。

党组书记、局长:杨鹏飞(正厅级)

党组成员、副局长:陈日升、高尚省、魏文涛(副厅级)

隶属机构:广西壮族自治区人民政府

办公地址:广西壮族自治区南宁市良庆区体强路18号

1.负责统筹推进全区信息化、数字化发展工作;

2.拟订相关行业技术标准规范、管理办法和考核评估办法并组织实施;

3.负责组织拟订并推动实施大数据发展、数字广西发展战略规划;

4.负责拟订自治区本级信息化、数字化领域的财政性资金(专项资金)年度投资计划并组织实施;

5.负责统筹协调推进数字设施建设,配合做好网络安全工作;

6.负责统筹全区数据资源建设、管理、应用,政务数据的汇聚、共享;

10.负责中国—东盟信息港建设管理;

11.负责统筹推进全区行政审批制度改革;

12.负责对进驻自治区政务服务平台的政务服务事项的组织协调和监督管理;

二、工信部等三部门联合发文:大型和超大型数据中心PUE值不高于1.4

工信部、国家机关事务管理局、国家能源局近日联合印发《关于加强绿色数据中心建设的指导意见》(下简称《意见》),明确提出要建立健全绿色数据中心标准评价体系和能源资源监管体系,到2022年,数据中心平均能耗基本达到国际先进水平。

《意见》指出,引导大型和超大型数据中心设计电能使用效率值不高于1.4;力争通过改造使既有大型、超大型数据中心电能使用效率值不高于1.8。

政策引领、市场主导。充分发挥市场配置资源的决定性作用,调动各类市场主体的积极性、创造性。更好发挥政府在规划、政策引导和市场监管中的作用,着力构建有效激励约束机制,激发绿色数据中心建设活力。

改造存量、优化增量。建立绿色运维管理体系,加快现有数据中心节能挖潜与技术改造,提高资源能源利用效率。强化绿色设计、采购和施工,全面实现绿色增量。

创新驱动、服务先行。大力培育市场创新主体,加快建立绿色数据中心服务平台,完善标准和技术服务体系,推动关键技术、服务模式的创新,引导绿色水平提升。

建立健全绿色数据中心标准评价体系和能源资源监管体系,打造一批绿色数据中心先进典型,形成一批具有创新性的绿色技术产品、解决方案,培育一批专业第三方绿色服务机构。到2022年,数据中心平均能耗基本达到国际先进水平,新建大型、超大型数据中心的电能使用效率值达到1.4以下,高能耗老旧设备基本淘汰,水资源利用效率和清洁能源应用比例大幅提升,废旧电器电子产品得到有效回收利用。

(一)提升新建数据中心绿色发展水平

加强对新建数据中心在IT设备、机架布局、制冷和散热系统、供配电系统以及清洁能源利用系统等方面的绿色化设计指导。鼓励采用液冷、分布式供电、模块化机房以及虚拟化、云化IT资源等高效系统设计方案,充分考虑动力环境系统与IT设备运行状态的精准适配;鼓励在自有场所建设自然冷源、自有系统余热回收利用或可再生能源发电等清洁能源利用系统;鼓励应用数值模拟技术进行热场仿真分析,验证设计冷量及机房流场特性。引导大型和超大型数据中心设计电能使用效率值不高于1.4。

引导数据中心在新建及改造工程建设中实施绿色施工,在保证质量、安全基本要求的同时,最大限度地节约能源资源,减少对环境负面影响,实现节能、节地、节水、节材和环境保护。严格执行《电器电子产品有害物质限制使用管理办法》和《电子电气产品中限用物质的限量要求》(GB/T 26572)等规范要求,鼓励数据中心使用绿色电力和满足绿色设计产品评价等要求的绿色产品,并逐步建立健全绿色供应链管理制度。

(二)加强在用数据中心绿色运维和改造

指导数据中心建立绿色运维管理体系,明确节能、节水、资源综合利用等方面发展目标,制定相应工作计划和考核办法;结合气候环境和自身负载变化、运营成本等因素科学制定运维策略;建立能源资源信息化管控系统,强化对电能使用效率值等绿色指标的设置和管理,并对能源资源消耗进行实时分析和智能化调控,力争实现机械制冷与自然冷源高效协同;在保障安全、可靠、稳定的基础上,确保实际能源资源利用水平不低于设计水平。

有序推动数据中心开展节能与绿色化改造工程,特别是能源资源利用效率较低的在用老旧数据中心。加强在设备布局、制冷架构、外围护结构(密封、遮阳、保温等)、供配电方式、单机柜功率密度以及各系统的智能运行策略等方面的技术改造和优化升级。鼓励对改造工程进行绿色测评。力争通过改造使既有大型、超大型数据中心电能使用效率值不高于1.8。

3. 加强废旧电器电子产品处理

加快高耗能设备淘汰,指导数据中心科学制定老旧设备更新方案,建立规范化、可追溯的产品应用档案,并与产品生产企业、有相应资质的回收企业共同建立废旧电器电子产品回收体系。在满足可靠性要求的前提下,试点梯次利用动力电池作为数据中心削峰填谷的储能电池。推动产品生产、回收企业加快废旧电器电子产品资源化利用,推行产品源头控制、绿色生产,在产品全生命周期中最大限度提升资源利用效率。

(三)加快绿色技术产品创新推广

1. 加快绿色关键和共性技术产品研发创新

鼓励数据中心骨干企业、科研院所、行业组织等加强技术协同创新与合作,构建产学研用、上下游协同的绿色数据中心技术创新体系,推动形成绿色产业集群发展。重点加快能效水效提升、有毒有害物质使用控制、废弃设备及电池回收利用、信息化管控系统、仿真模拟热管理和可再生能源、分布式供能、微电网利用等领域新技术、新产品的研发与创新,研究制定相关技术产品标准规范。

2. 加快先进适用绿色技术产品推广应用

加快绿色数据中心先进适用技术产品推广应用,重点包括:一是高效IT设备,包括液冷服务器、高密度集成IT设备、高转换率电源模块、模块化机房等;二是高效制冷系统,包括热管背板、间接式蒸发冷却、行级空调、自动喷淋等;三是高效供配电系统,包括分布式供能、市电直供、高压直流供电、不间断供电系统ECO模式、模块化UPS等;四是高效辅助系统,包括分布式光伏、高效照明、储能电池管理、能效环境集成监控等。

充分发挥标准对绿色数据中心建设的支撑作用,促进绿色数据中心提标升级。建立健全覆盖设计、建设、运维、测评和技术产品等方面的绿色数据中心标准体系,加强标准宣贯,强化标准配套衔接。加强国际标准话语权,积极推动与国际标准的互信互认。以相关测评标准为基础,建立自我评价、社会评价和政府引导相结合的绿色数据中心评价机制,探索形成公开透明的评价结果发布渠道。

加快培育具有公益性质的第三方服务机构,鼓励其创新绿色评价及服务模式,向数据中心提供咨询、检测、评价、审计等服务。鼓励数据中心自主利用第三方服务机构开展绿色评测,并依据评测结果开展有实效的绿色技术改造和运维优化。依托高等院校、科研院所、第三方服务等机构建立多元化绿色数据中心人才培训体系,强化对绿色数据中心人才的培养。

鼓励数据中心和节能服务公司拓展合同能源管理,研究节能量交易机制,探索绿色数据中心融资租赁等金融服务模式。鼓励数据中心直接与可再生能源发电企业开展电力交易,购买可再生能源绿色电力证书。探索建立绿色数据中心技术创新和推广应用的激励机制和融资平台,完善多元化投融资体系。

(一)加强组织领导。工业和信息化部、国家机关事务管理局、国家能源局建立协调机制,强化在政策、标准、行业管理等方面的沟通协作,加强对地方相关工作的指导。各地工业和信息化、机关事务、能源主管部门要充分认识绿色数据中心建设的重要意义,结合实际制定相关政策措施,充分发挥行业协会、产业联盟等机构的桥梁纽带作用,切实推动绿色数据中心建设。

(二)加强行业监管。在数据中心重点应用领域和地区,了解既有数据中心绿色发展水平,研究数据中心绿色发展现状。将重点用能数据中心纳入工业和通信业节能监察范围,督促开展节能与绿色化改造工程。推动建立数据中心节能降耗承诺、信息依法公示、社会监督和违规惩戒制度。遴选绿色数据中心优秀典型,定期发布《国家绿色数据中心名单》。充分发挥公共机构特别是党政机关在绿色数据中心建设的示范引领作用,率先在公共机构组织开展数据中心绿色测评、节能与绿色化改造等工作。

(三)加强政策支持。充分利用绿色制造、节能减排等现有资金渠道,发挥节能节水、环境保护专用设备所得税优惠政策和绿色信贷、首台(套)重大技术装备保险补偿机制支持各领域绿色数据中心创建工作。优先给予绿色数据中心直供电、大工业用电、多路市电引入等用电优惠和政策支持。加大政府采购政策支持力度,引导国家机关、企事业单位优先采购绿色数据中心所提供的机房租赁、云服务、大数据等方面服务。

(四)加强公共服务。整合行业现有资源,建立集政策宣传、技术交流推广、人才培训、数据分析诊断等服务于一体的国家绿色数据中心公共服务平台。加强专家库建设和管理,发挥专家在决策建议、理论指导、专业咨询等方面的积极作用。持续发布《绿色数据中心先进适用技术产品目录》,加快创新成果转化应用和产业化发展。鼓励相关企事业单位、行业组织积极开展技术产品交流推广活动,鼓励有条件的企业、高校、科研院所针对绿色数据中心关键和共性技术产品建立实验室或者工程中心。

(五)加强国际交流合作。充分利用现有国际合作交流机制和平台,加强在绿色数据中心技术产品、标准制定、人才培养等方面的交流与合作,举办专业培训、技术和政策研讨会、论坛等活动,打造一批具有国际竞争力的绿色数据中心,形成相关技术产品整体解决方案。结合“一带一路”倡议等国家重大战略,加快开拓国际市场,推动优势技术和服务走出去。

据悉,在数据中心当前的后期运营,能耗是最大成本,占比超过50%。降低能耗效率(PUE)值,一直是业界相关部门关心的重点。

工信部在2017年4月发布的《关于加强“十三五”信息通信业节能减排工作的指导意见》中指出:“十二五”期间新建大型数据中心的能耗效率(PUE)要普遍低于1.5;到2020年,新建大型、超大型数据中心的能耗效率(PUE)值必须达到1.4以下。

去年3月,工信部首次公布的《全国数据中心应用发展指引》中称:全国超大型数据中心平均PUE(平均电能使用效率)为1.50,大型数据中心平均PUE为1.69。而根据“十三五规划”,到2020年,新建大型云计算数据中心PUE值将不得高于1.4。

如今,三部门联手针对绿色数据中心建设进一步提出了明确的指导意见。在这样的大背景下,数据中心运营商如何运用新技术、新架构降低能源降耗,实现数据中心的绿色发展,将成为行业的关注热点,与此同时,节能降耗的大趋势之下,也将带来更多的市场机遇。

三、怎样选择数据平台的建设方案

业务跑的好好的,各系统稳定运行,为何还要搭建企业的数据平台?

这样的问题,心里想想就可以了,不要大声问出来。我来直接回答一下,公司一般在什么情况下需要搭建数据平台,对各种数据进行重新架构。

1、业务系统过多,彼此的数据没有打通。这种情况下,涉及到数据分析就麻烦了,可能需要分析人员从多个系统中提取数据,再进行数据整合,之后才能分析。一次两次可以忍,天天干这个能忍吗?人为整合出错率高怎么控制?分析不及时效率低要不要处理?

2、业务系统压力大,而不巧,数据分析又是一项比较费资源的任务。那么自然会想到的,通过将数据抽取出来,独立服务器来处理数据查询、分析任务,来释放业务系统的压力。

3、性能问题,公司可以越做越大,同样的数据也会越来越大。可能是历史数据的积累,也可能是新数据内容的加入,当原始数据平台不能承受更大数据量的处理时,或者是效率已经十分低下时,重新构建一个大数据处理平台就是必须的了。

上面我列出了三种情况,但他们并非独立的,往往是其中两种甚至三种情况同时出现。一个数据平台的出现,不仅可以承担数据分析的压力,同样可以对业务数据进行整合,也会不同程度的提高数据处理的性能,基于数据平台实现更丰富的功能需求。

二、数据平台的建设有哪些方案可以选择

下文中的优缺点仅从企业选型的角度,并非方案本身的技术角度。

如果一句话回答的话,那就是:太多了(这是一句废话,我承认),但确实有非常多的方案可供选择,我懂的少,肯定是无法一一介绍,所以就分成了下面几类,相信也一定程度上覆盖了大部分企业的需求了。

概念不说了,既然是做数据这一行的,相信你比我还要清楚,不清楚的可以百度。它的重点在于数据整合,同时也是对业务逻辑的一个梳理。虽然它也可以打包成ssas那种cube一类的东西来提升数据的读取性能,但是数据仓库的作用,更多的是为了解决公司的业务问题,而不仅仅是性能问题。这一点后面会详细介绍。

关于这一方案的优缺点,直接说重点:

方案成熟,关于数据仓库的架构,不管是Inmon架构还是Kimball架构,都有着非常广泛的应用,而且相信能将这两种架构落地的人也不少。

实施简单,涉及的技术层面主要是仓库的建模以及etl的处理,很多软件公司具备数据仓库的实施能力,实施难度的大小更多的取决于业务逻辑的复杂程度,而并非技术上的实现。

灵活性强,说这句话要有对应场景的,数据仓库的建设是透明的,如果需要,可以对仓库的模型、etl逻辑进行修改,来满足变更的需求(当然,最好设计之初考虑的周全一点)。同时对于上层的分析而言,通过sql或者mdx对仓库数据的分析处理具备极强的灵活性。

“实施周期长”,注意,我加了引号,对应下面的敏捷型数据集市,而且这点是相对的,实施周期的长与短要取决于业务逻辑的复杂性,时间是花在了业务逻辑的梳理,并非技术上的瓶颈。关于这点,后面会详细介绍。

数据的处理能力有限,这个有限,也是相对的,海量数据的处理它肯定不行,非关系型数据的处理它也不行,但是TB以下级别的数据,还是搞得定的(也取决于所采用的数据库系统),这个量级的数据,而相当一部分企业的数据,还是很难超过这个级别的。

底层的数据产品与分析层绑定,使得应用层可以直接对底层数据产品中的数据进行拖拽式分析。这一类产品的出现,其初衷是为了对业务数据进行简单的、快速的整合,实现敏捷建模,并且大幅提升数据的处理速度。目前来看,这些产品都达到了以上的目的。但它的优缺点也比较明显。

部署简单,敏捷开发,这也是这类产品最大的优点,和数据仓库相比,实施周期要短的多。实际上它也没什么严格的实施的概念,因为这类产品只是针对需要分析的数据,进行局部的关联,只考虑眼前要解决的问题就够了,迭代的能力更强些。

与上层的分析工具结合较好,上层的分析工具接入这类数据产品后,可直接实现数据的图形化展示和olap分析。对数据处理性能的提高,这类产品都对数据的分析性能做了处理,虽然方式不尽相同,有内存映射文件存储的,也有分布式架构、列数据存储的。但无疑都一定程度上提高了数据的处理性能。

无法处理复杂的业务逻辑,这只是一个工具,它无法解决业务问题。这类工具中自带简单的etl功能,实现简单的数据处理和整合,而如果考虑到历史数据,考虑到整体的数据之间的逻辑和关系,它一定是解决不了的。一个简单的例子,当某个表中,有两个字段,一个要保留历史数据,一个要更新历史数据,要怎样实现自动处理。有一个观念是需要清楚的,不能指望一款工具来解决业务问题。这种数据产品仅仅是对当前的业务数据进行简单的整合,第一,数据是局部的,第二,时间是当前的(其涵带的增量更新或者全量更新,是无法应对复杂的逻辑的,相信熟悉etl的人都知道这个过程有多复杂)。当然,对于一些公司来说,可能需求只是对当前业务数据进行整合分析,那么这类产品就够了。(说实话,很多公司真的是懒得更长远的考虑,有一天没一天的,谁说的准呢)

l灵活性低,这个也是没法避免的,越是操作简单的工具,他的灵活性肯定受限,因为封装住了,产品是不透明的,常规的需求用起来非常方便,但是遇到复杂的,发现对他内部不了解,你也没法修改,只有蛋疼的份。

从我的角度看,它是很难成为公司的数据中心的。

3、 MPP(大规模并行处理)架构的数据产品,以最近开源的greenplum为例

传统的主机计算模式在海量数据面前,显得弱鸡。造价非常昂贵,同时技术上也无法满足高性能的计算,smp架构难于扩展,在独立主机的cpu计算和io吞吐上,都没办法满足海量数据计算的需求。分布式存储和分布式计算正是解决这一问题的关键,不管是后面的MapReduce计算框架还是MPP计算框架,都是在这一背景下产生的。

greenplum的数据库引擎是基于postgresql的,并且通过Interconnnect神器实现了对同一个集群中多个Postgresql实例的高效协同和并行计算。

同时,基于greenplum的数据平台建设,可以实现两个层面的处理,显而易见的一个是对数据处理性能的处理,greenplum的百科中宣称支持50PB级海量数据的处理,考虑它有吹牛的成分,对目前greenplum实际应用情况的了解,100tb级左右的数据,是非常轻松的。另一个是数据仓库可以搭建在greenplum中,这一层面上也是对业务逻辑的梳理,对公司业务数据的整合。

海量数据的支持,大量成熟的应用案例,所以我想这一点是不用怀疑的。

扩展性,据说可线性扩展到10000个节点,并且每增加一个节点,查询、加载性能都成线性增长。

易用性,不需要复杂的调优需求,并行处理由系统自动完成。依然是sql作为交语言,简单、灵活、强大。

高级功能,greenplum还研发了很多高级数据分析管理功能,例如人气很高的外部表,还有Primary/Mirror镜像保护机制,行/列混合存储等。

稳定性,greenplum原本作为一个纯商业数据产品,具有很长的历史,其稳定性相比于其他产品以及敏捷性数据集市是更加有保障的。 greenplum有非常多的应用案例,纳斯达克、纽约证券交易所、平安银行、建设银行、华为等都建立了基于greenplum的数据分析平台。其稳定性是可以从侧面验证的,在15年9月份开源后,各大互联网公司也是一片欢腾,现在也接触了几家在使用greenplum的客户,对其评价都很高。

本身来说,它的定位在olap领域,不擅长oltp交易系统。当然我们搭建公司的数据中心也不会是用来做交易系统的。

成本,两个方面的考虑,一是硬件成本,greenplum有其推荐的硬件规格,对内存、网卡都有要求。当然,在硬件选型上,需要达到一个平衡,要在性能、容量、成本等多方面考虑,毕竟不能一味的追求性能,把采购部门吓到吧。另一个是实施成本,这里主要是人了,基本的是greenplum的安装配置,再到greenplum中数据仓库的构建,都需要人和时间。(但是必须要说的是,人家软件都开源了,也省下了一笔钱啊)

技术门槛,这里是相对于上一个敏捷型数据集市的,greenplum的门槛肯定是要高一点了。

关于hadoop,已经火的要爆炸了,greenplum的开源跟它也是脱不了关系的。有着高可靠性、高扩展性、高效性、高容错性的口碑。在互联网领域有非常广泛的运用,雅虎、facebook、百度、淘宝等等等等。hadoop生态体系非常庞大,各公司基于hadoop所实现的也不仅限于数据分析,也包括机器学习、数据挖掘、实时系统等。

当企业数据规模达到一定的量级,我想hadoop是各大企业的首选方案,到达这样一个层次的时候,我想企业所要解决的也不仅是性能问题,还会包括时效问题、更复杂的分析挖掘功能的实现等。非常典型的实时计算体系也与hadoop这一生态体系有着紧密的联系。

近些年来hadoop的易用性也有了很大的提升,sql-on-hadoop技术大量涌现,包括hive、impala、spark-sql等。尽管其处理方式不同,但普遍相比于原始基于文件的Mapreduce,不管是性能还是易用性,都是有所提高的。也因此对mpp产品的市场产生了压力。

对于企业构建数据平台来说,hadoop的优势与劣势非常明显:它的大数据的处理能力、高可靠性、高容错性、开源性以及低成本(为什么说低成本,要处理同样规模的数据,换一个其他方案试试呢)。缺点也就是他的体系的复杂,技术门槛较高(能搞定hadoop的公司规模一般都不小了)。

关于hadoop的优缺点对于公司的数据平台选型来说,影响已经不大了。需要上hadoop的时候,也没什么其它的方案好选择(要么太贵,要么不行),没到达这个数据量的时候,也没人愿意碰这东西。总之,不要为了大数据而大数据。

三、方案很多,企业要怎样选择呢?

环境太复杂,但是我想至少要从下面这几个方面去考虑吧。

什么样的目的?就是文中开始部分的三种情况呀(不好意思,自大了,肯定有其它情况,欢迎向“jiago王”补充),或者是其中几个的组合。

做事方法都一样,哪怕是中午出去吃饭,也是要在心里有个目的,这顿饭是为了吃饱,还是吃爽,或者为了拍别人的马屁,然后才好选择去吃什么。

当然,要明确数据平台的建设目的,哪里是那么容易的,初衷与讨论后确认的目标或许是不一致的。

公司要搭建一个数据平台的初衷可能很简单,只是为了减轻业务系统的压力,将数据拉出来后再分析,如果目的真的就这么单纯,还真的没有必要大动干戈了。如果是独立系统的话,直接将业务系统的数据库复制出来一份就好了;如果是多系统,选类似finecube那种型敏捷型的商业数据产品也够了,快速建模,直接用finebi或者finereport接入进去就能实现数据的可视化与olap分析。

但是,既然已经决定要将数据平台独立出来了,就不再多考虑一点吗?多个系统的数据,不趁机梳理整合一下?当前只有分析业务数据的需求,以后会不会考虑到历史数据呢?这种敏捷的方案能够支撑明年、后年的需求吗?

任何公司要搭建数据平台,都不是一件小事,多花一两个月实施你可能觉得累,多花一周两周的时间,认真的思考一下总可以的吧。雷军不是说过这样一句话:不能以战术上的勤奋,掩盖战略上的懒惰。

根据公司的数据规模选择合适的方案,这里说多了都是废话。

包括时间成本和金钱,不必多说。但是这里有一个问题想提一下,发现很多公司,要么不上数据平台,一旦有了这样的计划,就恨不得马上把平台搭出来用起来,时间成本不肯花,这样的情况很容易考虑欠缺,也容易被数据实施方忽悠。

关于方案选择的建议,举以下3 1个场景

要实现对业务数据的快速提取和分析,多个业务系统,没有达到海量数据,不考虑历史数据,不需要依照业务逻辑对数据进行系统的梳理,这种情况下,可以考虑敏捷型的bi工具自带的数据底层。

简单来讲,这种场景仅仅是在技术层面上,完成对数据的整合与提速,并没有从业务层面上对数据进行建模。他可以满足一定的分析需求,但是不能成为公司的数据中心。

要搭建公司级的数据中心,打通各系统之间的数据。非常明显的,需要搭建一个数据仓库。这时就需要进一步考虑公司数据的量级了,如果是小数据量,TB级以下,那么在传统数据库中建这样一个数据仓库就可以了,如果数据量达到几十上百TB,或者可见的在未来几年内数据会达到这样一个规模,可以将仓库搭在 greenplum中。

这种场景应该是适用于大部分公司,对于大部分企业来说,数据量都不会PB级别,更多的是在TB级以下。

公司数据爆发式增长,原有的数据平台无法承担海量数据的处理,那么就建议考虑hadoop这种大数据平台了。它一定是公司的数据中心,这样一个角色,仓库是少不了的,可以将原来的仓库直接搬到hive中去。这种数据量比较大的情况要怎样呈现,因为hive的性能较差,它的即席查询可以接 impala,也可以接greenplum,因为impala的并发量不是那么高,而greenplum正好有它的外部表(也就是greenplum创建一张表,表的特性叫做外部表,读取的内容是hadoop的hive里的),正好和hadoop完美的融合(当然也可以不用外部表)。

这个是后面补充的,当公司原本有一个数据仓库,但历史数据了堆积过多,分析性能下降,要怎么办?两个方案可以考虑,比较长远的,可以将仓库以及数据迁移到greenplum中,形成一个新的数据平台,一个独立的数据平台,可以产生更多的可能性;比较快速的,是可以将类似finecube那种敏捷型数据产品接入原来的仓库,这样来提升数据的处理性能,满足分析的要求。

四、关于方案选型时可能会出现的误区

(忽略业务的复杂性,要用工具来解决或者是绕开业务的逻辑。)

这个是我最近遇到过的,客户要做报表平台,有三个业务系统的数据需要整合。但是急于变现,不想搭建传统的数据仓库,所以从敏捷型的bi工具中选型。工具厂商对自己数据产品的描述,一般着重于他的快速实施、性能的优化、以及自带的基本etl功能。这样容易给客户造成误区,就是通过这一产品可快速搭建出一个公司级别的数据中心,满足于顶层对数据的需求。

然而在后期突然意识到,工具所解决的,仅仅是在技术层面上简化了工具的使用的复杂性,把etl和数据集市封装在一起,并且提高了数据的性能,但是并没有从业务层面上实现数据的建模,很多细节问题无法处理。

虽然敏捷开发非常诱人,如果业务系统简单,或者只需要分析当前状态的业务数据,不需要公司级的数据中心,那么确实是一个非常好的方案。然而这些问题还没有考虑清楚,对敏捷产品有了过高的期望,后面是会遇到些麻烦的。

除此之外,可能还会有为了大数据而大数据的,但是这些我在实际的工作中还没有遇到。

最后总结一下,企业选择数据平台的方案,有着不同的原因,要合理的选型,既要充分的考虑搭建数据平台的目的,也要对各种方案有着充分的认识。

仅从个人的角度,对于数据层面来说,还是倾向于一些灵活性很强的方案的,因为数据中心对于公司来说太重要了,我更希望它是透明的,是可以被自己完全掌控的,这样才有能力实现对数据中心更加充分的利用。因为,我不知道未来需要它去承担一个什么样的角色。

好了,关于数据中心交易平台建设和怎样选择数据平台的建设方案的问题到这里结束啦,希望可以解决您的问题哈!

声明:本文内容来自互联网不代表本站观点,转载请注明出处:https://www.41639.com/15_412410.html

相关推荐