×
请登录
账号
密码
登录 Use it
博客
随笔
网盘
建站
资源
古文赏析
标签
毒鸡汤
登录
注册
Hadoop数据操作系统YARN全解析
摘要:Hadoop 2.0引入YARN,大大提高了集群的资源利用率并降低了集群管理成本。其在异构集群中是怎样应用的?Hulu又有哪些成功实践可以分享? Hadoop YARN的生态系统 为了能够对集群中的资源进行统一管理和调度,Hadoop 2.0引入了数据操作系统YARN。YARN的引入,大大提高了集群的资源利用率,并降低了集群管理成本。首先,YARN允许…
star2017
博客
1年前
3657
0
大型网站架构系列:电商网站架构案例
摘要:大型网站架构是一个系列文档,欢迎大家关注。本次分享主题:电商网站架构案例。从电商网站的需求,到单机架构,逐步演变为常用的,可供参考的分布式架构的原型。除具备功能需求外,还具备一定的高性能,高可用,可伸缩,可扩展等非功能质量需求(架构目标)。 根据实际需要,进行改造,扩展,支持千万PV,是没问题的。 本次分享大纲 电商案例的原因 电商网站需求 网站初级架…
star2017
博客
1年前
2568
0
基于Spark的异构分布式深度学习平台
导读:本文介绍百度基于Spark的异构分布式深度学习系统,把Spark与深度学习平台PADDLE结合起来解决PADDLE与业务逻辑间的数据通路问题,在此基础上使用GPU与FPGA异构计算提升每台机器的数据处理能力,使用YARN对异构资源做分配,支持Multi-Tenancy,让资源的使用更有效。 深层神经网络技术最近几年取得了巨大的突破,特别在语音和图像识别…
star2017
博客
1年前
10042
0
从日志统计到大数据分析(一)——洪荒年代
我2007年浙大研究生毕业后加入百度,先在百度知道做了一年的后端研发,2008年底开始负责日志统计的一个小团队,开发了一套基于Hadoop的日志统计平台,之后一直围绕数据这一方向,覆盖数据的采集、传输、建模存储、查询分析、数据可视化。今年4月份从百度离职创业,做一款针对互联网创业公司的数据分析产品Sensors Analytics,有兴趣的可以到sensor…
star2017
博客
1年前
5888
0
从日志统计到大数据分析(二)——盘古开天地
设计一套日志统计平台的需求来源主要是Nslog的RD和OP同学,整理了好几十条,并出了一个基本的方案。我当时觉得实现一个提升运维管理的系统不难,难的是怎么是好用的我很关心怎么提升需求处理的效率问题。这个时候其中一个人又被调到了一个基础库团队。也就是做这件事的就只剩我和校招新人了。而我们两个都还没做过需求处理,也不知道那几百个脚本里面都写的什么玩意儿。我说咱俩…
star2017
博客
1年前
4138
0
从日志统计到大数据分析(三)——战国的混乱
随着需求的增长,计算资源也随之增长,每个季度有20%-30%。经过一年半,机器数从160台增长到了5000台。记得2009年产品发布后第一次提机器预算时,为了保证新产品部的核心统计能在员工上班之前跑出来,提了100多台,那个时候一个像百度知道这样的业务线也只是申请添加十几台机器满足正常的业务增长,经理都在担心部门是否会批。后来,再提需求都是以千台计,我的经理…
star2017
博客
1年前
4061
0
从日志统计到大数据分析(四)——秦天下
转眼到了2011年初,我感觉团队放在网页相关性部门,不利于发展。我的想法是要把团队面向全公司服务,甚至成为像NLP(自然语言处理)部门在厂长心中的地位。但网页相关性部门的上司觉得先服务好本部门就够了。我和基础架构部的一个经理(最早在百度负责维护和开发Hadoop团队的负责人,在他完成了Hadoop在全百度的推广之后,改为负责一个分布式存储团队了)商量了一下,…
star2017
博客
1年前
4173
0
从日志统计到大数据分析(五)——楚汉争霸
痛定思痛,我们觉得主要问题出在数据源上。百度有上百条业务线(有一定业务规模的),牵涉到数千个日志模块,每个模块的日志格式都是不一样的。甚至就连Web Server这层,有用Apache的,有用Lighttpd的,也有用Nginx的,用的软件版本可能还是不同的。日志格式五花八门,输出的是非结构化的文本字符串,比如Nginx一条日志: 219.136.113.4…
star2017
博客
1年前
4242
0
从日志统计到大数据分析(八)——五代
在上一篇的最后,我把数据处理分成五个阶段,分别是数据采集、数据传输、数据建模/存储、数据统计/分析/挖掘、数据可视化/反馈。这篇主要讲解第一个环节数据采集相关的内容。 如果看过前面几篇,就会体会到我对数据源的重视程度是超乎想象的,认为数据源整好了,数据处理就搞定了一半。如果源头没有整好,后续用再复杂的算法,也不能解决数据缺失和错误所带来的问题,并且会花费许多…
star2017
博客
1年前
4688
0
写给数据分析新手的几点建议
几点想法,分享给刚入门的数据分析师,也跟经验丰富的数据分析师做下探讨。 1.数据是有立场的,立场决定解读 数据对于业务来讲,是KPI的衡量标杆,也是行动指南。但一旦涉及到立场和方向性的东西,必然有利益触发点的问题。比如同样的一次活动的网站转化率是1.2%,是好还是坏?这是做数据分析第一步要进行的定位,也就是我们所说的下结论。好坏的区分在于比较,如何比较呢?我…
star2017
博客
1年前
3985
0
游戏数据分析:日活跃与核心用户挖掘
究竟什么是活跃?
star2017
博客
1年前
525
0
拥有敏捷数据交付平台(DataMaster)是怎样一种体验?
DataMaster划分为六个中心,分别为采集交换中心、取数操作中心、数据开发中心、敏捷挖掘中心、数据开放中心及运营管理中心。
star2017
博客
1年前
3215
0
大数据如何为电子签名提供更好的解决方案?
大数据通过提供各种更好的电子签名解决方案,主要改善行业和数字证券。
star2017
博客
1年前
567
0
淘宝云梯分布式计算平台整体架构
以下是淘宝云梯分布式计算平台的整体架构,由数据分析网整理自网络资料,供大家学习参考。
star2017
博客
1年前
3120
0
数据仓库的基本架构
数据仓库本身并不“生产”任何数据,同时自身也不需要“消费”任何的数据,数据来源于外部,并且开放给外部应用。
star2017
博客
1年前
8654
0
优酷背后的大数据秘密
在本文中优酷数据中台的数据技术专家门德亮分享了优酷从Hadoop迁移到阿里云MaxCompute后对业务及平台的价值。
star2017
博客
1年前
2507
0
如何进行有效的大数据处理、分析?
大数据和分析法的质量,不如分析的目的来得重要。最有趣的紧张态势和争论,始终围绕着组织是否会因使用分析法而获得最大报酬,以使既有的流程行为(process behavior)更完善,或者改变公司人员的行为。
star2017
博客
1年前
7192
0
揭秘程序员大佬十二时辰:夜间灵感喷涌,甚至全年无休
作为一名程序员,你的效率什么时候最高?
star2017
博客
1年前
4371
0
股票交易实时分析系统的架构与算法
【摘要】如果能在一台服务器上应用人工智能和机器学习算法处理每天的股票交易,而自己则在夏威夷的海滩上享受生活,那将是多么惬意呀。虽然股票价格的变化受多种因素的影响,世上也没有免费的午餐,但是有些公司依然能够借助于开源的机器学习算法和数据分析平台得到“更好、更健康、更便宜的午餐”。本文搜集并整理了一些如何实现实时股票分析系统的资料,从架构和算法两个层面给出了一种…
star2017
博客
1年前
825
0
大话Hadoop1.0、Hadoop2.0与Yarn平台
一篇关于Hadoop1.0、Hadoop2.0与Yarn的博文,从整体上把握三者之间的联系
star2017
博客
1年前
9067
0
1
...
261
262
263
...
465
本文目录
热门标签
广告位
热门文章
1.
SpringBoot2实践系列(六):集成监控模块Actuator详解
2.
如何学习Python数据科学(2018)
3.
31个与大数据有关的非常不错的资源和文章(附全链接)
4.
这可能是人工智能、机器学习和大数据领域覆盖最全的一份速查表
5.
微服务应用(十五):一台服务器重启导致Redis集群宕机所有业务不可用问题分析
6.
史上最全的“大数据”学习资源(上)
阿里云新老用户最新优惠
阿里云新老用户最新优惠
最新发布
1.
分析binlog日志都是哪些操作
2.
连接配置了SSL的达梦数据库
3.
修改jar里的配置文件
4.
linux定时工具crontab使用
5.
桌面看盘工具dstock V2.0发布
6.
Claude Code自动代码工具安装配置使用
最新评论
签到
?
签到
签到
签到,学习
签到