1、数据分布(Data Distribution)
在本教程的前面,我们仅在示例中使用了少量数据,只是为了了解不同的概念。
在现实世界中,数据集要大得多,但至少在项目的早期阶段,很难收集现实世界的数据。
我们如何获取大数据集?
为了创建用于测试的大数据集,我们使用Python模块NumPy,该模块附带了许多创建任意大小的随机数据集的方法。
例如:
创建一个包含250个介于0和5之间的随机浮点数的数组:
import numpyx = numpy.random.uniform(0.0, 5.0, 250)print(x)
2、直方图
为了可视化数据集,我们可以对收集到的数据绘制直方图。
我们将使用Python模块Matplotlib绘制直方图。
在我们的Matplotlib教程中了解Matplotlib模块。
例如:
绘制直方图:
import numpyimport matplotlib.pyplot as pltx = numpy.random.uniform(0.0, 5.0, 250)plt.hist(x, 5)plt.show()
Result:
直方图解释
我们使用上例中的数组绘制5条柱状图。
第一栏代表数组中介于0和1之间的值。
第二栏代表1到2之间的数值。
这给了我们这个结果:
- 52个值介于0和1之间
- 48个值介于1和2之间
- 49个值介于2和3之间
- 51个值在3和4之间
- 50个值介于4到5之间
注意:数组值是随机数,在计算机上不会显示完全相同的结果。
3、大数据分布
包含250个值的数组被认为不是很大,但是现在您知道了如何创建一组随机值,并且通过更改参数,可以创建所需大小的数据集。
例如:
创建一个具有100000个随机数的数组,并使用具有100条的直方图显示它们:
import numpyimport matplotlib.pyplot as pltx = numpy.random.uniform(0.0, 5.0, 100000)plt.hist(x, 100)plt.show()
免责声明:以上内容(如有图片或视频亦包括在内)有转载其他网站资源,如有侵权请联系删除
-
设计总结|如何更好地表达活动品牌?
-
谈谈“目标思维”的落地
编辑导读:我们在做数据分析之前,一定要搞清楚需求方的目标到底是什么,要根据目标来重新定义业务方提出的问题,这就是目标思维。目标思维有多重要呢?应该如何落地呢...
-
在线教育平台竞品分析:网易云课堂vs腾讯课堂
本文从移动端出发,对当前比较热门的两款在线教育平台软件-网易云课堂和腾讯课堂进行比较和分析,不足之处还请大家多提意见。 市场分析 随着国内互联网技术的发展和移...
-
即学即用|父亲节活动的4种运营策略
-
B端产品经理和体验设计师的工作职责边界梳理
-
豆果美食电商分支用户体验报告及建议
-
数据分析师如何提高工作效率
在我们的日常工作中,提高工作效率是每个岗位都需要实现的,在工作中,面对比较凌乱的事情时,首先我们需要梳理清楚,按重要级进行开展;本文作者分享了关于...
-
2016中国云计算SaaS移动办公平台年度综合报告
-
网易大布局教育事业:网易公开课、网易云课堂和MOOC分析
-
一篇文章搞懂语音交互的来龙去脉