第3章 · 播客 第12集
数据库系统 · 数据挖掘、NoSQL、大数据与全章收束
🎙️ 本集播客:第12集(末集):数据挖掘的定义与五类功能、六种常用技术、六步流程与三类人员,NoSQL 四大优点与键值对存储的本质,大数据四个 V 与 PB/EB/ZB 换算,最后把第 3 章全章必背清单一次拉通,引出第 4 章计算机网络。 语音由微软 Edge 神经网络语音预生成(女声·晓伊,男声·云希)。点击下方任意对话可直接从该句开始播,当前句朗读时下一句已预先加载,无缝衔接。
明
阿明
小雅姐,最后一集了。数据挖掘到底是干嘛的?跟查询报表有什么不一样?
雅
小雅
先背技术角度定义:数据挖掘就是从大量的、不完全的、有噪声的、模糊的、随机的实际应用数据中,提取隐含在其中的、人们事先不知道的、但又是潜在有用的信息和知识的过程。这个定义包括好几层含义:数据源必须是真实的、大量的、含噪声的;发现的是用户感兴趣的知识;发现的知识要可接受、可理解、可运用;并不要求发现放之四海而皆准的知识,仅支持特定的发现问题。
雅
小雅
然后是你问的本质区别,原文原句:数据挖掘与传统的数据分析如查询、报表、联机应用分析的本质区别是数据挖掘是在没有明确假设的前提下去挖掘信息、发现知识。数据挖掘所得到的信息应具有先前未知、有效和可实用三个特征。先前未知的信息是指预先未曾预料到的,即要发现那些不能靠直觉发现的信息或知识,甚至是违背直觉的,挖掘出的信息越是出乎意料,就可能越有价值。最典型的例子就是一家连锁店通过数据挖掘发现了小孩纸尿布和啤酒之间有着惊人的联系。
明
阿明
纸尿布和啤酒,这个例子我记得。支持数据挖掘的三种基础技术呢?还有别的总起性的句子吗?
雅
小雅
数据挖掘技术在商业应用中已经可以马上投入使用,因为对这种技术进行支持的三种基础技术已经发展成熟,它们是海量数据搜集、强大的多处理器计算机和数据挖掘算法。三个名字配齐。还有一句商业角度的描述:数据挖掘是一种新的商业信息处理技术,其主要特点是对商业数据库中的大量业务数据进行抽取、转换、分析和其他模型化处理,从中提取辅助商业决策的关键性数据。简而言之,数据挖掘其实是一种深层次的数据分析方法。
明
阿明
五类功能逐个来吧。
雅
小雅
五类:自动预测趋势和行为,典型例子是市场预测问题,使用过去有关促销的数据来寻找未来投资中回报最大的用户;关联分析,若两个或多个变量的取值之间存在某种规律性就称为关联,关联可分为简单关联、时序关联、因果关联,关联分析生成的规则带有可信度;聚类,数据库中的记录可被划分为一系列有意义的子集,聚类增强了人们对客观现实的认识,是概念描述和偏差分析的先决条件;概念描述,分为特征性描述和区别性描述,前者描述某类对象的共同特征,后者描述不同类对象之间的区别;偏差检测,从数据库中检测异常记录,基本方法是寻找观测结果与参照值之间有意义的差别,偏差包括分类中的反常实例、不满足规则的特例、观测结果与模型预测值的偏差、量值随时间的变化等。
明
阿明
关联分析的三分「简单、时序、因果」,概念描述的三分「特征性、区别性」,这两组最容易混。给我各自的例子。
雅
小雅
关联分析的原文例子:一个开设储蓄账户的客户很可能同时进行债券交易和股票交易,购买纸尿裤的男顾客经常同时购买啤酒。概念描述:生成一个类的特征性描述只涉及该类对象中所有对象的共性;生成区别性描述的方法很多,如决策树方法、遗传算法等。
雅
小雅
对,还有聚类和分类的区别也在常用技术里等着你。常用技术原文列了六种:关联分析、序列分析、分类、预测、聚类分析及时间序列分析。分类分析通过分析具有类别的样本的特点得到决定样本属于各种类别的规则或方法,其主要方法有基于统计学的贝叶斯方法、神经网络方法、决策树方法及支持向量机等。预测与分类类似,但预测是根据样本的已知特征估算某个连续类型的变量的取值,而分类则只是用于判别样本所属的离散类别,预测常用的技术是回归分析——连续用预测、离散用分类,这个分界是必考的。
雅
小雅
补齐另外几种:序列分析主要用于发现一定时间间隔内接连发生的事件,其依据除了统计上的概率之外还要加上时间的约束。聚类分析是根据物以类聚的原理,将本身没有类别的样本聚集成不同的组,主要依据是聚到同一个组中的样本应该彼此相似,属于不同组的样本应该足够不相似。时间序列分析的是随时间而变化的事件序列,目的是预测未来发展趋势,或者寻找相似发展模式或者是发现周期性发展规律。
明
阿明
数据挖掘的流程呢?我记得是六步。三类人员是不是也在这段?
雅
小雅
六步:问题定义,最先的也是最重要的要求就是熟悉背景知识,弄清用户的需求;建立数据挖掘库,一般建议把要挖掘的数据都收集到一个数据库中,而不是采用原有的数据库或数据仓库;分析数据,从数据集中找出规律和趋势,用聚类分析区分类别;调整数据,针对问题的需求对数据进行增删,组合或生成一个新的变量;模型化,这一步是数据挖掘的核心环节,一般运用神经网络、决策树、数理统计、时间序列分析等方法来建立模型;评价和解释,评估确定哪些是有效的有用的模式,检验办法有用原先挖掘库的数据、另找一批数据、实际运行环境中取出新鲜数据三种。
明
阿明
三类人员紧跟在流程后面吧?
雅
小雅
业务分析人员,要求精通业务,能够解释业务对象并确定业务需求;数据分析人员,精通数据分析技术并较熟练地掌握统计学,把业务需求转化为数据挖掘的各步操作;数据管理人员,精通数据管理技术,从数据库或数据仓库中收集数据。数据挖掘是一个多种专家合作的过程,也是一个在资金上和技术上高投入的过程,要反复进行。
明
阿明
NoSQL 这一节,为什么突然不要关系模型了?web2.0 不是照样跑在 MySQL 上吗?
雅
小雅
NoSQL 即 Not Only SQL,可直译不仅仅是 SQL,它打破了长久以来关系型数据库与 ACID 理论大一统的局面。NoSQL 数据存储不需要固定的表结构,通常也不存在连接操作,在大数据存取上具备关系型数据库无法比拟的性能优势。
雅
小雅
存储机理的对比也要会讲:关系型数据库的表存储格式化的数据结构,每个元组字段的组成都一样,即使不是每个元组都需要所有的字段,数据库也会为每个元组分配所有的字段,这便于表与表之间进行连接等操作,但也是关系型数据库性能瓶颈的一个因素。而非关系型数据库以键值对存储,结构不固定,每一个元组可以有不一样的字段,可以减少一些时间和空间的开销。
明
阿明
NoSQL 的优点四条?
雅
小雅
四条:第一,易扩展,NoSQL 数据库种类繁多,但一个共同的特点都是去掉关系数据库的关系型特性,数据之间无关系,这样就非常容易扩展。第二,大数据量,高性能,都具有非常高的读写性能,尤其在大数据量下同样表现优秀,原文特别解释了缓存粒度:一般 MySQL 使用 Query Cache,每次表一更新 Cache 就失效,是一种大粒度的 Cache;
雅
小雅
而 NoSQL 的 Cache 是记录级的,是一种细粒度的 Cache,所以性能高很多。第三,灵活的数据模型,无须事先为要存储的数据建立字段,随时可以存储自定义的数据格式。第四,高可用,在不太影响性能的情况下就可以方便地实现高可用的架构,比如 Cassandra、HBase 模型,通过复制模型也能实现高可用。
明
阿明
缺点呢?总不能十全十美。
雅
小雅
原文一句:NoSQL 也存在很多缺点,例如并未形成一定标准,各种产品层出不穷,内部混乱,各种项目还需时间来检验,缺乏相关专家技术的支持等。判断题问「NoSQL 已经形成统一标准」,答否。
明
阿明
大数据的 4 个 V,最后一块。
雅
小雅
先背总定义:大数据指无法在一定时间范围内用常规软件工具进行捕捉、管理和处理的数据集合,是需要新处理模式才能具有更强的决策力、洞察发现力和流程优化能力的海量、高增长率和多样化的信息资产。四个 V 逐个来。Volume 指数据体量巨大,从 TB 级别跃升到 PB 级别、EB 级别,甚至于达到 ZB 级别,换算关系必须会:1PB 等于 1024TB,1EB 等于 1024PB,1ZB 等于 1024EB。参照数也记两个:人类生产的所有印刷材料的数据量是 200PB,历史上全人类说过的所有话的数据量大约是 5EB。
雅
小雅
Variety 指数据类型繁多,数据被分为结构化数据和非结构化数据,非结构化数据越来越多,包括网络日志、音频、视频、图片、地理位置信息等。Value 指价值密度低,价值密度的高低与数据总量的大小成反比,原文例子:一部 1 小时的视频,在连续不间断的监控中,有用数据可能仅有 1 到 2 秒。
雅
小雅
Velocity 指处理速度快,这是大数据区分于传统数据挖掘的最显著特征,根据 IDC 的数字宇宙的报告,预计到 2020 年全球数据使用量将达到 35.2ZB。注意「最显著特征」这个头衔只给了 Velocity,判断题常拿 Volume 来冒充。
明
阿明
大数据处理的关键技术有哪些?
雅
小雅
一般包括:大数据采集、大数据预处理、大数据存储及管理、大数据分析及挖掘、大数据展现和应用,其中展现和应用包括大数据检索、大数据可视化、大数据应用、大数据安全等。应用领域一句话带过:可以在各行各业得以应用,如金融服务、医疗保健、零售业、制造业、政府机构等。
明
阿明
好了,全章过完,给我拉通一个总清单吧。
雅
小雅
全章必背,分块走。第一块模式与模型:三级模式外模式多个、概念模式一个、内模式一个;物理独立性走模式—内模式映射、逻辑独立性走外模式—模式映射,逻辑独立性更难实现;数据模型两大类概念模型 E-R 面向数据库设计、基本模型面向 DBMS 实现,层次用树只能 1:n、网状用有向图、关系用表格。第二块运算与范式:关系代数八种运算,笛卡尔积列加行乘,θ 连接从笛卡尔积选满足条件的元组、等值连接 θ 取等号、自然连接去重复属性,除法配齐才留;
雅
小雅
范式 1NF 属性不可再分、2NF 消除非主属性部分依赖、3NF 消除传递依赖、BCNF 决定因素都包含码;分解守无损连接性和函数依赖保持性;反规范化四技术。第三块设计:四阶段需求分析、概念设计、逻辑设计、物理设计,产物依次是需求说明书、E-R 图、关系模型、内模式;视图集成四冲突同名异义、异名同义、同名不同层次、联系测度冲突;m:n 联系必须单独成表、关键字由两实体标识组成;视图是虚关系、快照是实关系可刷新。
雅
小雅
第四块事务与恢复:ACID 四特性,一旦提交永久有效是持续性;X 锁读写独占、S 锁只读共享;一级封锁防丢失修改、二级加防脏数据、三级加可重复读;两段锁协议保证可串行化但可能死锁;四类故障中介质故障破坏性最大;事务故障和系统故障的恢复都是系统自动完成,Undo 反向逆操作、Redo 正向重做;冷备份停库热备份不停库,恢复先完全备份再按时间从早到晚。第五块分布式:定义三要素数据分布、场地自治、局部加全局应用;六层模式结构、三级透明性分片、位置、局部数据模型;
雅
小雅
与并行数据库最主要区别是场地自治和局部应用。第六块商业智能:数据仓库四大特性面向主题、集成最重要、相对稳定、随时间变化;ROLAP 全在 RDBMS、MOLAP 全在多维库、HOLAP 折中;数据挖掘先前未知有效可实用三特征、纸尿布与啤酒;NoSQL 键值对无固定结构易扩展高性能灵活高可用;大数据四 V 中 Velocity 最显著、1PB 等于 1024TB、1EB 等于 1024PB、1ZB 等于 1024EB。
明
阿明
第 3 章这么一收,数据库这条线完整了。
雅
小雅
对。下一章进入计算机网络:OSI 七层、TCP/IP 协议族、IP 地址与子网划分那些计算题,是架构师的必争之地。第 3 章数据库系统,到此收官,我们第 4 章见。