我的期末复习资料分享,期末10个简答题3h。
云应用 server 大数据 去年原题比较多, it没几个原题
复习方法是首先豆包生成ppt所有知识点中文,其次对照ppt把不重要的部分删掉,最后拿着这份资料对照ppt的原文英文疯狂背诵,每一章让豆包出简答题+英文答案自测。
背诵:理解中文意思能扯一下就可以,关键是重点词汇要记住,跟ppt上英语要一样。
速通的话,记得快一天半就可以(不开小差),整理资料比较花时间。
这门课我觉得很有意思,尤其是实验课使用Tableau进行可视化呈现的时候。
Lecture1A Understanding Big Data
一、基本概念
(一)数据分析(Data Analysis)
(二)数据分析学(Data Analytics)
- 商业环境business:降低运营成本,为战略决策提供支持。
- 科学领域scientific:识别现象成因,提高预测准确性。
- 服务型环境service-based:降低成本,聚焦高质量服务交付。
- 描述性分析(Descriptive Analytics):解答 “发生了什么?”,针对已发生事件,将数据情境化以生成信息。
- 诊断性分析(Diagnostic Analytics):解答 “原因是什么?”,探究过去发生现象的成因cause,确定与现象相关的信息。
- 预测性分析(Predictive Analytics):解答 “将会发生什么?”,预测未来可能发生的事件结果,通过关联强度和规模构建模型。
- 规范性分析(Prescriptive Analytics):解答 “我们应该做什么?”,基于预测性分析结果制定应采取的行动,解释最佳方案及原因。
(三)商业智能(Business Intelligence, BI)
(四)关键绩效指标(Key Performance Indicators, KPI)
二、大数据的特征(五大 V)
(一)容量(Volume)
(二)速度(Velocity)
(三)多样性(Variety)
(四)真实性(Veracity)
- 信号(Signal):有价值,可转化为有意义信息的数据。
- 噪声(Noise):无法转化为信息,无价值的数据。
(五)价值(Value)
三、数据的不同类型
(一)按生成主体分类
- 定义:人类与系统(如在线服务、数字设备)交互产生的数据。
- 示例:社交媒体内容、博客文章、电子邮件、照片分享、即时通讯。
- 定义:软件程序和硬件设备响应现实世界事件而生成的数据。
- 示例:网络日志、传感器数据、遥测数据、智能电表数据、设备使用数据、GPS 数据、XML 数据。
(二)按数据结构分类
- 定义:符合数据模型或模式,通常以表格形式存储in tabular form。
- 用途:捕捉不同实体之间的关系。
- 存储方式:最常存储在关系型数据库中。
- 定义:不符合数据模型或数据模式的数据。
- 占比情况:约占80%。
- 增长特点:增长速度快于结构化数据。
- 示例:视频文件、图像文件、音频文件。
- 定义:具有一定结构化程度和一致性,但非关系型的数据,通常为分层或基于图形的结构hierarchical/graph-based。
- 存储方式:常存储在文本文件中。
- 示例:XML 数据、JSON 数据、传感器数据。
- 定义:提供数据集特征和结构信息的数据。
- 生成主体:主要由机器生成,可附加到数据中。
- 核心作用:对大数据处理、存储和分析至关重要,能提供数据来源及处理过程中的溯源信息。
Lecture2A Business Motivation and Drivers for Big Data Adoptions
一、基本概念
二、业务架构(Business Architecture)
(一)核心定义与作用
(二)涵盖内容
(三)与大数据的关联
(四)组织层级对齐
三、业务流程管理(Business Process Management)
(一)业务流程的核心意义
(二)业务流程管理的作用与相关术语
四、信息通信技术(Information and Communications Technology)
(一)核心驱动因素分类
Lecture3A Big Data Adoption and Planning Considerations
一、组织先决条件(Organization Prerequisites)
- 具备实施、定制、填充和使用大数据解决方案的完善流程sound process。
- 拥有执行上述流程所需的足够技能储备sufficient skillset。
- 需对大数据解决方案目标处理数据的质量quality of data进行评估。
- 必须制定明确的实施路线图roadmap。
二、数据获取(Data Procurement)
三、隐私(Privacy)
- 对数据集进行分析可能泄露组织或个人的机密信息。
- 单独分析看似无害的多个数据集时,若联合分析可能揭示私人信息。
- 可能导致有意或无意的隐私泄露。
- 理解所积累数据的性质the nature of data及相关数据隐私法规data privacy regulations。
- 采用数据标记data tagging和匿名化anonymization等特殊技术。
四、安全(Security)
- 通过身份验证和授权机制via authentication and authorization mechanism,确保数据网络和存储库的充分安全。
- 为不同类别用户建立数据访问级别。
五、数据溯源(Provenance)
- 帮助确定数据的真实性和质量。
- 可用于审计目的。
- 是实现分析结果价值的关键(无溯源的结果难以验证可信度,无法重复则缺乏说服力)。
六、有限的实时支持(Limited Realtime Support)
- 许多开源大数据解决方案和工具以批处理为导向batch-oriented。
- 新一代支持流数据分析的开源实时工具已出现,但多数现有实时数据分析解决方案为专有产品。
七、独特的性能挑战(Distinct Performance Challenges)
八、独特的治理要求(Distinct Governance Requirements)
- 元数据标准化。
- 外部数据监管。
- 数据隐私和数据匿名化相关规范。
- 数据源和分析结果的归档。
- 数据清理和过滤指南的制定。
九、独特的方法论(Distinct Methodology)
十、云计算(Clouds)
十一、大数据分析生命周期(Big Data Analytics Lifecycle)
(一)生命周期核心特点
(二)九阶段
阶段 1:业务案例评估(Business Case Evaluation)
- 启动要求:每个大数据分析生命周期必须以定义明确的业务案例为开端。
- 核心内容:清晰阐述分析的合理性、动机和目标;帮助决策者了解业务资源;识别关键绩效指标(KPI);判断所解决的业务问题是否为真正的大数据问题;明确相关预算。
阶段 2:数据识别(Data Identification)
- 核心任务:确定分析项目所需的数据集及其来源。
- 关键原则:识别更多样化的数据源,可提高发现隐藏模式和关联的概率。
阶段 3:数据获取与过滤(Data Acquisition & Filtering)
- 数据获取:从所有已识别的数据源收集数据。
- 过滤核心:剔除无关数据(噪声),但建议在过滤前存储原始数据集的完整副本。
- 关键操作:通过自动化为内部和外部数据源的数据添加元数据,提升分类和查询效率。
阶段 4:数据提取(Data Extraction)
- 核心问题:部分数据格式与大数据解决方案不兼容。
- 阶段目标:提取异构数据,并将其转换为大数据解决方案可用于分析的格式。
- 转换程度:取决于分析类型和大数据解决方案的能力。
- 示例:从 XML 文档中提取嵌入的评论和用户 ID,无需进一步转换。从单个 JSON 字段中提取用户的经纬度坐标。
阶段 5:数据验证与清理(Data Validation & Cleansing)
- 验证必要性:无效数据会扭曲和伪造分析结果;非结构化数据通常无有效性标识,其复杂性增加了制定验证约束的难度。
- 阶段目标:建立复杂的验证规则,移除所有已知无效数据。
- 实现方式:
- 批处理分析:通过离线 ETL(抽取 – 转换 – 加载)操作实现。
- 实时分析:需要更复杂的内存系统,对到达的数据源数据进行即时验证和清理。
阶段 6:数据聚合与表示(Data Aggregation & Representation)
- 聚合必要性:数据可能分散在多个数据集中,需整合以形成统一视图。
- 聚合难点:数据结构和语义差异导致操作复杂;海量数据使聚合成为耗时耗力的过程。
- 关键考量:需兼顾数据可重用性。
- 实现方式:
- 建立标准化数据结构,作为多种分析技术和项目的通用基础。
- 建立中央标准化分析存储库(如 NoSQL 数据库)。
阶段 7:数据分析(Data Analysis)
- 阶段目标:执行实际分析任务,通常涉及一种或多种分析类型。
- 分析特性:具有迭代性,可简单可复杂。
- 简单场景:查询数据集计算聚合结果用于比较。
- 复杂场景:结合数据挖掘和复杂统计分析技术。
- 分析分类:
- 验证性数据分析(Confirmatory Data Analysis):
- 逻辑类型:演绎法。
- 核心流程:预先提出待调查现象的成因假设,通过数据分析验证或推翻假设,为特定问题提供明确答案。
- 常用方法:数据采样技术。
- 探索性数据分析(Exploratory Data Analysis):
- 逻辑类型:归纳法,与数据挖掘密切相关。
- 核心流程:无预设假设,通过探索数据理解现象成因。
- 验证性数据分析(Confirmatory Data Analysis):
阶段 8:数据可视化(Data Visualization)
- 阶段目标:使用数据可视化技术和工具,以图形化方式呈现分析结果,方便业务用户有效解读。
- 核心价值:业务用户理解结果是数据产生价值的前提。
- 关键要求:结合业务领域背景,选择最合适的可视化技术,可通过多种形式呈现同一结果。
阶段 9:分析结果的利用(Utilization of Analysis Results)
- 阶段目标:确定已处理的分析数据的进一步应用场景。
- 主要应用方向:
- 支持业务决策制定。
- 生成 “模型”。
- 为企业系统提供输入。
- 业务流程优化。
- 触发警报。
Lecture4A Enterprise Technologies and Big Data BI
一、在线事务处理(Online Transaction Processing, OLTP)
二、在线分析处理(Online Analytical Processing, OLAP)
三、提取 – 转换 – 加载(Extract Transform Load, ETL)
- 提取(Extract):从源系统获取所需数据。
- 转换(Transform):通过应用规则修改提取的数据。
- 加载(Load):将转换后的数据插入目标系统。
四、数据仓库(Data Warehouses)
五、数据集市(Data Marts)
六、传统商业智能(Traditional BI)
- 即席报告(Ad-hoc Reports):手动处理数据生成定制报告(a process that involves manually processing data to produce custom-made reports);聚焦业务特定领域;报告详细,通常为表格形式(detailed and often tabular in nature)。
- 仪表板(Dashboards):提供关键业务领域的整体视图(provide a holistic view of key business areas);信息以实时或近实时的周期性间隔生成(generated at periodic intervals in real-time or near-real-time);以图形化方式呈现,使用柱状图、饼图和仪表等(graphical in nature, using bar charts, pie charts and gauges)。
七、大数据商业智能(Big Data BI)
八、传统数据可视化(Traditional Data Visualization)
九、大数据数据可视化(Data Visualization for Big Data)
- 数据兼容性:无缝连接结构化、半结构化和非结构化数据源(can seamlessly connect to structured, semi-structured and unstructured data sources)。
- 数据处理能力:能够处理数百万条数据记录(capable of handling millions of data records)。
- 技术支撑:采用内存分析技术,降低传统磁盘式数据可视化工具的延迟(use in-memory analytical technologies that reduce the latency normally attributed to traditional, disk-based data visualization tools)。
- 聚合(Aggregation):提供跨多个场景的数据整体汇总视图(provides a holistic and summarized view of data across multiple contexts)。
- 下钻(Drill-down):从汇总视图聚焦数据子集,获取目标数据的详细视图(enables a detailed view of the data of interest by focusing in on a data subset from the summarized view)。
- 过滤(Filtering):过滤无关数据,聚焦特定数据集(helps focus on a particular set of data by filtering away the data that is not of immediate interest)。
- 上卷(Roll-up):跨多个类别分组数据,显示小计和总计(groups data across multiple categories to show subtotals and totals)。
- 假设分析(What-if analysis):动态更改相关因素,可视化多种可能结果(enables multiple outcomes to be visualized by enabling related factors to be dynamically changed)。
Lecture6A Big Data Processing Concepts
一、并行数据处理(Parallel Data Processing)
二、分布式数据处理(Distributed Data Processing)
三、Hadoop
四、处理负载(Processing Workloads)
- 批处理负载(Batch):又称离线处理(offline processing),按批次处理数据,存在延迟,响应延迟高(processing data in batches; imposes delays; high-latency responses);通常涉及大量数据,采用顺序读写方式,包含一组读写查询(large quantities of data; sequential read/writes; groups of read or write queries);查询可能复杂且涉及多个连接(queries can be complex with multiple joins);OLAP 系统常处理批处理负载(OLAP systems commonly process batch workloads);战略商业智能和分析是批处理导向的,属于高读密集型任务(strategic BI and analytics are batch-oriented; highly read-intensive tasks)。
- 事务处理负载(Transactional):又称在线处理(online processing),交互式处理数据无延迟,响应延迟低(processed interactively without delay; low-latency responses);涉及少量数据,采用随机读写方式(small amounts of data; random reads and writes);包含的连接数少于商业智能和报告负载(fewer joins than BI and reporting workloads);具有在线属性和企业运营重要性,数据占用空间小(online nature; operational significance to enterprise; smaller data footprint)。
五、集群(Cluster)
六、批处理模式(Processing in Batch Mode)
(一)【很重要】基于 MapReduce 的批处理(Batch Processing with MapReduce)
(二)MapReduce 作业与任务(MapReduce Job and Tasks)
(三)Map 阶段(Map)
(四)Combine 阶段(Combine)
(五)Partition 阶段(Partition)
(六)Shuffle and Sort 阶段(Shuffle and Sort)
(七)Reduce 阶段(Reduce)
(八)MapReduce 算法原理(Understanding MapReduce Algorithms)
七、实时处理模式(Processing in Realtime Mode)
八、SCV 原则(Speed, Consistency and Volume Principle)
Lecture7A Big Data Storage Concepts
一、大数据存储技术(Big Data Storage Technology)
(一)磁盘存储设备(On-Disk Storage Devices)
1. 分布式文件系统(Distributed File Systems)
- 数据存储:支持无模式数据存储(support schema-less data storage)。
- 核心优势:通过复制实现开箱即用的冗余性和高可用性(out of box redundancy and high availability by copying data to multiple locations via replication);具备快速读写能力,满足大数据的速度特征(fast read/write capability; addresses the velocity characteristic of Big Data)。
- 适用场景:适合少量大型文件的顺序访问(work best with fewer but larger files accessed in a sequential manner);多小文件需合并为单个文件以优化存储和处理(multiple smaller files are generally combined into a single file);适用于流式数据访问,无随机读写场景(ideal for streaming mode with no random reads and writes)。
- 局限性:不适合大量小文件存储,会产生过多磁盘寻道操作,降低数据访问速度(not ideal for large number of small files; creates excessive disk-seek activity)。
- 支持数据类型:非结构化数据和半结构化数据(unstructured data; semi-structured data)。
2. 关系型数据库管理系统(RDBMS Databases)
- 适用场景:擅长处理涉及少量数据、具有随机读写属性的事务性负载(good for transactional workloads involving small amounts of data with random read/write properties)。
- 扩展方式:采用垂直扩展而非水平扩展,成本更高且具有破坏性(employ vertical scaling, not horizontal scaling; more costly and disruptive)。
- 集群特性:部分关系型数据库(如 IBM DB2 pureScale、Oracle RAC 等)可在集群上运行,但仍使用共享存储,存在单点故障风险(use shared storage that can act as a single point of failure)。
- 分片机制:需手动分片,主要依赖应用程序逻辑,多分片数据处理复杂(need to be manually sharded using application logic; complicates data processing from multiple shards)。
- 数据约束:要求数据遵循模式(schema),不直接支持半结构化和非结构化数据存储(require data to adhere to a schema; not directly support semi-structured and unstructured data);数据插入或更新时需验证模式一致性,引入延迟(schema conformance is validated; introduces latency)。
- 大数据场景局限性:不适合作为大数据解决方案的主存储设备(not useful as the primary storage device in a Big Data solution environment)。
3. NoSQL 数据库(Not-only SQL Databases)
- 核心定义:用于开发下一代非关系型数据库的技术,具有高可扩展性和容错性(technologies for next generation nonrelational databases; highly scalable and fault-tolerant)。
(1)核心特征(Characteristics)
- 无模式数据模型(schema-less data model)、横向扩展而非纵向扩展(scale out rather than scale up)、高可用性(highly available)、低运营成本(lower operational costs)。
- 最终一致性(eventual consistency)、遵循 BASE 模型而非 ACID 模型(BASE, not ACID)。
- API 驱动的数据访问(API driven data access)、自动分片和复制(auto sharding and replication)、集成缓存(integrated caching)。
- 支持分布式查询(distributed query support)、多语言持久化(polyglot persistence)、聚焦聚合(aggregate-focused)。
(2)产生背景(Rationale)
- 容量(Volume):满足海量数据存储需求,通过横向扩展和低成本通用服务器控制成本(provide scale out capability using inexpensive commodity servers)。
- 速度(Velocity):采用 “读取时模式”(schema-on-read)而非 “写入时模式”(schema-on-write),支持快速写入;高可用性避免节点或网络故障导致的写入延迟(enable fast writes; ensure no write latency due to node or network failure)。
- 多样性(Variety):支持半结构化、非结构化数据及不完整数据存储;支持无模式数据和模式演进(store semi-structured and unstructured data; support schema evolution)。
(3)四大类型(Types)
|
类型 |
核心特征 |
适用场景 |
不适用场景 |
示例 |
|
键值型(Key-value) |
以键值对形式存储,类似哈希表;支持集合 / 桶组织数据;单个集合可容纳多种数据格式(store as key-value pairs; like hash tables; support collections/buckets; single collection holds multiple data formats) |
非结构化数据、高性能读写、值为独立实体、简单值、简单查询、应用层操作(unstructured data; high performance read/writes; standalone value; simple values/queries; manipulated at application layer) |
按值搜索、网络关系查询、需更新值的单个属性(searching by value; network relationships; update individual attributes of value) |
Riak、Redis、Amazon Dynamo DB |
|
文档型(Document) |
键值对存储,值为可查询文档;支持复杂嵌套结构;值可识别、自描述、可聚合;支持部分更新和索引(value is a queryable document; complex nested structure; value-aware, self-describing, aggregable; support partial updates and indexes) |
半结构化文档数据、模式演进、部分更新、文档字段搜索、序列化对象存储(semi-structured document-oriented data; schema evolution; partial update; search document fields; stored serialized object) |
多文档更新、多文档操作、文档结构一致、值非自描述、二进制数据存储(multiple documents update/operations; consistent document structure; non-self-describing value; binary data storage) |
MongoDB、CouchDB、Terrastore |
|
列族型(Column-family) |
类似传统 RDBMS,将相关列分组为列族;每行可拥有不同列集,支持灵活模式(group related columns into column-families; each row has different columns; flexible schema) |
实时随机读写、每行含大量相关列、模式演进、特定字段常一起访问、高效存储、支持增删改查(realtime random read/write; large number of interrelated columns per row; schema evolution; frequently accessed fields together; efficient storage; insert/select/update/delete) |
关系型数据访问、ACID 要求、二进制数据、SQL 兼容查询、频繁查询(relational data access; ACID; binary data; SQL-compliant queries; frequent queries) |
Cassandra、HBase、Amazon SimpleDB |
|
图型(Graph) |
存储互联实体,重点关注实体间关联而非实体结构(persist inter-connected entities; emphasize linkages between entities) |
互联实体、基于关系查询实体、查询互联实体组、计算实体间距离、数据挖掘(interconnected entities; query by relationship; query groups of interconnected entities; find distances between entities; data mining) |
大量节点 / 边更新、大量属性或嵌套数据、二进制存储、基于属性查询(large number of node/edge updates; large number of attributes/nested data; binary storage; queries based on attributes) |
Neo4J、Infinite Graph、OrientDB |
4. NewSQL 数据库(NewSQL Databases)
- 核心优势:融合 RDBMS 的 ACID 特性与 NoSQL 的可扩展性和容错性(combine ACID properties of RDBMS with scalability and fault tolerance of NoSQL)。
- 关键特征:支持 SQL 兼容语法用于数据定义和操作;采用逻辑关系数据模型存储数据(support SQL compliant syntax; use logical relational data model)。
- 适用场景:高交易量 OLTP 系统(如银行系统);实时分析(如运营分析),部分实现利用内存存储(develop OLTP systems with high transaction volumes; realtime analytics; leverage in-memory storage)。
- 过渡优势:支持 SQL,便于从传统 RDBMS 向高可扩展数据库迁移(easier transition from traditional RDBMS due to SQL support)。
- 示例:VoltDB、NuoDB、InnoDB。
(二)内存存储设备(In-Memory Storage Devices)
1. 内存数据网格(In-Memory Data Grids, IMDGs)
- 数据存储:以键值对形式存储在多个节点的内存中,键和值可为任意序列化的业务对象或应用数据;支持无模式存储,可存储半结构化 / 非结构化数据(store as key-value pairs across multiple nodes; keys/values are serialized business objects/application data; support schema-less storage for semi/unstructured data)。
- 数据访问:通过 API 提供数据访问(data access via APIs)。
- 核心功能:支持复杂事件处理(CEP),基于发布 – 订阅消息模型实现持续查询(continuous querying/active querying);注册事件过滤器,数据操作满足过滤条件时通知订阅客户端(register event filters; inform subscribing clients when filter is satisfied)。
- 部署特性:可部署在云环境中,支持存储需求增减时自动横向扩展或缩减(deploy in cloud; auto scale out/in based on storage demand)。
- 数据同步策略:
- 读透(Read-through):IMDG 中未找到键值时,从后端磁盘存储同步读取,插入 IMDG 后返回客户端;后续请求直接由 IMDG 响应(read from backend on-disk storage if not found in IMDG; insert into IMDG and return to client; subsequent requests served by IMDG),同步特性可能引入读取延迟(may introduce read latency)。
- 写透(Write-through):对 IMDG 的写入操作同步、事务性地写入后端磁盘存储;后端写入失败则回滚 IMDG 更新(write to backend on-disk storage synchronously and transactionally; rollback IMDG update if backend write fails),确保数据一致性但引入写入延迟(ensures data consistency but introduces write latency)。
- 写回(Write-behind):对 IMDG 的写入操作异步、批量写入后端磁盘存储(write to backend on-disk storage asynchronously in batch),可能导致短期数据不一致(temporary data inconsistency)。
- 预刷新(Refresh-ahead):主动异步刷新频繁访问且未过期的值;值过期后,同步从后端存储读取并更新 IMDG(automatically refresh frequently accessed unexpired values asynchronously; read synchronously from backend and update IMDG if expired)。
2. 内存数据库(In-Memory Databases, IMDBs)
- 核心定位:采用数据库技术,利用 RAM 性能克服磁盘存储的运行时延迟(employ database technology; leverage RAM performance to overcome on-disk storage latency)。
- 数据操作:支持 SQL 查询,客户端可直接操作返回的数据,无需反序列化(support SQL queries; client manipulates returned data without deserialization)。
- 特色功能:支持持续查询,注册条件查询后,数据满足条件时向客户端发送更新事件(support continuous queries; send update events to clients when data meets query conditions)。
二、大数据分析技术(Big Data Analysis Techniques)
(一)定量分析(Quantitative Analysis)
(二)定性分析(Qualitative Analysis)
(三)数据挖掘(Data Mining)
(四)统计分析(Statistical Analysis)
- A/B 测试(A/B Testing):又称拆分测试或桶测试(split or bucket testing),比较同一元素的两个版本,基于预定义指标确定更优版本(compares two versions of an element to determine superiority based on pre-defined metric);当前版本为控制版本(control version),修改版本为处理版本(treatment);同时进行实验,记录观测结果(conduct experiments simultaneously; record observations);广泛应用于营销领域,也可用于科学领域优化流程或产品(most often used in marketing; also used in scientific domains to improve processes/products)。
- 相关性分析(Correlation):确定两个变量是否相关及相关关系类型的分析技术(determines whether two variables are related and their relationship type);相关系数为 + 1 时呈强正相关(one variable increases, the other increases);为 0 时无相关关系(no relationship);为 – 1 时呈强负相关(one variable increases, the other decreases)。
- 回归分析(Regression):探索数据集中因变量与自变量关系的分析技术(explores how a dependent variable is related to an independent variable);线性回归(Linear regression)表示恒定变化率(constant rate of change);非线性回归(Non-linear regression)表示可变变化率(variable rate of change)。
(五)机器学习(Machine Learning)
- 分类(Classification):监督学习技术(supervised learning technique),将数据分类到已知类别中(classify data into previously learned categories);分为两步:输入已分类 / 标记的训练数据(feed labelled training data),使系统理解类别;输入未知但相似的数据进行分类(feed unlabelled similar data for classification)。
- 聚类(Clustering):无监督学习技术(unsupervised learning technique),将数据划分为不同组,组内数据具有相似属性(divide data into groups with similar properties);无需预先学习类别,类别基于数据分组隐式生成(no prior category learning; categories implicitly generated based on data groupings);应用于未知文档分类、个性化营销(categorization of unknown documents; personalized marketing)。
- 异常检测(Outlier Detection):发现与数据集中其他数据显著不同或不一致的数据的过程(find data significantly different from/inconsistent with the rest of the dataset);可通过散点图可视化突出异常数据点(visualized via scatter graphs)。
- 过滤(Filtering):从大量项目中自动筛选相关项目的过程(automated process of finding relevant items from a pool of items);可基于用户自身行为或多用户行为匹配进行筛选(filter based on user’s own behaviour or multiple users’ behaviour matching)。
(六)语义分析(Semantic Analysis)
- 自然语言处理(Natural Language Processing, NLP):计算机理解人类自然语言( speech and text)的能力(computer’s ability to comprehend human speech and text as naturally understood by humans)。
- 文本分析(Text Analytics):应用数据挖掘、机器学习和自然语言处理技术,从非结构化文本中提取价值(specialized analysis of unstructured text using data mining, machine learning and NLP);实现文本发现而非仅搜索(enables text discovery rather than just search)。
- 情感分析(Sentiment Analysis):专门的文本分析形式,聚焦确定个人的偏见或情绪(specialized text analysis focusing on determining individuals’ bias or emotions);基于自然语言语境分析文本作者的态度及情绪强度(analyzes text context to determine author’s attitude and emotion intensity)。
(七)可视化分析(Visual Analysis)
- 热力图(Heat Maps):通过颜色编码表达模式、数据构成(部分 – 整体关系)和地理分布的有效技术(effective for expressing patterns, data compositions via part-whole relations and geographic distributions);矩阵型热力图用颜色编码单元格值(color-code cells in a matrix);地理热力图用颜色编码或阴影表示不同区域的主题数据(color-code/shade regions or superimpose colored points/shapes)。
- 时间序列图(Time Series Plots):分析定期记录的数据(analyze data recorded over periodic intervals);通常采用折线图,X 轴为时间,Y 轴为记录的数据值(line chart with time on X-axis and data value on Y-axis)。
- 网络图(Network Graphs):描绘相互关联的实体集合(depicts an interconnected collection of entities);应用于社交网络分析等场景,可预测实体间潜在关联(used in social network analysis; predict potential relationships between entities)。
- 空间数据映射(Spatial Data Mapping):分析基于位置的数据,发现实体间的地理关系和模式(analyze location-based data to find geographic relationships and patterns);应用于目标营销等场景(used for targeted marketing)。
Lecture8A Big Data Analysis Techniques
一、集群(Clusters)
二、文件系统与分布式文件系统(File Systems and Distributed File Systems)
(一)文件系统(File Systems)
(二)分布式文件系统(Distributed File Systems)
三、NoSQL 数据库(Not-only SQL Databases)
四、分片与复制(Sharding and Replication)
(一)分片(Sharding)
- 所有分片共享相同的模式,共同构成完整数据集。
- 对客户端通常透明(非强制要求),实现系统容量的水平扩展。
- 优化读写性能:每个节点仅负责部分数据,大幅提升读写速度。
- 需结合查询模式设计分片,避免分片成为性能瓶颈(如跨分片查询会降低性能)。
- 数据本地化:将常用访问数据集中存储在单个分片,缓解跨分片查询问题。
(二)复制(Replication)
- 主从复制(master-slave)
- 架构:节点分为主节点和从节点,所有写入操作(插入、更新、删除)均提交至主节点,读取操作可从从节点执行。
- 适配场景:适用于读密集型负载,通过增加从节点横向扩展读能力;写入操作由主节点协调,保证写入一致性。
- 局限性:写入性能随写入量增加而下降;主节点故障时,读操作可通过从节点继续,但写入操作受影响。
- 读一致性问题:主节点更新后未同步至从节点时,从节点读取会出现不一致;可通过投票机制解决(多数从节点数据一致则判定为有效)。
- 对等复制(Peer-to-Peer)
- 架构:所有节点地位平等,无主次关系,每个节点(称为对等节点)均能处理读写操作,写入操作会复制到所有对等节点。
- 一致性策略:
- 悲观并发控制:通过锁定确保同一记录同一时间仅能更新一次,牺牲可用性保障一致性。
- 乐观并发控制:不锁定数据,允许短期不一致,更新传播完成后最终达成一致性,保障数据库可用性。
- 读一致性:可通过投票机制确保(多数对等节点数据一致则判定为有效)。
(三)分片与复制的组合
- 分片 + 主从复制
- 架构:多个分片作为从节点归属单个主分片,主分片本身也是一个分片;单个从分片仅受一个主分片管理。
- 一致性保障:主分片维护写入一致性。
- 故障影响:主分片故障或网络中断时,写入操作的容错性受影响;分片副本存储在多个从节点,保障读操作的可扩展性和容错性。
- 分片 + 对等复制
- 架构:每个分片复制到多个对等节点,每个对等节点仅负责整体数据集的子集。
- 核心优势:实现更高的可扩展性和容错性;无主节点设计,不存在单点故障,支持读写操作的故障容忍。
五、CAP 定理(Consistency, Availability, and Partition tolerance Theorem)
- 一致性(Consistency):从任意节点读取的数据在多个节点间保持一致。
- 可用性(Availability):任何读写请求都能得到成功或失败的响应。
- 分区容忍性(Partition tolerance):数据库系统能容忍通信中断导致的集群分裂(分成多个孤立部分),仍能正常处理读写请求。
- 分布式数据库添加节点可提升可扩展性和容错性,但会挑战一致性;节点增多导致通信延迟,影响可用性。
- 分区容忍性是分布式数据库的必备特性(通信中断虽罕见但不可避免),因此实际选择通常在 “一致性 + 分区容忍性(C+P)” 和 “可用性 + 分区容忍性(A+P)” 之间,具体取决于系统需求。
六、ACID 原则
- 原子性(Atomicity):事务中的所有操作要么全部成功,要么全部失败;部分成功的操作会回滚,恢复系统至事务执行前状态。
- 一致性(Consistency):事务执行前后,数据库始终保持一致状态;仅符合数据库模式约束的数据才能写入数据库。
- 隔离性(Isolation):事务执行结果在事务完成前,对其他操作不可见,避免并发操作相互干扰。
- 持久性(Durability):事务提交后,结果永久有效,即使发生系统故障也不会丢失,无法回滚。
七、BASE 原则
- 基本可用(basically available):数据库即使发生分区(如网络故障),仍能提供部分服务,保障核心可用性。
- 软状态(soft state):数据库读取时可能处于不一致状态,同一数据多次读取结果可能不同;因数据会自动更新以达成一致性,无需用户介入(与最终一致性密切相关)。
- 最终一致性(eventual consistency):写入操作后,不同客户端立即读取可能得到不一致结果;待更新传播至所有节点后,数据库最终达成一致状态;达成一致前,数据库处于软状态。


