联系我们
 课程时长 35 小时

课程大纲

每节课2小时

第1天:第1节:政府大数据商业智能的业务概述

  • 来自NIH、DoE的案例研究
  • 政府机构的大数据采用率以及他们如何围绕大数据预测分析调整未来运营
  • 在DoD、NSA、IRS、USDA等领域的广泛应用领域
  • 大数据与遗留数据的接口
  • 基本理解预测分析中的使能技术
  • 数据集成和仪表板可视化
  • 欺诈管理
  • 业务规则/欺诈检测生成
  • 威胁检测和剖析
  • 大数据实施的成本效益分析

第1天:第2节:大数据简介-1

  • 大数据的主要特征-体积、多样性、速度和真实性。用于体积的MPP架构。
  • 数据仓库-静态模式,缓慢演化的数据集
  • MPP数据库,如Greenplum、Exadata、Teradata、Netezza、Vertica等。
  • 基于Hadoop的解决方案-对数据集结构没有条件。
  • 典型模式:HDFS、MapReduce(crunch)、从HDFS检索
  • 批处理-适合分析/非交互式
  • 体积:CEP流数据
  • 典型选择-CEP产品(例如Infostreams、Apama、MarkLogic等)
  • 不太生产就绪-Storm/S4
  • NoSQL数据库-(列式和键值):最适合作为数据仓库/数据库的分析辅助

第1天:第3节:大数据简介-2

NoSQL解决方案

  • KV存储- Keyspace、Flare、SchemaFree、RAMCloud、Oracle NoSQL Database (OnDB)
  • KV存储- Dynamo、Voldemort、Dynomite、SubRecord、Mo8onDb、DovetailDB
  • KV存储(分层)- GT.m、Cache
  • KV存储(有序)- TokyoTyrant、Lightcloud、NMDB、Luxio、MemcacheDB、Actord
  • KV缓存- Memcached、Repcached、Coherence、Infinispan、EXtremeScale、JBossCache、Velocity、Terracoqua
  • 元组存储- Gigaspaces、Coord、Apache River
  • 对象数据库- ZopeDB、DB40、Shoal
  • 文档存储- CouchDB、Cloudant、Couchbase、MongoDB、Jackrabbit、XML-Databases、ThruDB、CloudKit、Prsevere、Riak-Basho、Scalaris
  • 宽列存储- BigTable、HBase、Apache Cassandra、Hypertable、KAI、OpenNeptune、Qbase、KDI

数据多样性:大数据数据清理问题简介

  • RDBMS-静态结构/模式,不利于敏捷、探索性环境。
  • NoSQL-半结构化,在存储数据之前无需精确模式即可存储数据
  • 数据清理问题

第1天:第4节:大数据简介-3:Hadoop

  • 何时选择Hadoop?
  • 结构化-企业数据仓库/数据库可以存储大量数据(但有成本),但强加结构(不利于主动探索)
  • 半结构化数据-使用传统解决方案(DW/DB)难以处理
  • 仓储数据=巨大努力,实施后也是静态的
  • 对于数据的多样性和体积,在商品硬件上处理-HADOOP
  • 创建Hadoop集群所需的商品硬件

MapReduce/HDFS简介

  • MapReduce-在多个服务器上分布式计算
  • HDFS-使数据本地可用于计算过程(具有冗余)
  • 数据-可以是非结构化/无模式的(不像RDBMS)
  • 开发人员有责任理解数据
  • 编程MapReduce=使用Java(优缺点),手动将数据加载到HDFS

第2天:第1节:大数据生态系统-构建大数据ETL:大数据工具世界-何时使用哪个?

  • Hadoop与其他NoSQL解决方案
  • 用于交互式、随机数据访问
  • Hbase(列导向数据库)在Hadoop之上
  • 随机访问数据但有限制(最大1 PB)
  • 不适合即席分析,适合日志记录、计数、时间序列
  • Sqoop-从数据库导入到Hive或HDFS(JDBC/ODBC访问)
  • Flume-将流数据(例如日志数据)流入HDFS

第2天:第2节:大数据管理系统

  • 移动部件、计算节点启动/失败:ZooKeeper-用于配置/协调/命名服务
  • 复杂管道/工作流:Oozie-管理工作流、依赖关系、串联
  • 部署、配置、集群管理、升级等(系统管理员):Ambari
  • 在云中:Whirr

第2天:第3节:商业智能中的预测分析-1:基础技术和基于机器学习的BI:

  • 机器学习简介
  • 学习分类技术
  • 贝叶斯预测-准备训练文件
  • 支持向量机
  • KNN p-Tree代数和垂直挖掘
  • 神经网络
  • 大数据大变量问题-随机森林(RF)
  • 大数据自动化问题-多模型集成RF
  • 通过Soft10-M实现自动化
  • 文本分析工具-Treeminer
  • 敏捷学习
  • 基于代理的学习
  • 分布式学习
  • 用于预测分析的开源工具简介:R、Rapidminer、Mahut

第2天:第4节:预测分析生态系统-2:政府中常见的预测分析问题

  • 洞察分析
  • 可视化分析
  • 结构化预测分析
  • 非结构化预测分析
  • 威胁/欺诈者/供应商剖析
  • 推荐引擎
  • 模式检测
  • 规则/场景发现-失败、欺诈、优化
  • 根本原因发现
  • 情感分析
  • CRM分析
  • 网络分析
  • 文本分析
  • 技术辅助审查
  • 欺诈分析
  • 实时分析

第3天:第1节:Hadoop上的实时和可扩展分析

  • 为什么常见分析算法在Hadoop/HDFS中失败
  • Apache Hama-用于批量同步分布式计算
  • Apache SPARK-用于实时分析的集群计算
  • CMU Graphics Lab2-基于图的异步分布式计算方法
  • Treeminer的基于KNN p-代数的方法,以降低硬件运营成本

第3天:第2节:用于电子发现和取证的工具

  • 大数据上的电子发现与遗留数据-成本和性能的比较
  • 预测编码和技术辅助审查(TAR)
  • TAR产品(vMiner)的现场演示,以了解TAR如何实现更快的发现
  • 通过HDFS实现更快的索引-数据速度
  • NLP或自然语言处理-各种技术和开源产品
  • 外语电子发现-外语处理技术

第3天:第3节:用于网络安全的大数据BI-理解从快速数据收集到威胁识别的360度全貌

  • 理解安全分析的基础-攻击面、安全配置错误、主机防御
  • 网络基础设施/大型数据管道/用于实时分析的响应ETL
  • 规范性vs预测性-基于固定规则vs从元数据自动发现威胁规则

第3天:第4节:USDA中的大数据:农业应用

  • 用于农业的IoT(物联网)简介-基于传感器的数据和控制
  • 卫星成像及其在农业中的应用简介
  • 集成传感器和图像数据,用于土壤肥力、种植推荐和预测
  • 农业保险和大数据
  • 作物损失预测

第4天:第1节:政府大数据中的欺诈预防BI-欺诈分析:

  • 欺诈分析的基本分类-基于规则vs预测分析
  • 有监督vs无监督机器学习用于欺诈模式检测
  • 供应商欺诈/项目超收
  • 医疗保险和医疗补助欺诈-索赔处理的欺诈检测技术
  • 差旅报销欺诈
  • IRS退款欺诈
  • 在数据可用的地方,将提供案例研究和现场演示。

第4天:第2节:社交媒体分析-情报收集和分析

  • 用于提取社交媒体数据的大数据ETL API
  • 文本、图像、元数据和视频
  • 社交媒体feed的情感分析
  • 社交媒体feed的上下文和非上下文过滤
  • 集成多样社交媒体的社交媒体仪表板
  • 社交媒体资料的自动剖析
  • 每个分析将通过Treeminer工具进行现场演示。

第4天:第3节:图像处理和视频流中的大数据分析

  • 大数据中的图像存储技术-超过PB级数据的存储解决方案
  • LTFS和LTO
  • GPFS-LTFS(大型图像数据的分层存储解决方案)
  • 图像分析基础
  • 对象识别
  • 图像分割
  • 运动跟踪
  • 3D图像重建

第4天:第4节:NIH中的大数据应用:

  • 生物信息学的新兴领域
  • 宏基因组学和大数据挖掘问题
  • 用于药物基因组学、代谢组学和蛋白质组学的大数据预测分析
  • 下游基因组学过程中的大数据
  • 大数据预测分析在公共卫生中的应用

大数据仪表板,用于快速访问多样化数据和显示:

  • 现有应用平台与大数据仪表板的集成
  • 大数据管理
  • 大数据仪表板案例研究:Tableau和Pentaho
  • 使用大数据应用在政府中推送基于位置的服务
  • 跟踪系统和管理

第5天:第1节:如何在组织内证明大数据BI实施的合理性:

  • 定义大数据实施的ROI
  • 节省分析师数据收集和准备时间的案例研究-生产力提高
  • 通过节省许可数据库成本获得收入的案例研究
  • 基于位置的服务带来的收入增长
  • 欺诈预防节省
  • 一种集成的电子表格方法,用于计算大数据实施的近似费用与收入增长/节省。

第5天:第2节:将遗留数据系统替换为大数据系统的分步程序:

  • 理解实用的大数据迁移路线图
  • 在架构大数据实施之前需要哪些重要信息
  • 计算数据体积、速度、多样性和真实性的不同方法
  • 如何估计数据增长
  • 案例研究

第5天:第4节:大数据供应商及其产品审查。问答环节:

  • Accenture
  • APTEAN(前CDC Software)
  • Cisco Systems
  • Cloudera
  • Dell
  • EMC
  • GoodData Corporation
  • Guavus
  • Hitachi Data Systems
  • Hortonworks
  • HP
  • IBM
  • Informatica
  • Intel
  • Jaspersoft
  • Microsoft
  • MongoDB(前10Gen)
  • MU Sigma
  • Netapp
  • Opera Solutions
  • Oracle
  • Pentaho
  • Platfora
  • Qliktech
  • Quantum
  • Rackspace
  • Revolution Analytics
  • Salesforce
  • SAP
  • SAS Institute
  • Sisense
  • Software AG/Terracotta
  • Soft10 Automation
  • Splunk
  • Sqrrl
  • Supermicro
  • Tableau Software
  • Teradata
  • Think Big Analytics
  • Tidemark Systems
  • Treeminer
  • VMware(EMC的一部分)

要求

  • 了解其领域中政府业务运营和数据系统的基础知识
  • 基本理解SQL/Oracle或关系数据库
  • 基本理解统计学(电子表格级别)

客户评论 (1)

即将举行的公开课程

课程分类