聯繫我們

課程簡介

每節課程為 2 小時

第 1 天:第 1 節:政府大數據商業智慧業務概覽

  • 來自 NIH(美國國立衛生研究院)、DoE(美國能源部)的案例研究
  • 政府機構的大數據適應率及其如何圍繞大數據預測分析調整未來運營
  • 在 DoD(美國國防部)、NSA(美國國家安全局)、IRS(美國國稅局)、USDA(美國農業部)等領域的大規模應用領域
  • 大數據與傳統數據的接口
  • 預測分析中使能技術的基本理解
  • 數據整合與儀表板可視化
  • 欺詐管理
  • 業務規則/欺詐檢測生成
  • 威脅檢測與畫像
  • 大數據實施的成本效益分析

第 1 天:第 2 節:大數據介紹 -1

  • 大數據的主要特徵:體量(Volume)、多樣性(Variety)、速度(Velocity)和真實性(Veracity)。用於體量的 MPP(多處理)架構
  • 數據倉庫 – 靜態模式,緩慢演化的數據集
  • MPP 數據庫,如 Greenplum、Exadata、Teradata、Netezza、Vertica 等
  • 基於 Hadoop 的解決方案 – 對數據集結構無限制
  • 典型模式:HDFS、MapReduce(crunch)、從 HDFS 檢索
  • 批處理 – 適用於分析/非交互
  • 體量:CEP 流數據
  • 典型選擇 – CEP 產品(例如 Infostreams、Apama、MarkLogic 等)
  • 生產準備程度較低 – Storm/S4
  • NoSQL 數據庫 –(列式和鍵值):最適合作為數據倉庫/數據庫的分析補充

第 1 天:第 3 節:大數據介紹 -2

NoSQL 解決方案

  • KV Store - Keyspace, Flare, SchemaFree, RAMCloud, Oracle NoSQL Database (OnDB)
  • KV Store - Dynamo, Voldemort, Dynomite, SubRecord, Mo8onDb, DovetailDB
  • KV Store (Hierarchical) - GT.m, Cache
  • KV Store (Ordered) - TokyoTyrant, Lightcloud, NMDB, Luxio, MemcacheDB, Actord
  • KV Cache - Memcached, Repcached, Coherence, Infinispan, EXtremeScale, JBossCache, Velocity, Terracoqua
  • Tuple Store - Gigaspaces, Coord, Apache River
  • Object Database - ZopeDB, DB40, Shoal
  • Document Store - CouchDB, Cloudant, Couchbase, MongoDB, Jackrabbit, XML-Databases, ThruDB, CloudKit, Prsevere, Riak-Basho, Scalaris
  • Wide Columnar Store - BigTable, HBase, Apache Cassandra, Hypertable, KAI, OpenNeptune, Qbase, KDI

數據的多樣性:大數據中數據清洗問題的介紹

  • RDBMS – 靜態結構/模式,不促進靈活、探索性的環境
  • NoSQL – 半結構化,具有足夠的結構以便在儲存數據前無需精確模式
  • 數據清洗問題

第 1 天:第 4 節:大數據介紹 -3:Hadoop

  • 何時選擇 Hadoop?
  • 結構化 - 企業數據倉庫/數據庫可以儲存海量數據(但有成本),但施加結構(不利於主動探索)
  • 半結構化數據 – 傳統解決方案(DW/DB)難以處理
  • 數據倉庫化 = 巨大工作量,且在實施後仍是靜態的
  • 針對數據的多樣性和體量,在通用硬件上進行處理 – HADOOP
  • 需要通用硬件來創建 Hadoop 叢集

MapReduce /HDFS 介紹

  • MapReduce – 將計算分發到多台伺服器
  • HDFS – 使數據在計算過程中本地可用(帶有冗餘)
  • 數據 – 可以是非結構化/無模式的(與 RDBMS 不同)
  • 開發者負責使數據意義化
  • 編寫 MapReduce = 使用 Java 進行開發(優缺點)、手動將數據加載到 HDFS

第 2 天:第 1 節:大數據生態系統 - 構建大數據 ETL:大數據工具宇宙 - 何時使用哪個?

  • Hadoop vs. 其他 NoSQL 解決方案
  • 對於交互式、隨機訪問數據
  • 基於 Hadoop 的 Hbase(列導向數據庫)
  • 隨機訪問數據但有限制(最大 1 PB)
  • 不適用於即席分析,適用於日誌記錄、計數、時間序列
  • Sqoop - 從數據庫導入到 Hive 或 HDFS(JDBC/ODBC 訪問)
  • Flume – 將流數據(例如日誌數據)導入 HDFS

第 2 天:第 2 節:大數據管理系統

  • 移動部件、計算節點啟動/故障:ZooKeeper - 用於配置/協調/命名服務
  • 複雜管道/工作流:Oozie – 管理工作流、依賴關係、鏈式調用
  • 部署、配置、叢集管理、升級等(系統管理):Ambari
  • 雲中:Whirr

第 2 天:第 3 節:商業智能中的預測分析 -1:基礎技術與基於機器學習的 BI:

  • 機器學習介紹
  • 學習分類技術
  • 貝葉斯預測-準備訓練文件
  • 支持向量機
  • KNN p-Tree 代數 & 垂直挖掘
  • 神經網絡
  • 大數據大變量問題 - 隨機森林 (RF)
  • 大數據自動化問題 – 多模型集成 RF
  • 通過 Soft10-M 實現自動化
  • 文本分析工具 - Treeminer
  • 敏捷學習
  • 基於智能體的學習
  • 分布式學習
  • 預測分析的開源工具介紹:R, Rapidminer, Mahut

第 2 天:第 4 節:預測分析生態系統 -2:政府中常見的預測分析問題

  • 洞察分析
  • 可視化分析
  • 結構化預測分析
  • 非結構化預測分析
  • 威脅/欺詐星/供應商畫像
  • 推薦引擎
  • 模式檢測
  • 規則/場景發現 – 故障、欺詐、優化
  • 根本原因發現
  • 情感分析
  • CRM 分析
  • 網絡分析
  • 文本分析
  • 技術輔助審查
  • 欺詐分析
  • 即時分析

第 3 天:第 1 節:基於 Hadoop 的即時與可擴展分析

  • 為何常見分析算法在 Hadoop/HDFS 中失敗
  • Apache Hama - 用於批量同步分布式計算
  • Apache SPARK - 用於即時分析的叢集計算
  • CMU Graphics Lab2 - 基於圖的異步分布式計算方法
  • 基於 Treeminer 的 KNN p-代數方法,以降低運營的硬件成本

第 3 天:第 2 節:電子發現和法醫學工具

  • 大數據上的電子發現 vs. 傳統數據 – 成本和性能的比較
  • 預測編碼和技術輔助審查 (TAR)
  • Tar 產品(vMiner)的實時演示,以了解 TAR 如何實現更快的發現
  • 通過 HDFS 實現更快的索引 – 數據的速度
  • NLP 或自然語言處理 – 各種技術和開源產品
  • 外語中的電子發現-外語處理技術

第 3 天:第 3 節:用於網絡安全的大數據商業智慧 – 理解從快速數據收集到威脅識別的完整 360 度視圖

  • 理解安全分析基礎-攻擊面、安全配置錯誤、主機防禦
  • 網絡基礎設施/ 大型數據管道 / 響應 ETL 用於即時分析
  • 處方式 vs 預測式 – 固定規則基於 vs 從元數據自動發現威脅規則

第 3 天:第 4 節:USDA 中的大數據:農業應用

  • 農業 IoT(物聯網)介紹 - 基於感測器的大數據和控制
  • 衛星成像及其在農業中的應用介紹
  • 整合感測器和影像數據,用於土壤肥力、種植建議和預測
  • 農業保險和大數據
  • 作物損失預測

第 4 天:第 1 節:政府大數據中的欺詐預防商業智能 - 欺詐分析:

  • 欺詐分析的基本分類 - 規則基於 vs 預測分析
  • 欺詐模式檢測的監督式 vs 非監督式機器學習
  • 供應商欺詐/項目過度收費
  • Medicare(聯邦醫療保險)和 Medicaid(醫療補助)欺詐 - 理賠處理的欺詐檢測技術
  • 差旅報銷欺詐
  • IRS 退款欺詐
  • 在數據可用的情況下將提供案例研究和實時演示。

第 4 天:第 2 節:社交媒體分析 - 情報收集和分析

  • 用於提取社交媒體數據的大數據 ETL API
  • 文本、圖像、元數據和視頻
  • 來自社交媒體信息流的情感分析
  • 社交媒體信息流的上下文和非上下文過濾
  • 社交媒體儀表板以整合多種社交媒體
  • 社交媒體個人資料的自動畫像
  • 將通過 Treeminer 工具對每種分析進行實時演示。

第 4 天:第 3 節:圖像處理和視頻流中的大數據分析

  • 大數據中的圖像儲存技術 - 超過 PB 級數據的儲存解決方案
  • LTFS 和 LTO
  • GPFS-LTFS(大圖像數據的層狀儲存解決方案)
  • 圖像分析基礎
  • 對象識別
  • 圖像分割
  • 動作追蹤
  • 3-D 圖像重建

第 4 天:第 4 節:NIH 中的大數據應用:

  • 生物資訊學新興領域
  • 宏基因組學和大數據挖掘問題
  • 藥物基因組學、代謝組學和蛋白質組學的大數據預測分析
  • 下游基因組學過程中的大數據
  • 大數據預測分析在公共衛生中的應用

大數據儀表板,用於快速訪問多樣化數據並顯示:

  • 現有應用平台與大數據儀表板的整合
  • 大數據管理
  • 大數據儀表板案例研究:Tableau 和 Pentaho
  • 使用大數據應用推動政府中的基於位置服務
  • 追蹤系統和管理

第 5 天:第 1 節:如何證明組織內大數據商業智能實施的合理性:

  • 定義大數據實施的投資回報率(ROI)
  • 節省分析師收集和準備數據時間的案例研究 – 生產力增益的增加
  • 通過節省授權數據庫成本實現營收增長的案例研究
  • 來自基於位置服務的營收增長
  • 來自欺詐預防的節省
  • 一種綜合電子表格方法,用於計算大數據實施的大致開支 vs. 營收增益/節省。

第 5 天:第 2 節:逐步程序以將傳統數據系統替換為大數據系統:

  • 理解實際的大數據遷移路線圖
  • 在設計大數據實施之前需要哪些重要信息
  • 計算數據體量、速度、多樣性和真實性的不同方法
  • 如何估算數據增長
  • 案例研究

第 5 天:第 4 節:審查大數據供應商及其產品。問答環節:

  • Accenture
  • APTEAN (Formerly CDC Software)
  • Cisco Systems
  • Cloudera
  • Dell
  • EMC
  • GoodData Corporation
  • Guavus
  • Hitachi Data Systems
  • Hortonworks
  • HP
  • IBM
  • Informatica
  • Intel
  • Jaspersoft
  • Microsoft
  • MongoDB (Formerly 10Gen)
  • MU Sigma
  • Netapp
  • Opera Solutions
  • Oracle
  • Pentaho
  • Platfora
  • Qliktech
  • Quantum
  • Rackspace
  • Revolution Analytics
  • Salesforce
  • SAP
  • SAS Institute
  • Sisense
  • Software AG/Terracotta
  • Soft10 Automation
  • Splunk
  • Sqrrl
  • Supermicro
  • Tableau Software
  • Teradata
  • Think Big Analytics
  • Tidemark Systems
  • Treeminer
  • VMware (Part of EMC)

最低要求

  • 具備對政府領域內業務運營及數據系統的基本知識
  • 對 SQL/Oracle 或關係型數據庫有基本理解
  • 對統計學有基本理解(達到電子表格層面)
 35 小時

客戶評論 (1)

課程分類