聯繫我們

課程簡介

每次課程為2小時

第一天:第1節:為什麼要在政府中使用大數據商業智能的業務概覽

  • 來自 NIH, DoE 的案例研究
  • 政府在機構中的大數據適應率,以及它們如何圍繞大數據預測分析調整未來運營
  • 在國防部、國家安全局、國稅局、農業部等的大規模應用領域
  • 大數據與傳統數據的接口
  • 預測分析中使能技術的基本理解
  • 數據集成與儀表板可視化
  • 欺詐管理
  • 業務規則/ 欺詐檢測生成
  • 威脅偵測與側寫
  • 大數據實施的成本效益分析

第一天:第2節:大數據介紹-1

  • 大數據的主要特徵:規模、多樣性、速度和準確性。針對規模的 MPP 架構。
  • 數據倉庫 – 靜態模式,緩慢演變的數據集
  • MPP 數據庫,如 Greenplum, Exadata, Teradata, Netezza, Vertica 等。
  • 基於 Hadoop 的解決方案 – 對數據集結構無限制。
  • 典型模式:HDFS, MapReduce (crunch),從 HDFS 檢索
  • 批處理 – 適合分析/非交互
  • 規模:CEP 流數據
  • 典型選擇 – CEP 產品(例如 Infostreams, Apama, MarkLogic 等)
  • 生產就绪度較低 – Storm/S4
  • NoSQL 數據庫 – (列式和鍵值):最適合作為數據倉庫/數據庫的分析輔助。

第一天:第3節:大數據介紹-2

NoSQL 解決方案

  • KV Store - Keyspace, Flare, SchemaFree, RAMCloud, Oracle NoSQL Database (OnDB)
  • KV Store - Dynamo, Voldemort, Dynomite, SubRecord, Mo8onDb, DovetailDB
  • KV Store(層次化)- GT.m, Cache
  • KV Store(有序)- TokyoTyrant, Lightcloud, NMDB, Luxio, MemcacheDB, Actord
  • KV 緩存 - Memcached, Repcached, Coherence, Infinispan, EXtremeScale, JBossCache, Velocity, Terracoqua
  • Tuple Store - Gigaspaces, Coord, Apache River
  • 對象數據庫 - ZopeDB, DB40, Shoal
  • 文檔存儲 - CouchDB, Cloudant, Couchbase, MongoDB, Jackrabbit, XML-Databases, ThruDB, CloudKit, Prsevere, Riak-Basho, Scalaris
  • 寬列存儲 - BigTable, HBase, Apache Cassandra, Hypertable, KAI, OpenNeptune, Qbase, KDI

數據的多樣性:大數據中數據清理問題介紹

  • RDBMS – 靜態結構/模式,不促進敏捷、探索性環境。
  • NoSQL – 半結構化,具有足夠的結構以在存儲前無需確切模式即可存儲數據
  • 數據清理問題

第一天:第4節:大數據介紹-3:Hadoop

  • 何時選擇 Hadoop?
  • 結構化 - 企業數據倉庫/數據庫可以存儲海量數據(但有成本),並強加結構(不利於主動探索)
  • 半結構化數據 – 傳統解決方案(DW/DB)難以處理
  • 數據倉庫 = 巨大的工作,且即使實施後也是靜態的
  • 對於數據的多樣性和規模,在商用硬件上處理 – HADOOP
  • 創建 Hadoop 集群所需的商用 H/W

Map Reduce /HDFS 介紹

  • MapReduce – 將計算分發到多個服務器
  • HDFS – 為計算過程本地提供數據(帶有冗余)
  • 數據 – 可以是無結構/無模式的(與 RDBMS 不同)
  • 開發人員負責理解數據
  • 編寫 MapReduce = 使用 Java(優缺點),手動加載數據到 HDFS

第二天:第1節:大數據生態系統 - 構建大數據 ETL:大數據工具宇宙 - 使用哪個以及何時使用?

  • Hadoop vs. 其他 NoSQL 解決方案
  • 用於交互式、隨機訪問數據
  • 基於 Hadoop 之上的 Hbase(列導向數據庫)
  • 隨機訪問數據但有限制(最大 1 PB)
  • 不適合即席分析,適合記錄、計數、時間序列
  • Sqoop - 從數據庫導入到 Hive 或 HDFS (JDBC/ODBC 訪問)
  • Flume – 將流數據(例如日誌數據)輸入到 HDFS

第二天:第2節:大數據管理系統

  • 移動部件,計算節點啟動/失敗:ZooKeeper - 用於配置/協調/命名服務
  • 復雜管道/工作流:Oozie – 管理工作流、依賴關係、連鎖反應
  • 部署、配置、集群管理、升級等(系統管理員):Ambari
  • 在雲端中:Whirr

第二天:第3節:商業智能中的預測分析 -1:基本技術及基於機器學習的 BI :

  • 機器學習介紹
  • 學習分類技術
  • 貝葉斯預測 - 準備訓練文件
  • 支持向量機
  • KNN p-Tree 代數與垂直挖掘
  • 神經網絡
  • 大數據大變量問題 - 隨機森林 (RF)
  • 大數據自動化問題 – 多模型集成 RF
  • 通過 Soft10-M 實現自動化
  • 文本分析工具 - Treeminer
  • 敏捷學習
  • 基於代理的學習
  • 分布式學習
  • 預測分析開源工具介紹:R, Rapidminer, Mahut

第二天:第4節 預測分析生態系統-2:政府中的常見預測分析問題

  • 見解分析
  • 可視化分析
  • 結構化預測分析
  • 非結構化預測分析
  • 威脅/欺詐者/供應商側寫
  • 推薦引擎
  • 模式檢測
  • 規則/情景發現 – 失敗、欺詐、優化
  • 根本原因發現
  • 情感分析
  • CRM 分析
  • 網絡分析
  • 文本分析
  • 技術輔助審查
  • 欺詐分析
  • 實時分析

第三天:第1節:基於 Hadoop 的實時和可擴展分析

  • 為什麼常見的分析算法在 Hadoop/HDFS 中失效
  • Apache Hama - 用於批量同步分布式計算
  • Apache SPARK - 用於實時分析的集群計算
  • CMU Graphics Lab2 - 基於圖的分布式計算非同步方法
  • Treeminer 基於 KNN p-代數的方法,以降低運營硬件成本

第三天:第2節:電子发现和法證工具

  • 基於大數據 vs. 傳統數據的電子发现 – 成本和性能的比較
  • 預測編碼和技術輔助審查 (TAR)
  • Tar 產品 (vMiner) 的實時演示,了解 TAR 如何實現快速發現
  • 通過 HDFS 加速索引 – 數據速度
  • NLP 或自然語言處理 – 各種技術和開源產品
  • 外文電子发现 - 用於外文處理的技術

第三天:第3節:網絡安全中的大數據 BI – 理解從快速數據收集到威脅識別的整個360度視圖

  • 了解安全分析基礎 - 攻擊面、安全錯誤配置、主機防禦
  • 網絡基礎設施/大容量數據管道/實時分析的響應 ETL
  • 處方性 vs 預測性 – 基於固定規則與從元數據自動發現威脅規則

第三天:第4節:農業部中的大數據:在農業中的應用

  • 農業 IoT(物聯網)介紹 - 傳感器驅動的大數據和控制
  • 衛星成像及其在農業中的應用介紹
  • 整合傳感器和圖像數據以獲取土壤肥力、耕作建議和預測
  • 農業保險與大數據
  • 作物損失預測

第四天:第1節:來自政府大數據的欺詐預防 BI - 欺詐分析:

  • 欺詐分析的基礎分類 - 基於規則 vs 預測分析
  • 用於欺詐模式檢測的監督式與非監督式機器學習
  • 供應商欺詐/項目過度收費
  • 醫療保險和醫療補助欺詐 - 索賠處理的欺詐檢測技術
  • 差旅報銷欺詐
  • 國稅局退款欺詐
  • 在有數據的地方提供案例研究和實時演示。

第四天:第2節:社交媒體分析 - 情報收集與分析

  • 用於提取社交媒體數據的大數據 ETL API
  • 文本、圖像、元數據和視頻
  • 來自社交媒體_feed的情感分析
  • 社交媒體_feed 的上下文和非上下文過濾
  • 整合多樣化社交媒體的社交媒體儀表板
  • 社交媒體配置文件自動化側寫
  • 通過 Treeminer 工具給出每個分析的實時演示。

第四天:第3節:圖像處理和視頻饋送中的大數據分析

  • 大數據中的圖像存儲技術 - 超過PB級別的數據存儲解決方案
  • LTFS 和 LTO
  • GPFS-LTFS(用於大型圖像數據的分層存儲解決方案)
  • 圖像分析的基礎
  • 對象識別
  • 圖像分割
  • 運動追蹤
  • 三維圖像重建

第四天:第4節:NIH 中的大數據應用:

  • 生物信息學的新興領域
  • 宏基因組學與大數據挖掘問題
  • 藥物基因组學、代謝组學和蛋白質组學的大數據預測分析
  • 下游基因組流程中的大數據
  • 公共衛生中大數據預測分析的應用

用於快速訪問多樣化數據和顯示的大數據儀表板:

  • 現有應用平台與大數據儀表板的集成
  • 大數據管理
  • 大數據儀表板案例研究:Tableau 和 Pentaho
  • 使用大數據應用在政府中推動基於位置服務
  • 追蹤系統和管理

第五天:第1節:如何在組織內為大數據 BI 實施辯護:

  • 定義大數據實施的投資回報率 (ROI)
  • 節省分析師收集和準備數據時間的案例研究 – 提高生產力
  • 通過節省授權數據庫成本獲得收入增益的案例研究
  • 通過基於位置服務獲得的收入增益
  • 來自欺詐預防的節省
  • 一種綜合電子表格方法,用於計算大數據實施的大致支出與收入增益/節省。

第五天:第2節:將傳統數據系統替換為大數據系統的逐步程序:

  • 了解實用大數據遷移路線圖
  • 構建大數據實施前需要哪些重要信息
  • 計算數據的規模、速度、多樣性和準確性的不同方法
  • 如何估算數據增長
  • 案例研究

第五天:第4節:審查大數據供應商及其產品。問答環節:

  • Accenture
  • APTEAN (原 CDC Software)
  • Cisco Systems
  • Cloudera
  • Dell
  • EMC
  • GoodData Corporation
  • Guavus
  • Hitachi Data Systems
  • Hortonworks
  • HP
  • IBM
  • Informatica
  • Intel
  • Jaspersoft
  • Microsoft
  • MongoDB (原 10Gen)
  • MU Sigma
  • Netapp
  • Opera Solutions
  • Oracle
  • Pentaho
  • Platfora
  • Qliktech
  • Quantum
  • Rackspace
  • Revolution Analytics
  • Salesforce
  • SAP
  • SAS Institute
  • Sisense
  • Software AG/Terracotta
  • Soft10 Automation
  • Splunk
  • Sqrrl
  • Supermicro
  • Tableau Software
  • Teradata
  • Think Big Analytics
  • Tidemark Systems
  • Treeminer
  • VMware (EMC 旗下)

最低要求

  • 對其領域內政府業務運營和數據系統的基本知識
  • 對 SQL/Oracle 或關係數據庫的基本了解
  • 對統計學(電子表格層面)的基本理解
 35 小時

客戶評論 (1)

課程分類