感謝您提交詢問!我們的一位團隊成員將在短時間內與您聯繫。
感謝您提交預訂!我們的一位團隊成員將在短時間內與您聯繫。
課程簡介
每次課程為2小時
第一天:第1節:為什麼要在政府中使用大數據商業智能的業務概覽
- 來自 NIH, DoE 的案例研究
- 政府在機構中的大數據適應率,以及它們如何圍繞大數據預測分析調整未來運營
- 在國防部、國家安全局、國稅局、農業部等的大規模應用領域
- 大數據與傳統數據的接口
- 預測分析中使能技術的基本理解
- 數據集成與儀表板可視化
- 欺詐管理
- 業務規則/ 欺詐檢測生成
- 威脅偵測與側寫
- 大數據實施的成本效益分析
第一天:第2節:大數據介紹-1
- 大數據的主要特徵:規模、多樣性、速度和準確性。針對規模的 MPP 架構。
- 數據倉庫 – 靜態模式,緩慢演變的數據集
- MPP 數據庫,如 Greenplum, Exadata, Teradata, Netezza, Vertica 等。
- 基於 Hadoop 的解決方案 – 對數據集結構無限制。
- 典型模式:HDFS, MapReduce (crunch),從 HDFS 檢索
- 批處理 – 適合分析/非交互
- 規模:CEP 流數據
- 典型選擇 – CEP 產品(例如 Infostreams, Apama, MarkLogic 等)
- 生產就绪度較低 – Storm/S4
- NoSQL 數據庫 – (列式和鍵值):最適合作為數據倉庫/數據庫的分析輔助。
第一天:第3節:大數據介紹-2
NoSQL 解決方案
- KV Store - Keyspace, Flare, SchemaFree, RAMCloud, Oracle NoSQL Database (OnDB)
- KV Store - Dynamo, Voldemort, Dynomite, SubRecord, Mo8onDb, DovetailDB
- KV Store(層次化)- GT.m, Cache
- KV Store(有序)- TokyoTyrant, Lightcloud, NMDB, Luxio, MemcacheDB, Actord
- KV 緩存 - Memcached, Repcached, Coherence, Infinispan, EXtremeScale, JBossCache, Velocity, Terracoqua
- Tuple Store - Gigaspaces, Coord, Apache River
- 對象數據庫 - ZopeDB, DB40, Shoal
- 文檔存儲 - CouchDB, Cloudant, Couchbase, MongoDB, Jackrabbit, XML-Databases, ThruDB, CloudKit, Prsevere, Riak-Basho, Scalaris
- 寬列存儲 - BigTable, HBase, Apache Cassandra, Hypertable, KAI, OpenNeptune, Qbase, KDI
數據的多樣性:大數據中數據清理問題介紹
- RDBMS – 靜態結構/模式,不促進敏捷、探索性環境。
- NoSQL – 半結構化,具有足夠的結構以在存儲前無需確切模式即可存儲數據
- 數據清理問題
第一天:第4節:大數據介紹-3:Hadoop
- 何時選擇 Hadoop?
- 結構化 - 企業數據倉庫/數據庫可以存儲海量數據(但有成本),並強加結構(不利於主動探索)
- 半結構化數據 – 傳統解決方案(DW/DB)難以處理
- 數據倉庫 = 巨大的工作,且即使實施後也是靜態的
- 對於數據的多樣性和規模,在商用硬件上處理 – HADOOP
- 創建 Hadoop 集群所需的商用 H/W
Map Reduce /HDFS 介紹
- MapReduce – 將計算分發到多個服務器
- HDFS – 為計算過程本地提供數據(帶有冗余)
- 數據 – 可以是無結構/無模式的(與 RDBMS 不同)
- 開發人員負責理解數據
- 編寫 MapReduce = 使用 Java(優缺點),手動加載數據到 HDFS
第二天:第1節:大數據生態系統 - 構建大數據 ETL:大數據工具宇宙 - 使用哪個以及何時使用?
- Hadoop vs. 其他 NoSQL 解決方案
- 用於交互式、隨機訪問數據
- 基於 Hadoop 之上的 Hbase(列導向數據庫)
- 隨機訪問數據但有限制(最大 1 PB)
- 不適合即席分析,適合記錄、計數、時間序列
- Sqoop - 從數據庫導入到 Hive 或 HDFS (JDBC/ODBC 訪問)
- Flume – 將流數據(例如日誌數據)輸入到 HDFS
第二天:第2節:大數據管理系統
- 移動部件,計算節點啟動/失敗:ZooKeeper - 用於配置/協調/命名服務
- 復雜管道/工作流:Oozie – 管理工作流、依賴關係、連鎖反應
- 部署、配置、集群管理、升級等(系統管理員):Ambari
- 在雲端中:Whirr
第二天:第3節:商業智能中的預測分析 -1:基本技術及基於機器學習的 BI :
- 機器學習介紹
- 學習分類技術
- 貝葉斯預測 - 準備訓練文件
- 支持向量機
- KNN p-Tree 代數與垂直挖掘
- 神經網絡
- 大數據大變量問題 - 隨機森林 (RF)
- 大數據自動化問題 – 多模型集成 RF
- 通過 Soft10-M 實現自動化
- 文本分析工具 - Treeminer
- 敏捷學習
- 基於代理的學習
- 分布式學習
- 預測分析開源工具介紹:R, Rapidminer, Mahut
第二天:第4節 預測分析生態系統-2:政府中的常見預測分析問題
- 見解分析
- 可視化分析
- 結構化預測分析
- 非結構化預測分析
- 威脅/欺詐者/供應商側寫
- 推薦引擎
- 模式檢測
- 規則/情景發現 – 失敗、欺詐、優化
- 根本原因發現
- 情感分析
- CRM 分析
- 網絡分析
- 文本分析
- 技術輔助審查
- 欺詐分析
- 實時分析
第三天:第1節:基於 Hadoop 的實時和可擴展分析
- 為什麼常見的分析算法在 Hadoop/HDFS 中失效
- Apache Hama - 用於批量同步分布式計算
- Apache SPARK - 用於實時分析的集群計算
- CMU Graphics Lab2 - 基於圖的分布式計算非同步方法
- Treeminer 基於 KNN p-代數的方法,以降低運營硬件成本
第三天:第2節:電子发现和法證工具
- 基於大數據 vs. 傳統數據的電子发现 – 成本和性能的比較
- 預測編碼和技術輔助審查 (TAR)
- Tar 產品 (vMiner) 的實時演示,了解 TAR 如何實現快速發現
- 通過 HDFS 加速索引 – 數據速度
- NLP 或自然語言處理 – 各種技術和開源產品
- 外文電子发现 - 用於外文處理的技術
第三天:第3節:網絡安全中的大數據 BI – 理解從快速數據收集到威脅識別的整個360度視圖
- 了解安全分析基礎 - 攻擊面、安全錯誤配置、主機防禦
- 網絡基礎設施/大容量數據管道/實時分析的響應 ETL
- 處方性 vs 預測性 – 基於固定規則與從元數據自動發現威脅規則
第三天:第4節:農業部中的大數據:在農業中的應用
- 農業 IoT(物聯網)介紹 - 傳感器驅動的大數據和控制
- 衛星成像及其在農業中的應用介紹
- 整合傳感器和圖像數據以獲取土壤肥力、耕作建議和預測
- 農業保險與大數據
- 作物損失預測
第四天:第1節:來自政府大數據的欺詐預防 BI - 欺詐分析:
- 欺詐分析的基礎分類 - 基於規則 vs 預測分析
- 用於欺詐模式檢測的監督式與非監督式機器學習
- 供應商欺詐/項目過度收費
- 醫療保險和醫療補助欺詐 - 索賠處理的欺詐檢測技術
- 差旅報銷欺詐
- 國稅局退款欺詐
- 在有數據的地方提供案例研究和實時演示。
第四天:第2節:社交媒體分析 - 情報收集與分析
- 用於提取社交媒體數據的大數據 ETL API
- 文本、圖像、元數據和視頻
- 來自社交媒體_feed的情感分析
- 社交媒體_feed 的上下文和非上下文過濾
- 整合多樣化社交媒體的社交媒體儀表板
- 社交媒體配置文件自動化側寫
- 通過 Treeminer 工具給出每個分析的實時演示。
第四天:第3節:圖像處理和視頻饋送中的大數據分析
- 大數據中的圖像存儲技術 - 超過PB級別的數據存儲解決方案
- LTFS 和 LTO
- GPFS-LTFS(用於大型圖像數據的分層存儲解決方案)
- 圖像分析的基礎
- 對象識別
- 圖像分割
- 運動追蹤
- 三維圖像重建
第四天:第4節:NIH 中的大數據應用:
- 生物信息學的新興領域
- 宏基因組學與大數據挖掘問題
- 藥物基因组學、代謝组學和蛋白質组學的大數據預測分析
- 下游基因組流程中的大數據
- 公共衛生中大數據預測分析的應用
用於快速訪問多樣化數據和顯示的大數據儀表板:
- 現有應用平台與大數據儀表板的集成
- 大數據管理
- 大數據儀表板案例研究:Tableau 和 Pentaho
- 使用大數據應用在政府中推動基於位置服務
- 追蹤系統和管理
第五天:第1節:如何在組織內為大數據 BI 實施辯護:
- 定義大數據實施的投資回報率 (ROI)
- 節省分析師收集和準備數據時間的案例研究 – 提高生產力
- 通過節省授權數據庫成本獲得收入增益的案例研究
- 通過基於位置服務獲得的收入增益
- 來自欺詐預防的節省
- 一種綜合電子表格方法,用於計算大數據實施的大致支出與收入增益/節省。
第五天:第2節:將傳統數據系統替換為大數據系統的逐步程序:
- 了解實用大數據遷移路線圖
- 構建大數據實施前需要哪些重要信息
- 計算數據的規模、速度、多樣性和準確性的不同方法
- 如何估算數據增長
- 案例研究
第五天:第4節:審查大數據供應商及其產品。問答環節:
- Accenture
- APTEAN (原 CDC Software)
- Cisco Systems
- Cloudera
- Dell
- EMC
- GoodData Corporation
- Guavus
- Hitachi Data Systems
- Hortonworks
- HP
- IBM
- Informatica
- Intel
- Jaspersoft
- Microsoft
- MongoDB (原 10Gen)
- MU Sigma
- Netapp
- Opera Solutions
- Oracle
- Pentaho
- Platfora
- Qliktech
- Quantum
- Rackspace
- Revolution Analytics
- Salesforce
- SAP
- SAS Institute
- Sisense
- Software AG/Terracotta
- Soft10 Automation
- Splunk
- Sqrrl
- Supermicro
- Tableau Software
- Teradata
- Think Big Analytics
- Tidemark Systems
- Treeminer
- VMware (EMC 旗下)
最低要求
- 對其領域內政府業務運營和數據系統的基本知識
- 對 SQL/Oracle 或關係數據庫的基本了解
- 對統計學(電子表格層面)的基本理解
35 小時
客戶評論 (1)
培訓師能夠根據組織的需求調整課程內容,而不僅僅是爲了完成課程而提供培訓。
Masilonyane - Revenue Services Lesotho
課程 - Big Data Business Intelligence for Govt. Agencies
機器翻譯