聯繫我們

課程簡介

第一天

用於犯罪情報分析的大數據商業智能概覽

  • 來自執法的案例研究 - 預測性警察工作
  • 執法機構中大數據的採用率,以及他們如何圍繞大數據預測分析調整未來運營
  • 新興技術解決方案,如槍聲傳感器、監控視頻和社交媒體
  • 利用大數據技術緩解信息過載
  • 大數據與傳統數據的接口
  • 預測分析中使能技術的基本理解
  • 數據集成和儀表板可視化
  • 欺詐管理
  • 業務規則和欺詐檢測
  • 威脅檢測和畫像
  • 大數據實施的成本效益分析

大數據簡介

  • 大數據的主要特徵 - 容量、多樣性、速度和真實性。
  • MPP(大規模並行處理)架構
  • 數據倉庫 – 靜態模式,緩慢演變的數據集
  • MPP數據庫:Greenplum、Exadata、Teradata、Netezza、Vertica等
  • 基於Hadoop的解決方案 – 對數據集結構無限制。
  • 典型模式:HDFS,MapReduce( Crunch),從HDFS檢索
  • 用於流處理的Apache Spark
  • 批處理 - 適合分析/非交互式
  • 容量:CEP流數據
  • 典型選擇 – CEP產品(例如Infostreams、Apama、MarkLogic等)
  • 生產就緒性較低 – Storm/S4
  • NoSQL數據庫 –(列式和鍵值):最適合作為數據倉庫/數據庫的分析輔助工具

NoSQL解決方案

  • KV存儲 - Keyspace、Flare、SchemaFree、RAMCloud、Oracle NoSQL Database (OnDB)
  • KV存儲 - Dynamo、Voldemort、Dynomite、SubRecord、Mo8onDb、DovetailDB
  • KV存儲(層次結構)- GT.m、Cache
  • KV存儲(有序)- TokyoTyrant、Lightcloud、NMDB、Luxio、MemcacheDB、Actord
  • KV緩存 - Memcached、Repcached、Coherence、Infinispan、EXtremeScale、JBossCache、Velocity、Terracoqua
  • Tuple Store - Gigaspaces、Coord、Apache River
  • 對象數據庫 - ZopeDB、DB40、Shoal
  • 文檔存儲 - CouchDB、Cloudant、Couchbase、MongoDB、Jackrabbit、XML-Databases、ThruDB、CloudKit、Prsevere、Riak-Basho、Scalaris
  • 寬列存儲 - BigTable、HBase、Apache Cassandra、Hypertable、KAI、OpenNeptune、Qbase、KDI

數據的多樣性:大數據中數據清理問題的簡介

  • RDBMS – 靜態結構/模式,不促進敏捷、探索性環境。
  • NoSQL – 半結構化,具有足夠的結構以在存儲數據前無需精確模式即可存儲數據
  • 數據清理問題

Hadoop

  • 何時選擇Hadoop?
  • STRUCTURED - 企業數據倉庫/數據庫可以存儲大量數據(但有成本),但強加結構(不利於主動探索)
  • SEMI STRUCTURED data – 使用傳統解決方案難以執行(DW/DB)
  • 數據倉儲 = 巨大努力,即使在實施後也是靜態的
  • 對於數據的多樣性和容量,在普通硬件上處理 – HADOOP
  • 需要普通硬件來創建Hadoop集群

Map Reduce /HDFS簡介

  • MapReduce – 在多個服務器上分發計算
  • HDFS – 為計算過程使數據本地可用(具有冗餘)
  • 數據 – 可以是無結構的/無模式的(與RDBMS不同)
  • 開發人員負責理解數據
  • 編程MapReduce = 使用Java工作(利弊),手動加載數據到HDFS

第二天

大數據生態系統 – 構建大數據ETL(提取、轉換、加載) – 使用哪些大數據工具以及何時使用?

  • Hadoop與其他NoSQL解決方案對比
  • 用於交互式、隨機訪問數據
  • Hbase(列導向數據庫)基於Hadoop之上
  • 隨機訪問數據但有限制(最大1 PB)
  • 不適合臨時分析,適合記錄、計數、時間序列
  • Sqoop - 從數據庫導入到Hive或HDFS(JDBC/ODBC訪問)
  • Flume – 將流數據(例如日誌數據)注入HDFS

大數據管理系統

  • 移動部件,計算節點啟動/失敗:ZooKeeper - 用於配置/協調/命名服務
  • 複雜管道/工作流:Oozie – 管理工作流、依賴關係、鏈式反應
  • 部署、配置、集群管理、升級等(系統管理員):Ambari
  • 在雲端:Whirr

預測分析 – 基本技術和基於機器學習的商業智能

  • 機器學習簡介
  • 學習分類技術
  • 貝葉斯預測 – 準備訓練文件
  • 支持向量機
  • KNN p-Tree代數與垂直挖掘
  • 神經網絡
  • 大數據大變量問題 – 隨機森林(RF)
  • 大數據自動化問題 – 多模型集成RF
  • 通過Soft10-M實現自動化
  • 文本分析工具-Treeminer
  • 敏捷學習
  • 基於代理的學習
  • 分佈式學習
  • 預測分析開源工具簡介:R、Python、Rapidminer、Mahut

預測分析生態系統及其在犯罪情報分析中的應用

  • 技術與調查過程
  • 洞察分析
  • 可視化分析
  • 結構化預測分析
  • 非結構化預測分析
  • 威脅/欺詐者/供應商畫像
  • 推薦引擎
  • 模式檢測
  • 規則/場景發現 – 故障、欺詐、優化
  • 根本原因發現
  • 情感分析
  • CRM分析
  • 網絡分析
  • 從傳票、證人陳述、互聯網動態等獲取洞察的文本分析
  • 技術輔助審查
  • 欺詐分析
  • 實時分析

第三天

Hadoop上的實時和可擴展分析

  • 為什麼常見的分析算法在Hadoop/HDFS中失敗
  • Apache Hama - 用於批量同步分佈式計算
  • Apache SPARK - 用於集群計算和實時分析
  • CMU Graphics Lab2 - 基於圖的异步分佈式計算方法
  • KNN p -- 來自Treeminer的基於代數的方法,以降低操作硬件成本

eDiscovery和法證工具

  • 大數據與傳統數據的eDiscovery對比 – 成本和性能比較
  • 預測編碼和技術輔助審查(TAR)
  • vMiner實時演示,了解TAR如何實現更快的發現
  • 通過HDFS更快地索引 – 數據的速度
  • NLP(自然語言處理)– 開源產品和技術
  • 外語的eDiscovery – 用於外語處理的技術

大數據BI用於網絡安全 – 獲取360度視圖,快速數據收集和威脅識別

  • 了解安全分析基礎知識 – 攻擊面、安全誤配置、主機防護
  • 網絡基礎設施 / 大型數據管道 / 實時分析的響應ETL
  • 規範性與預測性 – 固定規則基於與從元數據自動發現威脅規則

收集不同類型的數據以進行犯罪情報分析

  • 使用IoT(物聯網)作為傳感器來捕獲數據
  • 使用衛星圖像進行國內監控
  • 使用監控和圖像數據進行犯罪識別
  • 其他數據收集技術 – 無人機、身體攝像頭、GPS標籤系統和熱成像技術
  • 將自動數據檢索與從線人、審問和研究獲得的數據結合
  • 預測犯罪活動

第四天

欺詐分析中大數據的欺詐預防BI

  • 欺詐分析的基本分類 – 基於規則與預測分析
  • 監督式與非監督式機器學習用於欺詐模式檢測
  • 企業間欺詐、醫療索賠欺詐、保險欺詐、逃稅和洗錢

社交媒體分析 – 情報收集和分析

  • 罪犯如何利用社交媒體進行組織、招募和策劃
  • 提取社交媒體數據的大數據ETL API
  • 文本、圖像、元數據和視頻
  • 來自社交媒體饋送的情感分析
  • 社交媒體饋送的上下文和非上下文過濾
  • 社交媒體儀表板以整合多樣化的社交媒體
  • 社交媒體檔案的自動畫像
  • 通過Treeminer工具給出每個分析的實時演示

圖像處理和視頻饋送中的大數據分析

  • 大數據中的圖像存儲技術 – 超過PB級數據的存儲解決方案
  • LTFS(線性磁帶文件系統)和LTO(線性磁帶開放)
  • GPFS-LTFS(通用並行文件系統 - 線性磁帶文件系統)– 用於大圖像數據的分層存儲解決方案
  • 圖像分析的基本原理
  • 對象識別
  • 圖像分割
  • 運動跟蹤
  • 3-D圖像重建

生物識別、DNA和下一代識別計劃

  • 超越指紋和面部識別
  • 語音識別、擊鍵(分析用戶打字模式)和CODIS(綜合DNA索引系統)
  • 超越DNA匹配:使用法醫DNA表型構建從DNA樣本中構建面孔

用於快速訪問多樣化數據和顯示的大數據儀表板:

  • 現有空應用平台與大數據儀表板的集成
  • 大數據管理
  • 大數據儀表板案例研究:Tableau和Pentaho
  • 使用大數據app向政府推送基於位置的服務
  • 跟蹤系統和管理

第五天

如何在組織內證明大數據BI實施的合理性:

  • 定義實施大數據的ROI(投資回報)
  • 節省分析師時間的案例研究,用於數據收集和準備 – 提高生產力
  • 從降低數據庫許可成本獲得的收入增長
  • 從基於位置的服務獲得的收入增長
  • 從欺詐預防獲得的成本節省
  • 綜合電子表格方法,用於計算大數據實施的大致費用與收入增長/節省。

用大數據系統替換傳統數據系統的逐步程序

  • 大數據遷移路線圖
  • 構建大數據系統之前需要哪些關鍵信息?
  • 計算容量、速度、多樣性和真實性的不同方法有哪些
  • 如何估計數據增長
  • 案例研究

大數據供應商及其產品的回顧。

  • 埃森哲
  • APTEAN(前CDC Software)
  • Cisco Systems
  • Cloudera
  • Dell
  • EMC
  • GoodData Corporation
  • Guavus
  • Hitachi Data Systems
  • Hortonworks
  • HP
  • IBM
  • Informatica
  • Intel
  • Jaspersoft
  • Microsoft
  • MongoDB(前10Gen)
  • MU Sigma
  • Netapp
  • Opera Solutions
  • Oracle
  • Pentaho
  • Platfora
  • Qliktech
  • Quantum
  • Rackspace
  • Revolution Analytics
  • Salesforce
  • SAP
  • SAS Institute
  • Sisense
  • Software AG/Terracotta
  • Soft10 Automation
  • Splunk
  • Sqrrl
  • Supermicro
  • Tableau Software
  • Teradata
  • Think Big Analytics
  • Tidemark Systems
  • Treeminer
  • VMware(EMC的一部分)

問答環節

最低要求

  • 了解執法流程和数据系統
  • 基本理解SQL/Oracle或關係型數據庫
  • 基本統計知識(電子表格級別)

受眾

  • 具有技術背景的執法專家
 35 小時

客戶評論 (3)

課程分類