感謝您提交詢問!我們的一位團隊成員將在短時間內與您聯繫。
感謝您提交預訂!我們的一位團隊成員將在短時間內與您聯繫。
課程簡介
第一天
用於犯罪情報分析的大數據商業智能概覽
- 來自執法的案例研究 - 預測性警察工作
- 執法機構中大數據的採用率,以及他們如何圍繞大數據預測分析調整未來運營
- 新興技術解決方案,如槍聲傳感器、監控視頻和社交媒體
- 利用大數據技術緩解信息過載
- 大數據與傳統數據的接口
- 預測分析中使能技術的基本理解
- 數據集成和儀表板可視化
- 欺詐管理
- 業務規則和欺詐檢測
- 威脅檢測和畫像
- 大數據實施的成本效益分析
大數據簡介
- 大數據的主要特徵 - 容量、多樣性、速度和真實性。
- MPP(大規模並行處理)架構
- 數據倉庫 – 靜態模式,緩慢演變的數據集
- MPP數據庫:Greenplum、Exadata、Teradata、Netezza、Vertica等
- 基於Hadoop的解決方案 – 對數據集結構無限制。
- 典型模式:HDFS,MapReduce( Crunch),從HDFS檢索
- 用於流處理的Apache Spark
- 批處理 - 適合分析/非交互式
- 容量:CEP流數據
- 典型選擇 – CEP產品(例如Infostreams、Apama、MarkLogic等)
- 生產就緒性較低 – Storm/S4
- NoSQL數據庫 –(列式和鍵值):最適合作為數據倉庫/數據庫的分析輔助工具
NoSQL解決方案
- KV存儲 - Keyspace、Flare、SchemaFree、RAMCloud、Oracle NoSQL Database (OnDB)
- KV存儲 - Dynamo、Voldemort、Dynomite、SubRecord、Mo8onDb、DovetailDB
- KV存儲(層次結構)- GT.m、Cache
- KV存儲(有序)- TokyoTyrant、Lightcloud、NMDB、Luxio、MemcacheDB、Actord
- KV緩存 - Memcached、Repcached、Coherence、Infinispan、EXtremeScale、JBossCache、Velocity、Terracoqua
- Tuple Store - Gigaspaces、Coord、Apache River
- 對象數據庫 - ZopeDB、DB40、Shoal
- 文檔存儲 - CouchDB、Cloudant、Couchbase、MongoDB、Jackrabbit、XML-Databases、ThruDB、CloudKit、Prsevere、Riak-Basho、Scalaris
- 寬列存儲 - BigTable、HBase、Apache Cassandra、Hypertable、KAI、OpenNeptune、Qbase、KDI
數據的多樣性:大數據中數據清理問題的簡介
- RDBMS – 靜態結構/模式,不促進敏捷、探索性環境。
- NoSQL – 半結構化,具有足夠的結構以在存儲數據前無需精確模式即可存儲數據
- 數據清理問題
Hadoop
- 何時選擇Hadoop?
- STRUCTURED - 企業數據倉庫/數據庫可以存儲大量數據(但有成本),但強加結構(不利於主動探索)
- SEMI STRUCTURED data – 使用傳統解決方案難以執行(DW/DB)
- 數據倉儲 = 巨大努力,即使在實施後也是靜態的
- 對於數據的多樣性和容量,在普通硬件上處理 – HADOOP
- 需要普通硬件來創建Hadoop集群
Map Reduce /HDFS簡介
- MapReduce – 在多個服務器上分發計算
- HDFS – 為計算過程使數據本地可用(具有冗餘)
- 數據 – 可以是無結構的/無模式的(與RDBMS不同)
- 開發人員負責理解數據
- 編程MapReduce = 使用Java工作(利弊),手動加載數據到HDFS
第二天
大數據生態系統 – 構建大數據ETL(提取、轉換、加載) – 使用哪些大數據工具以及何時使用?
- Hadoop與其他NoSQL解決方案對比
- 用於交互式、隨機訪問數據
- Hbase(列導向數據庫)基於Hadoop之上
- 隨機訪問數據但有限制(最大1 PB)
- 不適合臨時分析,適合記錄、計數、時間序列
- Sqoop - 從數據庫導入到Hive或HDFS(JDBC/ODBC訪問)
- Flume – 將流數據(例如日誌數據)注入HDFS
大數據管理系統
- 移動部件,計算節點啟動/失敗:ZooKeeper - 用於配置/協調/命名服務
- 複雜管道/工作流:Oozie – 管理工作流、依賴關係、鏈式反應
- 部署、配置、集群管理、升級等(系統管理員):Ambari
- 在雲端:Whirr
預測分析 – 基本技術和基於機器學習的商業智能
- 機器學習簡介
- 學習分類技術
- 貝葉斯預測 – 準備訓練文件
- 支持向量機
- KNN p-Tree代數與垂直挖掘
- 神經網絡
- 大數據大變量問題 – 隨機森林(RF)
- 大數據自動化問題 – 多模型集成RF
- 通過Soft10-M實現自動化
- 文本分析工具-Treeminer
- 敏捷學習
- 基於代理的學習
- 分佈式學習
- 預測分析開源工具簡介:R、Python、Rapidminer、Mahut
預測分析生態系統及其在犯罪情報分析中的應用
- 技術與調查過程
- 洞察分析
- 可視化分析
- 結構化預測分析
- 非結構化預測分析
- 威脅/欺詐者/供應商畫像
- 推薦引擎
- 模式檢測
- 規則/場景發現 – 故障、欺詐、優化
- 根本原因發現
- 情感分析
- CRM分析
- 網絡分析
- 從傳票、證人陳述、互聯網動態等獲取洞察的文本分析
- 技術輔助審查
- 欺詐分析
- 實時分析
第三天
Hadoop上的實時和可擴展分析
- 為什麼常見的分析算法在Hadoop/HDFS中失敗
- Apache Hama - 用於批量同步分佈式計算
- Apache SPARK - 用於集群計算和實時分析
- CMU Graphics Lab2 - 基於圖的异步分佈式計算方法
- KNN p -- 來自Treeminer的基於代數的方法,以降低操作硬件成本
eDiscovery和法證工具
- 大數據與傳統數據的eDiscovery對比 – 成本和性能比較
- 預測編碼和技術輔助審查(TAR)
- vMiner實時演示,了解TAR如何實現更快的發現
- 通過HDFS更快地索引 – 數據的速度
- NLP(自然語言處理)– 開源產品和技術
- 外語的eDiscovery – 用於外語處理的技術
大數據BI用於網絡安全 – 獲取360度視圖,快速數據收集和威脅識別
- 了解安全分析基礎知識 – 攻擊面、安全誤配置、主機防護
- 網絡基礎設施 / 大型數據管道 / 實時分析的響應ETL
- 規範性與預測性 – 固定規則基於與從元數據自動發現威脅規則
收集不同類型的數據以進行犯罪情報分析
- 使用IoT(物聯網)作為傳感器來捕獲數據
- 使用衛星圖像進行國內監控
- 使用監控和圖像數據進行犯罪識別
- 其他數據收集技術 – 無人機、身體攝像頭、GPS標籤系統和熱成像技術
- 將自動數據檢索與從線人、審問和研究獲得的數據結合
- 預測犯罪活動
第四天
欺詐分析中大數據的欺詐預防BI
- 欺詐分析的基本分類 – 基於規則與預測分析
- 監督式與非監督式機器學習用於欺詐模式檢測
- 企業間欺詐、醫療索賠欺詐、保險欺詐、逃稅和洗錢
社交媒體分析 – 情報收集和分析
- 罪犯如何利用社交媒體進行組織、招募和策劃
- 提取社交媒體數據的大數據ETL API
- 文本、圖像、元數據和視頻
- 來自社交媒體饋送的情感分析
- 社交媒體饋送的上下文和非上下文過濾
- 社交媒體儀表板以整合多樣化的社交媒體
- 社交媒體檔案的自動畫像
- 通過Treeminer工具給出每個分析的實時演示
圖像處理和視頻饋送中的大數據分析
- 大數據中的圖像存儲技術 – 超過PB級數據的存儲解決方案
- LTFS(線性磁帶文件系統)和LTO(線性磁帶開放)
- GPFS-LTFS(通用並行文件系統 - 線性磁帶文件系統)– 用於大圖像數據的分層存儲解決方案
- 圖像分析的基本原理
- 對象識別
- 圖像分割
- 運動跟蹤
- 3-D圖像重建
生物識別、DNA和下一代識別計劃
- 超越指紋和面部識別
- 語音識別、擊鍵(分析用戶打字模式)和CODIS(綜合DNA索引系統)
- 超越DNA匹配:使用法醫DNA表型構建從DNA樣本中構建面孔
用於快速訪問多樣化數據和顯示的大數據儀表板:
- 現有空應用平台與大數據儀表板的集成
- 大數據管理
- 大數據儀表板案例研究:Tableau和Pentaho
- 使用大數據app向政府推送基於位置的服務
- 跟蹤系統和管理
第五天
如何在組織內證明大數據BI實施的合理性:
- 定義實施大數據的ROI(投資回報)
- 節省分析師時間的案例研究,用於數據收集和準備 – 提高生產力
- 從降低數據庫許可成本獲得的收入增長
- 從基於位置的服務獲得的收入增長
- 從欺詐預防獲得的成本節省
- 綜合電子表格方法,用於計算大數據實施的大致費用與收入增長/節省。
用大數據系統替換傳統數據系統的逐步程序
- 大數據遷移路線圖
- 構建大數據系統之前需要哪些關鍵信息?
- 計算容量、速度、多樣性和真實性的不同方法有哪些
- 如何估計數據增長
- 案例研究
大數據供應商及其產品的回顧。
- 埃森哲
- APTEAN(前CDC Software)
- Cisco Systems
- Cloudera
- Dell
- EMC
- GoodData Corporation
- Guavus
- Hitachi Data Systems
- Hortonworks
- HP
- IBM
- Informatica
- Intel
- Jaspersoft
- Microsoft
- MongoDB(前10Gen)
- MU Sigma
- Netapp
- Opera Solutions
- Oracle
- Pentaho
- Platfora
- Qliktech
- Quantum
- Rackspace
- Revolution Analytics
- Salesforce
- SAP
- SAS Institute
- Sisense
- Software AG/Terracotta
- Soft10 Automation
- Splunk
- Sqrrl
- Supermicro
- Tableau Software
- Teradata
- Think Big Analytics
- Tidemark Systems
- Treeminer
- VMware(EMC的一部分)
問答環節
最低要求
- 了解執法流程和数据系統
- 基本理解SQL/Oracle或關係型數據庫
- 基本統計知識(電子表格級別)
受眾
- 具有技術背景的執法專家
35 小時
客戶評論 (3)
基礎知識很好,喜歡準備的文件和練習
Rekha Nallam - GE Medical Systems Polska Sp. z o.o.
課程 - Introduction to Predictive AI
機器翻譯
Deepthi非常關注我的需求,她能夠判斷何時增加複雜度,何時採取更結構化的方法。Deepthi真正按照我的節奏進行培訓,確保我能夠自己使用新的功能/工具。她先演示,然後讓我自己重新操作,這極大地幫助了我鞏固所學內容。我對這次培訓的結果以及Deepthi的專業水平感到非常滿意!
Deepthi - Invest Northern Ireland
課程 - IBM Cognos Analytics
機器翻譯
他準備充分,並且非常富有同情心
Oliver - Post CH AG
課程 - Splunk Fundamentals
機器翻譯