大數據藍海

大數據在娛樂方面的應用—溫布頓網球賽
溫布頓網球賽(Wimbledon Championship)是世界四大網球公開賽之一,每年吸引上千萬的球迷關注這場賽事。為了維持溫布頓球賽在網球界的重要地位,同時也為了擴增其影響力以及吸引更多的觀眾,主辦單位(All England Club)一直希望能尋求更佳的解決方案來提升其品牌知名度同時帶給球迷更精采且豐富的娛樂體驗,而這也是大數據技術有所發揮的地方。

溫布頓網球賽主辦單位與IBM合作開發了一套強力資訊分析解決方案名為IBM Slam TrackerSlam Tracker採用了IBMSPSS predictive analytics技術,利用過去八年來大滿貫賽事超過四千一百萬筆的資料,進行即時的賽事預測。IBM SPSS predictive engines總共分析了45項關鍵指標,其中包含19項進攻型指標,9項防禦型指標,9項耐力指標以及8項選手模式指標,從中找出對戰雙方克敵制勝的三項關鍵指標,例如2015年的男單決賽由塞爾維亞選手Djokovic對上瑞士選手Federer,系統分析出Djokovic致勝的第ㄧ項關鍵指標是他必須取得超過77%的第一個勝分(如圖十五所示)。除了Slam Tracker之外,IBM也開發了SoftLayer雲端技術,對社群媒體進行監控及分析,此技術可追蹤球員及球迷之間的對話,並收集球迷對於溫布頓賽事的意見及評論,藉由分析這些社群意見,溫布頓主辦單位可即時修正其數位策略,除了帶給球迷更好的賽事體驗之外,也可跟據不同國家球迷的喜好,客製化設計其使用介面,以迎合不同屬性球迷的需求。另外,IBM也開發了名為Watson的雲端彈性儲存技術,此技術可即時監控網頁流量,並在不同儲存媒體之間自動進行資料的搬移,藉此可使影音資料達到近乎無限的使用彈性(scalability),以符合比賽期間廣大球迷對於即時賽事影音資料串流的需求。

圖十五:IBM Slam Tracker所提供的2015年男單決賽對戰致勝關鍵分析

IBM結合其社群(Social)、行動化(Mobility)、智慧分析(Analytics)及雲端運算(Cloud)等四大科技,成功為溫布頓網球賽帶來全新的風貌,因為這項成功,其他著名網球賽事如2015年的法國網球公開賽也開始採用IBM Slam Tracker技術。除了網球賽事之外,這些球員對戰分析技術也慢慢應用於其他領域,如藉由龐大的歷史資料可分析一個企業與其他競爭對手的致勝關鍵因素,讓企業領導者可據此決定企業未來的營運方針,相信未來這些大數據分析技術的應用,會慢慢改變我們未來的生活。
圖十六2015年溫布頓網站所提供的球賽及評論影片

參考文獻

[1]http://www.wimbledon.com/index.html
[2]http://www.telegraph.co.uk/sponsored/sport/rugby-trytracker/10410268/ slamtracker-wimbledon-tennis.html
[3]http://www.avianaglobal.com/category/predictive-analytics/

(本文由本中心數位匯流新創服務團隊提供)
大數據視覺化之企業案例與願景
大數據分析已經成為近年來電腦科學領域之顯學,雖然我們可以藉由電腦自動化處理龐大資料,但最終分析結果經常必需交由人類來進一步解讀,此時「視覺化」(Visualization)工具便扮演著溝通橋樑之重要角色,能夠輔助人類更直覺、快速地觀看與解讀分析結果,使得視覺化成為大數據各項技術挑戰中所不可或缺之一環[7]

為因應大數據時代到來,許多跨國企業皆致力於發展視覺化技術與工具。藍色巨人IBM近幾年推出免費線上視覺化工具Many Eyes [5],提供多樣化表格與圖形工具,讓使用者能夠互動地產生與瀏覽視覺化結果(如圖十七)。此外,IBM更結合Many EyesWatson人工智慧技術,推出線上數據分析網站Watson Analytics [6],以提升個人與企業用戶之數據洞察力與決策正確性。
搜尋引擎巨擘Google旗下的Big Picture團隊[1],多年來投入大數據視覺化技術開發,研究如何讓複雜龐大之數據容易被理解、使用、甚至有趣。基於Google Play Music使用者之音樂資料庫,該團隊統計分析其中專輯、作者、發行日期、音樂類型、…等等資訊,從1950年代開始,將不同時間發行專輯之受歡迎程度,視覺化成一個音樂時間線圖形[2]Big Picture團隊也利用YouTube之影片資料庫,統計分析美國受歡迎的影片趨勢,使用者可以將不同城市、地區、年齡、以及性別之影片喜好,互動地視覺化在美國地圖上。其他視覺化成功案例,讀者可以進一步參閱該團隊網站[1]

圖十七、應用IBM Many Eyes產生之視覺化範例。資料來源為99~103學年度年度由作者開設之【機率與統計】課程,所使用之視覺化方式為「弦圖」(Chord Plot)。
除此之外,軟體服務指標企業Microsoft長時間鑽研多媒體與人機互動領域,更應用相關技術建立一套互動式系統HoloDesk [4],讓使用者不需要透過任何穿戴或輸入裝置,便可以用手即時與虛擬物體或視覺化結果進行互動。2014年四月,Microsoft展示了立體視覺化平台Holograph [8],使用者能夠透過此系統平台,運用各項直覺化互動工具,快速探索與處理複雜的多維度「時空資料」(Spatiotemporal Data),並藉此讓使用者更容易一併瞭解資料於空間當中的變化,以及於時間軸上的演進。

綜合而論,視覺化技術為大數據分析的重要環節之一。根據調查研究報告[9]指出,使用視覺化工具輔助大數據分析之企業,能夠有效提升各種層面之表現,包含:減少決策時間、增加決策準確率、降低營運成本、…等等。因此可以預見未來產業界將全方位地開發與應用視覺化技術,不僅僅為該企業增加短期獲利,更是為爭奪大數據時代霸主之位做好萬全準備。

參考資料
[1]Google. Big Picture Group, June 2015. http://research.google.com/bigpicture/.
[2]Google. Music Timeline, June 2015. http://research.google.com/bigpicture/music/.
[3]Google. YouTube Trends Map, June 2015. http://www.youtube.com/trendsmap/.
[4]Otmar Hilliges, David Kim, Shahram Izadi, Malte Weiss, and Andrew D. Wilson. HoloDesk: Direct 3D Interactions with a Situated See-Through Display. Proceedings of ACM CHI 2012, May 2012, pp. 2421-2430.
[5]IBM. Many Eyes, June 2015. http://www.ibm.com/software/analytics/many-eyes/.
[6]IBM. Watson Analytics, June 2015. http://www.ibm.com/analytics/watson-analytics/
[7]H. V. Jagadish, Johannes Gehrke, Alexandros Labrinidis, Yannis Papakonstantinou, Jignesh M. Patel, Raghu Ramakrishnan, and Cyrus Shahabi. Big Data and Its Technical Challenges. Communications of the ACM, Vol. 57, No. 7, July 2014, pp. 86-94.
[8]Microsoft Research. Holograph: 3-D Spatiotemporal Interactive Data Visualization, April 2014. http://research.microsoft.com/apps/video/default.aspx?id=211209&r=1.
[9]Nathaniel Rowe. Seeing the Big Picture: Visualization for Big Data. Research Report, Aberdeen Group, May 2013. http://www.aberdeen.com/research/8466/ai-big-data-visualization-analytics/content.aspx

大數據報報

大數據結合醫療 挽救敗血症
近年來,醫療上成功將無線生物醫療感測器與大數據分析作結合,此技術可以讓醫療人員能夠隨時監控敗血症患者的生命跡象以及其他信息,當發生不尋常異狀時,裝置會透過無線連接到智慧手機,讓醫護人員能夠立即採取必要行動。【CIO/2015-06-17全文
數據應用新趨勢 大數據、物聯網、智聯網大數據能夠有效控制病情
Jim Davis預言,2017年前全球將有600億個終端感應裝置提供龐大的數據資料。企業最大的資產在於數據資料,如何將數據資料轉變成有價資產才是重點,台灣主要是一個以中小企業為主的市場,善加應用大數據,必然可為企業開啟新事業。【聯合財經網/2015-06-18全文
IBM大規模開發Spark
大數據的應用越來越廣泛,而Spark提供了大數據處理與分析能力,正是此背景下,IBM決定大規模贊助Spark,預計投入超過3500名開發者,此舉將強化公司在大數據領域的地位,更能吸引更多開發者加入它的生態體系。【數位時代/2015-06-19全文
中國大數據進入到應用期
中國大數據市場日漸茁壯,許多企業也開始湧入此領域,使得大數據發展從概念期進入到應用期。以計程車市場為例,能夠提供高效率、快速的叫車模式全是因為大數據的功勞。【國際日報/2015-06-19全文
Lyre Health獲得Castlight Health 310萬美元投資
心理保健大數據公司Lyra Health於日前獲得 Castlight Health 310萬的投資金,將能得到 Castlight 的醫療數據,而Lyra累積的數據越多,能夠提供的預測分析和治療就會越精準,就能加快自己的研發進程,另外,Lyra也主張透過大數據分析及篩檢並以最高效率、最低成本替患者治療。【TechCrunch /2015-06-26全文
彭淮南善用大數據 掌握市場動態
根據外匯外交易員說法,央行大數據,是包括外資進出動態、在股市買賣超情況和其他匯市交易資訊等,簡單來說,央行會利用大數據結果去「維持外匯市場秩序」。【中時電子報/2015-06-26全文
如何利用大數據幫助行銷團隊 聘用數據科學家
數據隨著時間日益豐富,預計在2020年將有44倍的數據產生,另外,根據麥肯錫研究報告指出,2018年,美國將出現14-19萬深度分析專才的需求職缺以及150萬經理和分析師,在在顯示出數據分析師的人才缺口情況。另外,針對市場行銷,科學數據才是能夠成為有效決策能力的關鍵。Entrepreneur Media/2015-06-27全文
台灣大數據 三大問題
目前台灣的大數據面臨三大問題,第一是整合過少,如網路社群需要各種人才整合,科系與科系間也未能夠統合; 第二是資料取得困難,因為個資法的牽絆,導致有很多資料都無法取得; 第三是國內人才外流,擁有大數據人才大量外流到國外。【風傳媒/2015-06-27全文
大數據和開放科學數據
隨著數據越來越多,缺乏的不再是數據,而是不知道如何管理龐大的數據,開放數據也是目前的趨勢,知名數據分享案例─人類基因組計劃就是強調任何人都可以免費下載人類基因數據,其目的就是為了讓數據能夠被重複利用、搜尋和探勘。【insideBIGDATA /2015-07-02全文
Camden利用大數據幫助降低稅收詐欺
Camden現利用IBMInfoSphere平台進行大數據分析以減少自治區的詐欺,集中存儲並管理16個倫敦跨系統數據,並創建平台創居民指數,旨在幫助解決討債,非法轉租和欺詐;另外,居住指數以經證明其價值,如讓議會更有效率,這也表示利用科學數據將能有效提升公共服務水平。【BUSINESS CLOUD NEWS/2015-07-03全文
資策會雲端大數據館
資策會在「臺北國際軟體應用展」推出「雲端大數據館」,並規畫展出「智慧觀光平台暨個人化服務應用」、「Bistro巨量資料管理平台」、「CAFE及新創雲端公司」等項目,企盼開發個人專屬的智慧觀光整合服務、大數據分析管理平台等。【中時電子報/2015-07-07全文
大數據軟體市場 將有6倍成長空間
根據Ovum信息管理軟體市場規模預測報告,大數據軟體市場到2019年將會成長6倍,其中OVUM報告者之一Tom Pringle表示:「大數據的實驗時代即將結束,企業開始正式使用大數據來實現它們期望獲得商業價值。【F. Firstpost/2015-07-08全文
大數據對旅遊業的三大效益
根據調查指出,旅遊業以及運輸業最容易出現訊息爆炸的問題。IBM團隊研究指出,如果將大數據應用於這些行業中,將有三大效益:第一、幫助顧客創建一個更完善的旅程,並藉由分析顧客需求,提供客製化服務,增加與客戶的互動以及忠誠度。第二、藉由分析歷史訊息,提供最合理的價格。第三、提高企業對於資產的安全性以及設備的使用壽命。【Forbes/2015-07-09全文
Teradata的大數據應用
Teradata推出數據湖管理解決方案Teradata Loom® 2.5於今年8月發佈,將幫助用戶更輕鬆地搜尋、存取並分析數據湖中的資料,並整合成高效率之分析生態系統。其利用『全部存儲法』(Store-everything approach),並去除技術上的複雜度,將有助企業專注於高價值業務活動。【InformationWeek/2015-07-09全文InfotechLead/2015-06-09全文
如何利用大數據拯救環境
最新NASACALIPSO衛星蒐集大量大氣層中的塵埃數據,並將這些數據製成影片─撒哈拉沙漠塵埃是如何被風携带到南美洲亚马逊雨林,沙塵中含有植物所需的營養「磷」,科學家希望能透過這些數據幫助南美洲亞馬遜森林植物成長,這也顯示出生態系統環環相扣的特性,另外,空汙也是目前環境汙染重要因素,希望透過採集的數據能夠幫助面對危機。【SALON/2015-07-19全文


活動訊息

2015 大數據論壇-Taiwan
2015815816日在臺北市松山區敦化北路240號舉辦,本次論壇將與產業鏈各環節的專業人士共同交流大數據領域前沿技術與發展趨勢,探討如何使用更有效的架構捕捉、存儲、整合、管理和分析大數據,支援企業決策和業務發展,實現大數據的商業價值。會議網站
2015 台灣資料科學愛好者年會」
2015820823日在中央研究院人文社會科學館舉辦,採取多軌並行,以豐富且多元的方式分享技術、經驗以及交流成果。今年的活動包含「年會主議程」、「R 資料分析上手課程」、「g0v 零時政府黑客松」、「DSP 資料開竅 企業論壇」、「資料新聞實戰營 (d|Bootcamp Taipei)」、「Hadoop/Spark 資料科學快速體驗營」、「地圖資料視覺化課程」會議網站
CPR south 2015研討會 (由元智大學大數據與數位匯流創新中心主辦)
2015826828日在台北福華文教會館舉辦,會議主題為方興未艾的資通訊科技治理與實踐─匯流與大數據,會議各場次將包括「南方」各國在資通訊科技政策與管制上的最新發展,並討論相關政策的研究平台,每一論文報告的場次將會有兩位資深的學者分別擔任主席以及評論人,以針對該場次所發表的論文提供具建設性建議。會議網站
The International Conference on Big Data, Internet of Things, and Zero-Size Intelligence (BIZ2015)
201598910日在馬來西亞Asia Pacific University of Technology and Innovation舉辦,活動為期三天,主題有大數據模型、經濟、企業、科學應用、資料探勘等主講嘉賓有Antonis Mouhtaropoulos以及Raju Chellam,。會議網站
2015生物醫療大數據高峰論壇
2015910911日在上海斯波特大酒店舉辦,研討會將會討論醫學大數據收集與分析的規範、端----端的處理,並探討醫學大數據在疾病風險評估等臨床應用方面的意義,為促進相關專家與行業領導者的交流搭建一個平台。會議網站
DDDMBD 2015 - The International Conference on Database, Data Warehouse, Data Mining and Big Data (DDDMBD2015)
2015910912日在印尼Surya University舉辦,研討會主題大致上可以分成資料探勘、大數據以及數據庫,主講嘉賓有Eunice Sari以及Benhard Sitohang會議網站
2015大數據技術與產業應用大會TDWI San Diego
2015918920日在中國安徽蚌埠舉行,將針對大數據領域內的熱點議題和高端技術,邀請海內外知名學界代表、工業界代表出席會議並做精彩報告,引領領域前沿、投資熱點,齊聚國內外頂級專家、業界精英,打造具有影響力的國際盛會! 會議網站
TDWI San Diego
2015920925日在美國加州聖地牙哥舉行,主題大致上是大數據、資料視覺化、數據分析、資料建模管理、資料倉儲及商業智慧等,從傳統的結構型資料到大數據,將會有先進的技術分析,並快速提供業者學習相關的科技及商業經驗! 會議網站

主題亮點 ─ 資料去重複技術裡的安全議題

Security issues in data deduplication techniques
背景

目前最被大眾所接受的雲端服務就非雲端儲存 (cloud storage) 莫屬了。Cloud storage所提供的服務就是提供使用者 (user) 儲存空間讓user能夠備份上傳他們的資料,並且進行雲端與user所持有的不同裝置做資料同步。目前著名的cloud storage包含Bitcasa (https://www.bitcasa.com/)Dropbox (https://www.dropbox.com/)Google Drive(https://www.google.com/drive/)Microsoft One Drive (https://onedrive.live.com/)SpiderOak (https://spideroak.com/)Wuala (https://www.wuala.com/)等。這些cloud storage的一個共同特徵就是都會給予未付費使用者 (free user) 一定程度的免費儲存空間 (free space)。譬如Dropbox會給予2GBfree spaceGoogle Drive會給予15GBfree spaceFree user即可隨意使用這些free space來儲存備份資料。但是cloud storage要如何精簡且有效率地儲存user所上傳的資料則是個大問題。這是因為除了付費使用者的資料當然得妥善保存之外,現在的free user往往都會註冊多個cloud  storage的帳號來多獲取一些free space,而雖為free user的資料,但是cloud storage仍不能讓其漏失,以上種種都加重了雲端儲存營運者 (cloud storage administrator) 的儲存成本 (storage cost)

資料去重複技術的各種分類
就以data deduplication來說,雖然其背後的原理只是「不要將相同的資料重複儲存」,但是就以實際上各種應用的data deduplication實作來說,則會有不同的分類方式。在此,我們考慮一個可能會是多人使用的cloud storageDropbox,在這樣的cloud storage上面,首先,可以針對「是否對於不同user的資料來進行data deduplication」來做分類。如果只能對個別user account內的資料進行data deduplication的話,即稱之為 single user data deduplication,而若是可以把所有user account內的資料一併考慮進去,統一進行data deduplication的話,即稱之為crosse user data deduplication (或又稱global data deduplication)。根據「資料上傳者是否會得知上傳的資料已經有重複」來區分的話,將可以區分成server-sideclient-side data deduplication兩種。就以前者來說,user想上傳資料的話就直接進行上傳,而由cloud storage來決定是否儲存剛獲得上傳的資料。而以後者來說,user在實際上傳資料之前,會先計算對應於資料的deduplication tag,並且先將deduplication tag上傳至cloud storageCloud storage在經由deduplication tag的比對來確認是否已經存有對應的資料之後,會通知user是否需要再上傳資料。其中,deduplication tagfile-based data deduplication是採用完整檔案下去做如SHA256hash,而在chunk-based data deduplication時則是用各chunk下去做hash。可以知道,因為如果cloud storage已經存有對應資料了,則甚至資料不用再被重複傳輸,因此,client-side data deduplication是一個除了可以獲得storage saving之外,還可以獲得bandwidth saving的作法。

目前許多cloud storage為了節省storage cost,也為了bandwidth saving與提昇使用者滿意度,均採用cross-user chunk-based client-side data deduplication。譬如WualaDropbox就是使用chunk size固定為4MB,且hash functionSHA256cross-user chunk-based client-side data deduplication。因為chunk-based這個特性不好被畫出來且和將討論的安全議題無關,我們先以下圖來表示cross-user client-side data deduplication的運作方式。首先,在圖一(a)時,user 1想上傳F1F2兩個檔案,首先,user 1先算出並上傳h(F1)h(F2)兩個deduplication tag,這裡假設cloud storage還沒有F1F2的複本,所以cloud storage傳回兩個negative ACK (圖中以0表示) 通知user 1繼續完整上傳F1F2。接著,在圖一(b)當中,user 2想上傳F1F3兩個檔案,user 2算出並上傳h(F1)h(F3)兩個deduplication tag,因cloud storage已有F1,所以cloud storage傳回一個negative ACK 與一個positive ACK (圖中以1表示) 通知user 2只需完整上傳F3即可。這裡可以看出,雖然從user的觀點來看,deduplication tag的傳輸都是多餘的,但是卻可以藉此得知資料是否已經存在cloud storage並獲得更多的storage saving
圖一:Cross-user client-side data deduplication的運作範例

安全與隱私顧慮
2010年開始有研究指出,具有data deuplication,尤其是cross-user client-side data deduplicationcloud storage (以下簡稱deduplicated cloud storage) 雖然可以獲得storagebandwidth saving但是也多了安全與隱私上的顧慮。譬如從圖二(a)可以看出,攻擊者可以藉由上傳可能的hash 以及觀察deduplicated cloud storage所做的回應來獲知對應的檔案是否已經存在於deduplicated cloud storage內,導致檔案的隱私性被破壞。而從圖二(b)可以看出deduplicated cloud storage會被濫用而成為一種covert channel。更仔細一點地來說,譬如兩個攻擊者之間的通訊若是被監聽,而假設他們事前已經同意一個共同的檔案,則他們藉由上傳或是刪除那個共同檔案,換言之,經由deduplicated cloud storage內那個共同檔案的存在與否,則可以建立起一個low-bandwidthcovert channel來進行秘密傳輸而不被發現傳輸正在進行當中。


圖二:各種deduplicated cloud storage不一樣的安全與隱私攻擊

而從圖二 (c)可以看出deduplicated cloud storage會被濫用而成為一種CDN (Content Delivery Network)來協助檔案的分配傳送。這樣的情況最常出現在不特定的多人想要共同分享同一份大檔案。因為是大檔案,所以無法經由一般的email附件來傳送。而假設攻擊者又不想付費取得相對應的storagebandwidth資源,所以原始的資料擁有者可以先上傳想分享的資料至deduplicated cloud storage,然後將相對應的deduplication tag傳遞給其他人。此時,收到deduplication tag的人假裝他仍要上傳同一份資料,並且也給予deduplicated cloud storage那些deduplication tag。在看到相同的deduplication tag之後,deduplicated cloud storage會認為此時上傳deduplication tag的人也只是恰好擁有相同資料,而中斷資料的傳輸並讓此人獲得資料的擁有權。至此,此人即可順利下載資料,且以deduplicated cloud storage的角度來看,他只是下載自己的資料,並不算在需要付費的頻寬限制之內。這樣的攻擊並不僅只是研究人員的想像,已經有一套open sourcesoftware稱為Dropship被開發出來,可以利用Dropboxdeduplicatio技術來進行這樣的cloud storage濫用。

還有,從圖二 (d)可以看出deduplicated cloud storage上的資料也有可能被攻擊者所惡意下載。這裡是說,如果攻擊者想下載某份檔案,但恰巧只擁有檔案的deduplication tag的話,即可利用類似上述方法,攻擊者先假裝自己要上傳檔案,藉此來獲取檔案的擁有權,之後再逕行下載即可獲得本不屬於攻擊者的檔案。

解決方法
回顧我們在圖二所闡述的關於deduplicated cloud storage所遇到各種安全與隱私問題,從2010年開始,有研究人員提出Proof of Ownership (POW)的概念來解決data deduplication的安全問題。觀察到圖二的問題主要是攻擊者都利用了「上傳同樣的hash之後,deduplicated cloud storage即會不加以檢查而直接認為上傳hashuser是擁有對應的資料」的這樣弱點,POW就針對這樣關於data deduplication的弱點加以防護;POW scheme當中,一旦有user上傳了deduplicated cloud storage內已經有的deduplication tag之後,deduplicated cloud storage將會在連結對應檔案與user之前,先隨機要求user回傳檔案內的幾個bit。如果user能順利回答那幾個bit0或是1,則deduplicated cloud storage相信user真的是擁有對應資料。反之,若是user無法順利回答那幾個bit0或是1,則deduplicated cloud storage認為方才上傳deduplication taguser是攻擊者,只想騙取檔案的所有權。而有些POW則是觀察到deduplication tag的計算需要過多I/O,但是用於client-side data deduplication判別是否有無資料存在於deduplicated cloud storage中的deduplication tag其實並不需要一般如MD5或是SHA1般的繁複計算量。因此,一些 POW 各自提出一個並非cryptographic use而有collisionhash function,能大幅降低計算hash所需的時間,藉此來提升 POW scheme 的效能。
(本文由本中心游家牧教授提供)


主題亮點 ─ 應用大數據於交通運輸

應用大數據於交通運輸
Big Data Applications on Intelligent Transportation
隨著物聯網熱潮迅速漫延,車聯網概念的興起是引領交通運輸智慧化的創新關鍵,從現在開始,汽車不單只是交通運輸工具,其可望變身為一個獨立暨龐大的行動裝置,為智慧交通系統(ITS)開起革命性的進化,蓄勢爆發的能量不容小覷。
圖三:計程車GPS軌跡
元智大學大數據中心的智慧交通運輸團隊利用大數據分析處理技術,挖掘交通大數據在發展智慧城市的各種應用;該團隊表示,目前正積極的與桃園縣交通局合作,藉由交通局提供桃園縣各公車的行車資料,包含公車車號、行駛路線及GPS定位資料、以及各路口的號誌資料,方便後續發展節能減碳及省時路徑規劃方面的應用,並期待以大數據技術精準預測公車到站時間。除此之外,該團隊為增加數據資料的多樣性,同時與桃園縣計程車公會合作,取得桃園縣近2000輛計程車的行車資料,包含車輛GPS經緯度、載客狀態、日期等,其中部分計程車裝置OBD (車上診斷系統),目前APP可以抓取車中的25項資訊,最多能同在頁面中顯示出六項資料出來,能夠讓使用者自行變更顯示方塊的顏色以及想要顯示的資訊,在功能上目前如果有數數值異常時,顯示數執會變成紅色提醒駕駛,例如水溫過高時,數值會呈現紅色警示駕駛(如下圖四)

圖四:OBD2 APP示意圖
除此之外,該團隊亦積極開發車載自動診斷系統(OBD2),目前OBD2可監控的即時行車狀況多達80幾種,包括有行車速度、引擎轉速、冷卻水溫及電瓶電壓等,但經過研讀與篩選並以實際行車測試後,共篩選出可以取得的31項行車資料項目如燃油系統狀態、引擎負荷值、引擎運轉時間、加速踏板距離、噴油時間等。藉由車上OBD2的設置,可以收集更多樣的行車資料如行車車速及油耗資料等,這些資料的蒐集、裝置成本的投入皆是為了研發另一個技術核心亮點─智慧綠能行車系統。

圖五:省時省油路徑規劃操作介面
在透過以上公私部門(公車定位資料與計程車駕駛資料)雙管齊下的資料蒐集,可以估算大桃園地區各道路的行車路況,該團隊目前進行此方面的資料蒐集是為了發展比Google map或導航王更為智慧更為貼心的智慧綠能行車系統,此系統含括了省時路徑導航、省油路徑規劃、停等紅綠燈油耗分析等研發;在省時路徑導航部分,是以行車歷史資料作為規劃行車路徑的依據,再利用行車數據進行切割與組合,進而產生最佳X條路徑,供駕駛人即時選擇耗時極小化的路線。再者,省油路徑規劃與停等紅綠燈油耗分析的研發概念是接近的,是利用車載機OBD2所回傳的油耗資訊,進行行車路徑時間以及行車耗油量的預估,據此提供駕駛人最佳的省油路徑規劃,在這油價不斷喊漲的時代,省油等於省下荷包,其應用價值預期可提供計程車業者提升營運品質與效率或地方機關進行道路規畫等,除此之外,亦能為地球帶來節能減碳的高效益。

智慧綠能行車系統的研發主要是應用在駕駛人可以透過該系統的服務知道哪一區段路線是較為壅塞的或是有交通事故、道路施工等情況發生,用路人可以即時的判斷進行選擇避免更為耗時、耗油的替代路線。然而,智慧綠能行車系統的發展,除了為駕駛人帶來省時省油的經濟效益之外,亦為駕駛人帶來更順心、更舒適的行車體驗。

為了瞭解甚至預測交通現象,本團隊也正在研究交通模型,其中包含離散的細胞自動機(cellular automaton)模型與連續模型,這些模型有助於瞭解壅塞情形之傳遞、平衡狀態之穩定性等,目前這些模型的研究幾乎都是靠統計物理學家利用人造資料進行模擬,本團隊則冀望在資料密度夠高後,能夠首創以真實資料搭配這些模型,進而預測交通。

本團隊也關注最大流量(maximum flow)問題,這個問題問的是在一個網路中,如何最大化起點至終點的最大流量,同時不讓任何一條道路超過其負荷量,作為演算法領域研究幾十年的基礎問題,要在這個問題上再取得突破極為困難,但前年麻省理工學院的Orlin教授有一篇重大的演算法突破,可將此問題的時間複雜度壓到正比於點數和邊數之積,本團隊正在研究是否有可能為這個新的演算法找到交通上的應用。
(本文由本中心智慧交通運輸團隊提供)