Confluent上市與Cloudera私有化背后:從硅谷大數據公司的勢力更替看數據分析的未來

圖片來源@視覺中國
文 | 愛分析
隨著數字化的深入,Hadoop架構的分析平臺在成本和業務需求上越來越不能適應企業的要求,因此國內外領先的大數據公司都在轉向云原生。云原生架構由于具有彈性伸縮、低成本、敏捷性的優勢,正在逐步取代Hadoop,成為新一代數據分析平臺的基礎。而新一代的數據分析平臺也將具備云原生、存算分離、容器化、自動化、湖倉融合、訂閱制等特征。區別于美國市場,中國市場的私有云會與公有云共同發力,企業應該看清趨勢,盡早做好下一代數據平臺架構的選型和搭建。

技術的發展都有著自己的生命周期。在技術從起步到成長,再到成熟、衰退,最終被新技術所取代的過程中,商業化公司一直起到了重要的推動作用,但它們也終將因為技術的迭代而改變自身的走向。
大數據行業近期發生的兩件大事,印證了數據分析領域的技術也遵循著這樣的演變規律:兩家硅谷大數據公司分別IPO和私有化。
6月25日,Apache Kafka商業化公司Confluent正式登陸納斯達克,首日開漲25%,市值超過110億美元。Confluent成立于2014年,其提供的是一個實時事件流平臺,具有高吞吐、低延時、高可用和數據持久性的能力。公司在2018年推出云原生版本產品Confluent Cloud,并將云原生作為公司的主要戰略。
而在此前的6月初,Cloudera卻被私有化退市,這一消息令人唏噓。因為Cloudera從2008年成立至今一直是Hadoop生態的領導者,其開發的產品以及背后基于Hadoop開源技術的生態曾是企業首選的大數據分析解決方案。但Cloudera自2017年5月上市以來一直表現不佳,先后經歷過股價腰斬,與業內第二名Hortonworks的合并抱團,以及現在的私有化退市,也代表了Hadoop的頹勢。
作為同是出自Apache的頂級項目,為何Confluent和Cloudera卻在同一時間在資本市場走向了完全相反的方向?Hadoop為何走向衰落,數據分析技術的未來又會走向何方?愛分析基于對相關領域的持續研究和積累,以及對業內專家的訪談,嘗試對這兩起事件折射出的數據分析技術的演進趨勢做出分析解讀。
01 成本與業務需求雙重因素驅動下,Hadoop從興起走向衰落
從企業用戶的視角,成本和業務需求實現是技術選型的核心考量。而這兩個因素在不同時代的演變,既造就了Hadoop的興起,也解釋了現在Hadoop為何開始走向衰落。
在數據分析技術的演進過程中,成本是首要驅動因素。
在2004年Hadoop誕生之前的近20年中,數據分析技術一直被大規模并行處理(MPP)架構所主導。以Teradata為代表的MPP數倉產品采用基于專有物理硬件的軟硬件一體機架構,因此企業在擴展存儲和計算資源時需要付出高昂的成本。隨著大數據時代的到來,數據量不斷加大,企業越來越不堪成本支出的重負,紛紛轉向了在軟件層面開源免費,硬件層面可以采用廉價PC服務器的Hadoop架構。
但Hadoop架構在成本上對客戶而言依然不是最優解。在數字化應用已經無所不在的今天,企業對存儲和計算資源都提出了更高的要求。Hadoop沒能進一步解決算力和資源的優化問題,也在擴容成本和運維成本上逐漸不能適應企業要求。
在擴容成本方面,Hadoop雖然在軟件架構層面實現了計算與存儲的分離,但其在硬件層面仍然基于無共享架構,計算和存儲資源是耦合的。然而今天企業在計算和存儲資源上的擴展需求往往并不同步:計算資源通常僅需在負載高峰期進行擴展,而存儲資源的擴展一般是長期、線性的過程。企業無法按需獨立擴展計算和存儲資源,必然帶來資源的浪費。此外,Hadoop的擴容時間成本也非常高,通常Hadoop集群擴容一倍,企業僅在硬件的采購和部署上花費的時間就需要半年或以上。
在運維成本方面,由于Hadoop的解決方案通常是從其生態中的數百個開源項目中選擇一堆技術組件組合起來實現相關功能,這樣的體系非常復雜,且組件間的耦合度非常高。隨著Hadoop生態技術組件越來越龐雜,組件之間的耦合性和差異性要求開發和運維人員具備全棧能力,給企業帶來了不菲的運維成本。
成本因素之外,業務需求的變化則在另一個層面驅動了數據分析技術的迭代。
在數倉時代,企業的數據分析需求以處理結構化數據、為業務人員作報表應用為主,MPP架構在當時能夠很好地滿足這些需求。
但隨著互聯網、移動互聯網的逐步普及,企業內沉淀的數據量呈現出爆發式增長,不僅數據量本身變得很大,數據類型也從原來的結構化數據為主,發展為包含各類結構化、半結構化、非結構化,以及圖片和音視頻數據。MPP架構無法承接對大量非結構化和半結構化數據的處理,而Hadoop架構由于生態內具有眾多組件能夠實現不同功能,可以處理復雜類型的數據,其分布式架構也能夠為企業實現大數據分析的高性能,以Hadoop為基礎的數據湖架構興起。
然而近年來,企業面臨的數據分析業務需求也發生了重要改變,使得Hadoop越來越不能很好地滿足企業日益復雜的分析需求。這些改變主要體現在三個方面:
1)隨著數字化轉型浪潮的推進,企業有越來越多在線化、互聯網化的業務場景,上云的滲透率越來越高,大量數據的產生、采集和應用都發生在云端,而更適應本地化部署特性的Hadoop很難滿足企業數據流動的需要。
2)同樣隨著企業數字化的深入,企業產生了大量創新性的數據應用需求,需要快速落地、快速迭代。而Hadoop架構由于過于繁重,無法適應企業對數據應用的敏捷性需求。
3)人工智能和機器學習在數據分析領域的應用正在加速落地,而一些高級的分析框架,比如TensorFlow,其分布式架構在設計之初就是基于云原生架構,沒有考慮過Hadoop架構,因此在Hadoop上很難部署和運行這類高級分析框架。
02?云原生架構的浪潮已經到來
既然Hadoop在面對新的數據分析需求時已經展現出種種不足,那下一代架構是什么?事實上,包括Confluent在內的新一代大數據公司已經回答了這個問題——擁抱云原生。云原生是指在應用的設計階段就為了云的運行環境而設計,包含微服務、容器化、DevOps、持續交付等特征,充分利用和發揮云平臺的彈性和分布式架構的優勢。
由于意識到企業用戶的需求正在往云端、存儲計算分離、敏捷等方向上發展,一些領先的大數據公司早在幾年前就將重點放在了云原生版本的產品上,也由此獲得了顯著的成功。
以剛剛IPO的Confluent公司為例,其所代表的開源流數據工具Kafka最早也是源自于Hadoop生態。Kafka為不同數據源之間數據的交換這個任務而生,Confluent將Kafka商業化推出Confluent Platform并取得了成功,隨后在2018年推出了云原生的版本Confluent Cloud,為用戶提供完全托管的云端服務,具備彈性伸縮以及支持用戶敏捷開發等特性。
根據Confluent招股說明書,Confluent Cloud在2020年取得了3140萬美元的訂閱收入,2019年、2020年和2021年前3個月的增速分別達到454%、117%和124%。盡管Confluent Cloud的收入目前僅占到公司總收入的20%左右,但其表現出的成長性遠超本地產品Confluent Platform約50%的增速。Confluent在招股說明書中也強調了公司云原生的戰略,并將Confluent Cloud視為公司未來收入增長的最重要產品。這應該也是資本市場給與Confluent高度認可的主要原因。

在此之前,去年IPO、市值曾達800億美元的明星大數據公司Snowflake,更是云原生的代表。Snowflake針對云計算環境將產品特性進行了深度優化,在云端向客戶提供簡單易用、彈性伸縮、按使用量計費的一站式數據管理和分析平臺。其突出特征是支持計算、存儲節點單獨擴展,從而實現了資源的精細化管理,有效降低了擴容成本,同時可以做到按使用量付費。
同樣是硅谷熱門的大數據公司Databricks,其提供的是一個云上的面向數據分析師和數據科學家的大數據分析平臺,用戶可以通過Databricks在云端環境中實施整個大數據方案,從數據提取、數據轉換、交互式處理,到數據產品等。Databricks底層計算使用Spark,存儲使用Delta云存儲服務,支撐了企業在云端對各種結構化、半結構化和非結構化數據的分析。
國內廠商中,源自Apache Kylin的大數據管理和分析平臺提供商Kyligence也是一個典型的案例。據Kyligence聯合創始人兼CEO韓卿表示,公司在成立之初產品是基于Hadoop架構的,但在2018年左右,公司敏銳地預判到客戶的需求逐漸在往云原生、存儲計算分離的方向上發展。因此Kyligence對原有產品架構做了一些新的設計,在2019 年推出了完全脫離Hadoop平臺的云原生產品Kyligence Cloud,其底層使用了云原生架構,存儲使用云廠商的對象存儲,計算使用Spark+容器化,資源可以直接對接云平臺的IaaS服務和ECS。Kyligence Cloud通過多維數據立方體(cube)預計算、分布式聚合索引和云原生彈性架構結合,不僅顯著簡化了云上數據倉庫和數據湖的數據處理和分析工作,同時也大幅降低了企業使用云分析的成本。因此,Kyligence Cloud獲得了諸如UBS等國內外頭部公司的認可和采用。
可以看到,云原生架構的浪潮已經到來。總結起來,云原生架構之所以在當下被越來越多地采納,主要在于其三方面的顯著優勢:彈性伸縮、低成本和敏捷性。

首先是云原生架構為數據分析帶來的彈性伸縮能力。因為云原生架構可以輕松實現計算和存儲資源的分離,企業可以做到按照實際需求分別購買存儲和計算資源,并隨啟隨停,真正實現按照資源消費量來付費,與此同時,在云端的擴容也可以在幾分鐘內完成 。這種使用方式極大地優化了企業對資源的使用效率,降低了使用成本。
其次,云原生架構也極大地降低了企業的運維成本。因為在云原生架構下,云廠商提供了完整的IaaS基礎設施,省去了企業硬件投入和運維工作的同時,企業也能充分運用IaaS的底層分布式框架實現各種操作,從而大大降低系統復雜性,提高系統運行效率。
最后是敏捷性。隨著企業數字化和智能化應用的深入,云原生架構彈性伸縮、存算分離支撐下的按需付費特性,能夠讓企業花費很少的成本先嘗試新應用。如果應用效果好,企業可以在此基礎上加大投入繼續推進;如果方向出現問題,企業可以及時停止項目,沉沒成本能夠控制在很低的水平。這樣的敏捷性很好地支撐了企業去嘗試各種新的數據應用,從而增強了企業的競爭優勢。
03?云原生時代,新一代數據分析平臺將具備哪些特征?
基于對企業數字化轉型與數據分析需求的趨勢判斷,并結合領先大數據公司在產品設計上采取的技術路線,可以看到,以云原生架構為基礎的全新的數據分析平臺將成為未來的主流。云原生特性作為技術架構層面的變化,也將為企業數據分析應用帶來更多的可能。對此,愛分析從技術、數據架構和商業模式三個維度總結了下一代數據分析平臺將具備的特征。
從技術維度,下一代數據分析平臺將會具備云原生、存算分離、容器化和自動化四個特征。
1)云原生。隨著云計算的逐漸普及,企業上云步伐的加快,企業主要的IT基礎設施都將部署在云端,因此數據分析平臺以及數據的分析和應用都將主要在云端進行。
2)存算分離。隨著企業對數據分析應用需求的持續增加,計算資源的擴展需求進一步增長,存算分離的價值也將凸顯。企業可以按需對存儲和計算資源在云端分別進行擴容,由此能夠以很低的成本獲得近乎無限的算力。
3)容器化。基于云原生的背景,未來企業的數據應用在很多情況下,將會跨云甚至跨基礎設施進行。容器化的價值在于可以讓企業在不同的基礎架構之上快速構建統一的數據分析平臺,實現數據應用的平滑遷移。
4)自動化。傳統的數據分析平臺在分析和應用的多個環節仍然依靠人工進行處理,比如數據標注、數據清洗。通過在數據分析平臺中應用AI增強技術,首先可以在云端對存儲和計算資源分別做自動優化,提高資源使用效率,為企業降低成本;其次,在數據清洗、數據建模、數據分析等環節使用自動化,能夠極大地提升分析平臺的易用性,節省大量人力成本,提升數據應用開發的敏捷性。對AI增強技術的大量采用也正是Snowflake具備出眾易用性的原因。
在數據架構維度,隨著數據分析的復雜度以及企業對數據分析實時度的要求越來越高,傳統的數據倉庫與數據湖割裂的局面將會走向融合。Gartner認為,數據倉庫通常是用已知數據解答分析已知問題,數據湖通常是用未知數據解答分析未知問題,而新的數據架構需要解決的是這兩種場景之上模糊地帶的需求。而根據研究機構EMA將新一代架構定義為“統一分析倉庫”(Unified Analytics Warehouse),這種新的數據架構需要具備高性能與企業級完整度、分析靈活性與低延遲、高擴展性及與現有設施的兼容性這三個方面的能力。此外,業內也有“湖倉一體”的提法,尚未達成統一。對此,愛分析會在后續的研究中詳細探討。
最后,在商業模式維度,技術架構上的變化也將帶來商業邏輯的變化,訂閱制、按需付費將會成為企業使用分析平臺的主要付費方式。由于在云原生架構下可以支持存算分離和彈性伸縮,企業不再需要在前期先投入大量成本購買硬件,而是可以在云端基于需求按使用量付費,實現“Pay as you go”。訂閱制從根本上顛覆了企業使用數據平臺的付費方式,其對于企業的核心價值是使得企業可以以很低的成本探索各種創新型的數據應用,從而使數據發揮更大的價值。同時,訂閱制也驅動廠商更加持續關注企業客戶成功,保持與客戶長期共生和互利的關系。以Kyligence為例,其全線產品目前在國內都已經廣泛采用訂閱模式來服務客戶,尤其是在銀行、保險等金融行業頭部客戶也已采納訂閱制,這說明國內企業的付費觀念已經發生變化,在美國已經是主流的訂閱制的付費模式同樣也適合中國市場。
04?中國市場的云原生:起步更晚,私有云占據關鍵地位
以上對數據分析走向云原生架構趨勢的總結,主要基于對美國市場的觀察。相比美國市場以公有云為主導的市場環境,中國市場會呈現出明顯差異。
首先,中國云計算市場起步時間較晚,相比美國落后五到七年左右,同時企業尤其是傳統企業的上云步伐也不如美國企業激進,大量業務數據仍然停留在傳統IT環境中。因此,中國市場轉向云原生的滲透仍然有數年的窗口期,在這個架構迭代的窗口期內,包括傳統數據庫廠商、云廠商和新興廠商在內,各方參與者的競爭格局將發生新一輪洗牌。
其次,由于政策監管、行業特性和觀念等因素,國內以金融和政府公共事業為代表的行業企業以及央國企,中長期來看仍將采納以私有云、行業云為底座的混合架構,公有云很難占據主導地位。因此,面向中國市場的云原生架構的數據分析平臺,需要考慮如何在以私有云為主的架構環境下,仍能讓企業用戶充分享受到云原生特性帶來的優勢,這背后有大量問題需要解決。
以Kyligence為例,其針對國內外市場推出了不同版本的解決方案。在國際市場,Kyligence對接了公有云平臺Azure和AWS,用戶可以在線購買和使用其產品,服務了包括UBS這樣的行業頂尖客戶。在國內市場,Kyligence除了提供公有云和本地部署版本的產品,也推出更適合國內企業客戶的私有云版本產品,并且其私有云版本產品獲得了多個大型金融機構的采用。
Hadoop的時代已經走向落幕,云原生是大勢所趨。但Hadoop并不會在這個時間點很快消亡,而是會平滑地過渡到下個技術階段,今天的Hadoop依然是很穩定的大數據解決方案。中國市場相比美國的滯后,給廣大企業為未來三到五年做好數據平臺架構的選型和相應的技術儲備,構建新一代的數據分析平臺,預留了充足的時間。對于那些已經把數字化作為根本戰略的企業,更應該盡快擁抱這樣的趨勢,以在未來的企業競爭中保持優勢。
更多精彩內容,關注鈦媒體微信號(ID:taimeiti),或者下載鈦媒體App
核心關鍵字: 大數據| 留言與評論(共有 0 條評論) |



