習(xí)人臉三維重建:從3DMM到CNN的實(shí)戰(zhàn)指南)
1. 從二維像素到三維面孔這個(gè)方向到底在解決什么問(wèn)題人臉三維重建這件事說(shuō)穿了就是讓機(jī)器從一張或者幾張二維照片里把一張臉的立體形狀、皮膚紋理、光照條件全部“猜”出來(lái)。你手機(jī)里那張自拍本質(zhì)上只是一個(gè)二維像素陣列每個(gè)像素記錄的是紅綠藍(lán)三個(gè)通道的亮度值。但真實(shí)世界里你的鼻子是凸出來(lái)的眼窩是凹進(jìn)去的顴骨有特定的弧度這些幾何信息在拍照的那一瞬間被“壓扁”成了一個(gè)平面。人臉重建要做的就是把這個(gè)壓扁的過(guò)程反過(guò)來(lái)推一遍。這件事為什么難因?yàn)閺臄?shù)學(xué)上講這是一個(gè)病態(tài)問(wèn)題。同一個(gè)二維圖像可能對(duì)應(yīng)無(wú)窮多種三維結(jié)構(gòu)。比如一張正臉照鼻子高一點(diǎn)、光照暗一點(diǎn)和鼻子矮一點(diǎn)、光照亮一點(diǎn)渲染出來(lái)的二維圖像可能幾乎一模一樣。所以你必須引入先驗(yàn)知識(shí)——也就是“人臉應(yīng)該長(zhǎng)什么樣”的統(tǒng)計(jì)規(guī)律——才能把解空間約束到一個(gè)合理的范圍內(nèi)。深度學(xué)習(xí)時(shí)代之前這個(gè)領(lǐng)域主要靠三維形變模型3D Morphable Model簡(jiǎn)稱3DMM撐著。3DMM的核心思想很樸素把所有正常人臉的三維掃描數(shù)據(jù)做統(tǒng)計(jì)提取出一組“主成分”然后用幾十到幾百個(gè)參數(shù)來(lái)控制人臉的形狀和表情。你可以把它理解成一個(gè)人臉的“調(diào)音臺(tái)”每個(gè)旋鈕控制一個(gè)維度的變化——第一個(gè)旋鈕控制臉的長(zhǎng)寬比第二個(gè)控制鼻梁高度第三個(gè)控制嘴的寬度以此類推。用的時(shí)候你只需要優(yōu)化這些參數(shù)讓渲染出來(lái)的二維圖像和輸入照片盡量接近就行了。但3DMM有它的天花板。它是線性模型能表達(dá)的人臉變化終究有限遇到極端表情、特殊光照、遮擋、大姿態(tài)偏轉(zhuǎn)就容易崩。2015年之后卷積神經(jīng)網(wǎng)絡(luò)開始大規(guī)模進(jìn)入這個(gè)領(lǐng)域整個(gè)技術(shù)路線發(fā)生了根本性的變化。CNN不再依賴人工設(shè)計(jì)的統(tǒng)計(jì)模型而是直接從海量數(shù)據(jù)里學(xué)習(xí)從二維到三維的映射關(guān)系。這就好比以前你是用一套固定的公式去擬合數(shù)據(jù)現(xiàn)在你讓網(wǎng)絡(luò)自己去發(fā)現(xiàn)公式應(yīng)該長(zhǎng)什么樣。我個(gè)人的判斷是人臉重建目前正處于一個(gè)“方法百花齊放但落地仍有門檻”的階段。學(xué)術(shù)上的SOTA指標(biāo)年年刷新但真正拿到實(shí)際項(xiàng)目里用你會(huì)發(fā)現(xiàn)光照、遮擋、皮膚細(xì)節(jié)、實(shí)時(shí)性這些問(wèn)題一個(gè)都跑不掉。這篇文章我會(huì)從技術(shù)路線、核心方法、實(shí)操細(xì)節(jié)、踩坑經(jīng)驗(yàn)幾個(gè)維度把深度學(xué)習(xí)時(shí)代的人臉重建和場(chǎng)景分析講透適合有一定深度學(xué)習(xí)基礎(chǔ)、想快速上手這個(gè)方向的工程師和研究者參考。2. 技術(shù)路線拆解從3DMM到CNN再到混合方案2.1 3DMM為什么仍然是繞不開的基礎(chǔ)很多人一上來(lái)就想跳過(guò)3DMM直接搞端到端網(wǎng)絡(luò)我的建議是別急。3DMM雖然老但它提供了一個(gè)非常重要的東西參數(shù)化的先驗(yàn)空間。你想想如果讓網(wǎng)絡(luò)直接回歸每個(gè)頂點(diǎn)的三維坐標(biāo)一張人臉動(dòng)輒幾萬(wàn)個(gè)頂點(diǎn)輸出維度就是十幾萬(wàn)訓(xùn)練起來(lái)極其困難而且很容易生成不合理的形狀——比如鼻子長(zhǎng)到額頭上。3DMM把輸出維度壓縮到了幾百維網(wǎng)絡(luò)只需要預(yù)測(cè)這些低維參數(shù)再由3DMM模型解碼成具體的三維網(wǎng)格。這個(gè)思路本質(zhì)上是一種降維正則化它保證了輸出的人臉一定是“像人臉的”。在實(shí)際工程中我見過(guò)太多團(tuán)隊(duì)試圖拋棄3DMM搞純端到端最后發(fā)現(xiàn)要么訓(xùn)練不收斂要么生成的結(jié)果雖然指標(biāo)好看但視覺上很怪。目前主流的3DMM實(shí)現(xiàn)有Basel Face Model、FLAME專注于頭部和頸部、FaceWarehouse等。FLAME在表情建模上比BFM更細(xì)致因?yàn)樗~外引入了下頜和頸部的關(guān)節(jié)參數(shù)。選哪個(gè)取決于你的應(yīng)用場(chǎng)景如果只做人臉不做脖子BFM夠用如果要做說(shuō)話人頭或者虛擬主播FLAME更合適。2.2 CNN到底在重建流程里扮演什么角色卷積神經(jīng)網(wǎng)絡(luò)在人臉重建里的角色可以分成三類。第一類是參數(shù)回歸。輸入一張照片網(wǎng)絡(luò)直接輸出3DMM的shape參數(shù)、expression參數(shù)、紋理參數(shù)、姿態(tài)參數(shù)和光照參數(shù)。代表作有PRNet、3DDFA系列。這類方法的優(yōu)點(diǎn)是速度快一張圖前向傳播一次就出結(jié)果適合實(shí)時(shí)應(yīng)用。缺點(diǎn)是精度受限于3DMM的表達(dá)能力細(xì)節(jié)丟失比較嚴(yán)重。第二類是體積回歸。網(wǎng)絡(luò)不預(yù)測(cè)參數(shù)而是直接輸出一個(gè)三維體積voxel或者點(diǎn)云。代表作有VRNVolumetric Regression Network。這類方法能捕捉更豐富的幾何細(xì)節(jié)但計(jì)算量大分辨率受限于顯存而且輸出的網(wǎng)格需要額外的后處理才能用于渲染。第三類是隱式表示。這是最近兩年的熱門方向用神經(jīng)網(wǎng)絡(luò)隱式地表示三維形狀的符號(hào)距離場(chǎng)SDF或者占用場(chǎng)occupancy field然后通過(guò)Marching Cubes提取網(wǎng)格。代表作有PIFu、PIFuHD。這類方法在細(xì)節(jié)還原上非常驚艷頭發(fā)絲、皺紋都能重建出來(lái)但推理速度慢而且需要大量高精度三維掃描數(shù)據(jù)做訓(xùn)練。我自己的經(jīng)驗(yàn)是如果你的項(xiàng)目對(duì)實(shí)時(shí)性有要求比如視頻通話、直播參數(shù)回歸是唯一選擇如果做離線的高精度建模比如數(shù)字人、影視特效隱式表示值得投入。2.3 混合方案為什么越來(lái)越流行純參數(shù)回歸精度不夠純隱式表示速度太慢所以最近很多工作開始走混合路線。一個(gè)典型的思路是先用CNN回歸3DMM參數(shù)得到一個(gè)粗糙的幾何底座然后用一個(gè)refinement網(wǎng)絡(luò)在這個(gè)底座上預(yù)測(cè)位移量把細(xì)節(jié)補(bǔ)回來(lái)。這樣既保證了輸出的合理性又提升了精度。還有一種思路是多視角融合。單張圖的信息量終究有限如果你有多張不同角度的照片可以把它們分別編碼成特征然后在三維空間里做融合。這在人臉掃描類應(yīng)用里很常見比如你需要給用戶建一個(gè)高精度的數(shù)字分身通常會(huì)讓他轉(zhuǎn)頭拍十幾張照片。注意多視角融合的關(guān)鍵是相機(jī)標(biāo)定。如果相機(jī)內(nèi)參和外參不準(zhǔn)融合出來(lái)的結(jié)果會(huì)扭曲變形。實(shí)際項(xiàng)目中我建議用棋盤格做一次標(biāo)定不要偷懶用估計(jì)值。3. 核心環(huán)節(jié)實(shí)操數(shù)據(jù)、網(wǎng)絡(luò)、損失函數(shù)、訓(xùn)練策略3.1 訓(xùn)練數(shù)據(jù)從哪來(lái)深度學(xué)習(xí)人臉重建最大的瓶頸不是網(wǎng)絡(luò)結(jié)構(gòu)而是數(shù)據(jù)。你需要大量的“二維照片-三維模型”配對(duì)數(shù)據(jù)但現(xiàn)實(shí)中這種數(shù)據(jù)非常稀缺。目前公開的數(shù)據(jù)集主要有幾個(gè)來(lái)源合成數(shù)據(jù)用3DMM隨機(jī)采樣生成大量三維人臉然后渲染成二維圖像。優(yōu)點(diǎn)是量大、標(biāo)注精確缺點(diǎn)是合成數(shù)據(jù)和真實(shí)照片之間存在domain gap。掃描數(shù)據(jù)用多相機(jī)陣列或者結(jié)構(gòu)光掃描儀獲取高精度三維人臉同時(shí)拍攝對(duì)應(yīng)的二維照片。優(yōu)點(diǎn)是真實(shí)缺點(diǎn)是成本高、數(shù)量少。弱監(jiān)督數(shù)據(jù)只有二維照片沒(méi)有三維標(biāo)注但可以利用關(guān)鍵點(diǎn)、輪廓、光度一致性等約束來(lái)訓(xùn)練。這類方法近年來(lái)越來(lái)越多因?yàn)樗梢岳没ヂ?lián)網(wǎng)上的海量人臉圖片。我的實(shí)操建議是合成數(shù)據(jù)預(yù)訓(xùn)練 真實(shí)數(shù)據(jù)微調(diào)。先用合成數(shù)據(jù)把網(wǎng)絡(luò)訓(xùn)到一個(gè)差不多的水平然后用少量真實(shí)掃描數(shù)據(jù)做fine-tune。這樣既能利用合成數(shù)據(jù)的量又能緩解domain gap。3.2 損失函數(shù)怎么設(shè)計(jì)損失函數(shù)的設(shè)計(jì)直接決定了重建結(jié)果的質(zhì)量。常用的損失項(xiàng)包括損失類型作用注意事項(xiàng)頂點(diǎn)損失直接約束三維頂點(diǎn)坐標(biāo)需要三維標(biāo)注權(quán)重要調(diào)好關(guān)鍵點(diǎn)損失約束二維投影關(guān)鍵點(diǎn)位置容易獲取但約束力弱光度損失約束渲染圖像與輸入圖像的一致性對(duì)光照估計(jì)敏感輪廓損失約束人臉輪廓的匹配對(duì)姿態(tài)估計(jì)敏感正則化損失約束參數(shù)不要偏離先驗(yàn)分布太遠(yuǎn)防止生成不合理形狀實(shí)際訓(xùn)練時(shí)通常是多項(xiàng)損失加權(quán)求和。權(quán)重的調(diào)節(jié)非常關(guān)鍵我見過(guò)太多人因?yàn)闄?quán)重沒(méi)調(diào)好導(dǎo)致訓(xùn)練失敗。一個(gè)經(jīng)驗(yàn)法則是先用關(guān)鍵點(diǎn)損失和正則化損失把網(wǎng)絡(luò)訓(xùn)到一個(gè)基本合理的狀態(tài)再逐步加入光度損失和頂點(diǎn)損失做精細(xì)化。3.3 網(wǎng)絡(luò)結(jié)構(gòu)選型backbone的選擇上ResNet和MobileNet是最常用的兩個(gè)。ResNet精度高但速度慢MobileNet速度快但精度略低。如果你的應(yīng)用場(chǎng)景是移動(dòng)端MobileNet是首選如果是服務(wù)器端離線處理ResNet-50或ResNet-101更合適。輸出頭的設(shè)計(jì)上通常分成幾路一路回歸形狀參數(shù)一路回歸表情參數(shù)一路回歸姿態(tài)參數(shù)一路回歸光照參數(shù)。每一路可以是一個(gè)全連接層也可以是一個(gè)小型的卷積頭。我個(gè)人的習(xí)慣是形狀和表情共享一部分特征因?yàn)閮烧呤邱詈系摹阈Φ臅r(shí)候臉頰的幾何形狀也會(huì)變化。3.4 訓(xùn)練策略與調(diào)參經(jīng)驗(yàn)學(xué)習(xí)率方面我通常用1e-4起步配合余弦退火。batch size在顯存允許的情況下盡量大因?yàn)槿四樦亟ǖ奶荻仍肼暠容^大大batch能穩(wěn)定訓(xùn)練。數(shù)據(jù)增強(qiáng)非常重要。隨機(jī)旋轉(zhuǎn)、縮放、平移、亮度調(diào)整、對(duì)比度調(diào)整、高斯噪聲這些都能顯著提升模型的泛化能力。特別是亮度調(diào)整因?yàn)楣庹展烙?jì)是人臉重建里最不穩(wěn)定的環(huán)節(jié)讓網(wǎng)絡(luò)見過(guò)各種光照條件能提升魯棒性。還有一個(gè)容易被忽視的點(diǎn)是姿態(tài)平衡。如果你的訓(xùn)練數(shù)據(jù)里正臉占絕大多數(shù)網(wǎng)絡(luò)在側(cè)臉上的表現(xiàn)會(huì)非常差。解決辦法是在采樣時(shí)對(duì)姿態(tài)做均衡或者用重加權(quán)的損失函數(shù)。4. 場(chǎng)景分析人臉重建之外我們還能做什么4.1 從單張人臉到多人場(chǎng)景人臉重建的技術(shù)棧很容易擴(kuò)展到場(chǎng)景分析。你想想一張照片里可能有多個(gè)人臉每個(gè)人臉有不同的姿態(tài)、光照、遮擋關(guān)系。這時(shí)候你需要先做人臉檢測(cè)和關(guān)鍵點(diǎn)定位然后對(duì)每個(gè)人臉?lè)謩e做重建最后在三維空間里做一致性校驗(yàn)。多人場(chǎng)景的難點(diǎn)在于相互遮擋和尺度一致性。兩個(gè)人站在一起前面的人擋住了后面的人半張臉重建時(shí)就需要根據(jù)可見部分推斷被遮擋部分。尺度一致性則要求你估計(jì)每個(gè)人在三維空間中的深度否則重建出來(lái)的人臉大小關(guān)系會(huì)錯(cuò)亂。4.2 人臉與場(chǎng)景的聯(lián)合建模更進(jìn)一步你可以把人臉重建和場(chǎng)景理解結(jié)合起來(lái)。比如在一個(gè)視頻會(huì)議場(chǎng)景里你不僅需要重建參會(huì)者的三維人臉還需要理解他所處的環(huán)境——房間的布局、光照方向、背景物體。這些信息可以幫助你更準(zhǔn)確地估計(jì)人臉的光照條件從而提升重建質(zhì)量。這個(gè)方向目前比較前沿相關(guān)的工作還不多。但我認(rèn)為這是未來(lái)的趨勢(shì)因?yàn)楣铝⒌刈鋈四樦亟ê芏嘈畔⑹潜焕速M(fèi)掉的。場(chǎng)景的幾何和光照信息本質(zhì)上為人臉重建提供了額外的約束。4.3 動(dòng)態(tài)場(chǎng)景下的時(shí)序一致性視頻人臉重建比單張圖重建多了一個(gè)維度時(shí)間。如果你對(duì)每一幀獨(dú)立做重建結(jié)果會(huì)抖動(dòng)得很厲害因?yàn)橄噜弾g的光照估計(jì)、姿態(tài)估計(jì)會(huì)有微小差異累積起來(lái)就是肉眼可見的閃爍。解決辦法有兩種一種是在網(wǎng)絡(luò)里加入時(shí)序模塊比如LSTM或者Transformer讓網(wǎng)絡(luò)看到前后幀的信息另一種是在后處理階段做時(shí)序?yàn)V波比如卡爾曼濾波或者滑動(dòng)窗口平均。前者效果更好但實(shí)現(xiàn)復(fù)雜后者簡(jiǎn)單粗暴但在快速運(yùn)動(dòng)場(chǎng)景下會(huì)引入延遲。我實(shí)際項(xiàng)目中用過(guò)滑動(dòng)窗口平均窗口大小設(shè)為5幀在25fps的視頻里延遲大約200毫秒對(duì)于大多數(shù)應(yīng)用可以接受。但如果你的場(chǎng)景對(duì)實(shí)時(shí)性要求極高比如AR試妝那就必須用網(wǎng)絡(luò)內(nèi)部的時(shí)序建模。5. 常見問(wèn)題與排查技巧實(shí)錄5.1 重建結(jié)果“不像本人”怎么辦這是最常見的問(wèn)題。原因通常有三個(gè)一是3DMM的表達(dá)能力不夠二是訓(xùn)練數(shù)據(jù)的多樣性不足三是損失函數(shù)沒(méi)有約束好身份特征。排查思路先可視化3DMM參數(shù)看看形狀參數(shù)是否落在了合理的分布范圍內(nèi)。如果參數(shù)正常但結(jié)果不像那可能是紋理重建的問(wèn)題——很多人只關(guān)注幾何忽略了紋理但人臉的辨識(shí)度很大程度上來(lái)自紋理。建議在損失函數(shù)里加入身份損失用一個(gè)人臉識(shí)別網(wǎng)絡(luò)提取特征約束重建結(jié)果和輸入的身份特征一致。5.2 光照估計(jì)不穩(wěn)定怎么解光照估計(jì)是人臉重建里最脆弱的環(huán)節(jié)。輸入圖像里的一點(diǎn)陰影、高光、色偏都可能導(dǎo)致光照參數(shù)估計(jì)錯(cuò)誤進(jìn)而影響幾何重建。我的經(jīng)驗(yàn)是不要過(guò)度依賴光照模型。如果你用的是球諧光照階數(shù)不要設(shè)太高通常2階就夠了。高階球諧雖然能表達(dá)更復(fù)雜的光照但也更容易過(guò)擬合。另外可以在訓(xùn)練時(shí)對(duì)輸入圖像做隨機(jī)gamma校正和顏色抖動(dòng)讓網(wǎng)絡(luò)對(duì)光照變化更魯棒。5.3 側(cè)臉和大表情下的崩潰側(cè)臉和大表情是參數(shù)回歸方法的傳統(tǒng)弱項(xiàng)。側(cè)臉的問(wèn)題在于可見區(qū)域太少信息量不足大表情的問(wèn)題在于3DMM的表情空間是線性的無(wú)法表達(dá)極端的肌肉變形。針對(duì)側(cè)臉一個(gè)有效的技巧是對(duì)稱性約束。人臉大致是對(duì)稱的你可以利用可見的半邊臉推斷被遮擋的半邊。針對(duì)大表情可以考慮用非線性表情模型比如FLAME的表情空間就比BFM更豐富。或者用位移圖的方式在3DMM的基礎(chǔ)上讓網(wǎng)絡(luò)預(yù)測(cè)額外的幾何偏移。5.4 推理速度優(yōu)化如果你要把模型部署到移動(dòng)端或者邊緣設(shè)備推理速度是硬指標(biāo)。優(yōu)化手段包括模型量化FP32轉(zhuǎn)FP16或INT8、剪枝、知識(shí)蒸餾、用輕量級(jí)backbone。我實(shí)測(cè)下來(lái)MobileNetV2加上量化在驍龍865上能做到30fps以上基本滿足實(shí)時(shí)要求。但量化會(huì)帶來(lái)精度損失通常掉1-2個(gè)點(diǎn)的NME需要根據(jù)你的應(yīng)用場(chǎng)景權(quán)衡。問(wèn)題現(xiàn)象可能原因排查方法解決方案重建結(jié)果不像本人紋理丟失或身份特征未約束可視化紋理和身份特征加入身份損失光照估計(jì)跳變輸入光照變化或模型過(guò)擬合檢查光照參數(shù)時(shí)序曲線降低球諧階數(shù)增加光照增強(qiáng)側(cè)臉崩潰可見區(qū)域不足檢查側(cè)臉樣本比例對(duì)稱性約束姿態(tài)均衡采樣大表情失真線性模型表達(dá)能力不足可視化表情參數(shù)換用FLAME或加位移圖推理速度慢模型過(guò)大或未優(yōu)化profile各層耗時(shí)量化、剪枝、換backbone6. 工具鏈與工程化落地建議6.1 框架選擇PyTorch是目前人臉重建領(lǐng)域的事實(shí)標(biāo)準(zhǔn)絕大多數(shù)開源實(shí)現(xiàn)都是PyTorch寫的。TensorFlow也有不少實(shí)現(xiàn)但生態(tài)不如PyTorch活躍。如果你要從零開始我建議直接用PyTorch省得后面找預(yù)訓(xùn)練模型和代碼參考時(shí)麻煩。6.2 可用的開源資源3DDFA_V2速度快精度不錯(cuò)適合做baselineDECA基于FLAME細(xì)節(jié)還原好支持表情和姿態(tài)解耦PIFuHD高精度重建適合離線場(chǎng)景Deep3DFaceRecon經(jīng)典的參數(shù)回歸方法代碼清晰易讀我的建議是先用Deep3DFaceRecon跑通整個(gè)流程理解每一步在做什么然后再根據(jù)需求換更高級(jí)的方法。6.3 部署注意事項(xiàng)部署時(shí)最大的坑是預(yù)處理和后處理的一致性。訓(xùn)練時(shí)用的歸一化參數(shù)、關(guān)鍵點(diǎn)定義、相機(jī)模型部署時(shí)必須完全一致否則結(jié)果會(huì)偏。我見過(guò)一個(gè)團(tuán)隊(duì)訓(xùn)練時(shí)用的是68點(diǎn)關(guān)鍵點(diǎn)部署時(shí)換成了98點(diǎn)結(jié)果重建出來(lái)的人臉整個(gè)變形。另一個(gè)坑是數(shù)值精度。訓(xùn)練時(shí)用FP32部署時(shí)轉(zhuǎn)FP16某些層的數(shù)值范圍可能溢出。建議在轉(zhuǎn)換后做一次全面的回歸測(cè)試逐層對(duì)比輸出差異。7. 我個(gè)人的一些實(shí)操體會(huì)人臉重建這個(gè)方向論文里的指標(biāo)和實(shí)際效果之間的gap比很多領(lǐng)域都大。你在論文里看到NME降到3%以下覺得已經(jīng)很好了但拿到真實(shí)場(chǎng)景里一跑側(cè)臉、遮擋、暗光隨便一個(gè)條件就能讓效果崩掉。所以我的建議是不要只盯著公開數(shù)據(jù)集上的指標(biāo)一定要在自己的目標(biāo)場(chǎng)景里做充分測(cè)試。另外數(shù)據(jù)的重要性怎么強(qiáng)調(diào)都不過(guò)分。與其花兩周時(shí)間調(diào)網(wǎng)絡(luò)結(jié)構(gòu)不如花兩周時(shí)間整理和標(biāo)注數(shù)據(jù)。我自己的項(xiàng)目里數(shù)據(jù)質(zhì)量提升帶來(lái)的收益遠(yuǎn)遠(yuǎn)大于模型結(jié)構(gòu)改進(jìn)帶來(lái)的收益。最后說(shuō)一個(gè)容易被忽視的點(diǎn)評(píng)估指標(biāo)的選擇。NME歸一化平均誤差是最常用的指標(biāo)但它主要衡量關(guān)鍵點(diǎn)位置的準(zhǔn)確性對(duì)幾何細(xì)節(jié)的敏感度不夠。如果你做的是高精度重建建議額外用倒角距離Chamfer Distance或者法線一致性來(lái)評(píng)估。不同指標(biāo)反映的是不同維度的質(zhì)量只看一個(gè)指標(biāo)很容易被誤導(dǎo)。這個(gè)方向后續(xù)還可以往幾個(gè)方向擴(kuò)展一是結(jié)合神經(jīng)輻射場(chǎng)做更逼真的渲染二是引入物理約束讓重建結(jié)果更符合真實(shí)人臉的力學(xué)特性三是探索自監(jiān)督和少樣本學(xué)習(xí)降低對(duì)三維標(biāo)注數(shù)據(jù)的依賴。每個(gè)方向都有不少坑要踩但也都有實(shí)實(shí)在在的應(yīng)用價(jià)值。