
文章總結(jié)與翻譯一、文章主要內(nèi)容本文聚焦大型語(yǔ)言模型(LLMs)在代碼審查評(píng)論細(xì)粒度分類中的應(yīng)用潛力,旨在解決傳統(tǒng)監(jiān)督機(jī)器學(xué)習(xí)方法依賴大量人工標(biāo)注數(shù)據(jù)、泛化能力有限的問(wèn)題,具體內(nèi)容如下:研究背景:代碼審查(CR)是軟件開(kāi)發(fā)中的關(guān)鍵質(zhì)量保障環(huán)節(jié),但現(xiàn)代輕量級(jí)審查中存在20%-44%的“無(wú)用”評(píng)論,浪費(fèi)開(kāi)發(fā)者時(shí)間。傳統(tǒng)方法多將評(píng)論分為5個(gè)高層類別,且依賴人工標(biāo)注數(shù)據(jù),難以處理17個(gè)細(xì)粒度類別(部分高價(jià)值類別數(shù)據(jù)占比不足1%)的不平衡問(wèn)題。研究設(shè)計(jì)分類策略:對(duì)比兩種分類策略——“扁平策略”(單步直接分類為17個(gè)類別)和“分層策略”(兩步分類:先分5個(gè)高層組,再分對(duì)應(yīng)子類別)。輸入上下文:測(cè)試“僅評(píng)論”和“代碼+評(píng)論”兩種輸入形式,探究代碼上下文對(duì)分類效果的影響。模型與數(shù)據(jù)集:選用Qwen 2(7B、72B)和Llama 3(8B、70B、405B)系列模型,基于OpenStack Nova項(xiàng)目的1828條人工標(biāo)注評(píng)論數(shù)據(jù)集,與現(xiàn)有最優(yōu)方法(CodeBERT+LSTM)對(duì)比。核心結(jié)果RQ1(LLMs能否分類評(píng)論):LLMs可有效分類17個(gè)類別,性能遠(yuǎn)超隨機(jī)猜測(cè)和多數(shù)類基線。其中Llama 3.1-405B采用扁平策略+代碼上下