
文章總結(jié)與翻譯一、文章主要內(nèi)容該研究聚焦科研人員學(xué)術(shù)興趣畫像更新滯后的問題,提出并評估了兩種基于大型語言模型(LLMs)的自動化、可擴(kuò)展生成方法,以解決傳統(tǒng)人工維護(hù)學(xué)術(shù)畫像耗時且易過時的痛點,具體內(nèi)容如下:研究背景:現(xiàn)有學(xué)術(shù)平臺(如Google Scholar、ResearchGate等)的科研人員畫像常存在信息過時、不準(zhǔn)確或不完整的問題,Web抓取等傳統(tǒng)構(gòu)建方式存在局限,阻礙了基于最新研究方向的人才識別與合作搭建,而此前自動化方法僅能提取MeSH術(shù)語生成詞云,無法生成流暢的敘事性總結(jié)。數(shù)據(jù)收集:收集了哥倫比亞大學(xué)歐文醫(yī)學(xué)中心(CUIMC)595名教職人員在PubMed上的出版物標(biāo)題、MeSH術(shù)語和摘要,其中167人擁有人工撰寫的在線研究畫像,且篩選時僅納入過去十年內(nèi)、研究者為前三位作者或資深作者(體現(xiàn)主要貢獻(xiàn))的出版物,并通過機(jī)構(gòu)隸屬關(guān)系解決同名研究者的出版物歧義問題。模型構(gòu)建:采用兩種LLM(GPT-4o-mini)生成學(xué)術(shù)興趣畫像的策略。一是基于MeSH術(shù)語的生成方法,將關(guān)鍵詞分為方法學(xué)和健康領(lǐng)域兩類,分別讓模型生成總結(jié)后拼接;二是基于摘要的生成方法,采用“分而治之”策略,先通過潛在狄利克雷分配(LDA)將出版物按主題分組,濃縮每組摘要后再進(jìn)行最終總結(jié),以應(yīng)對LLM輸入token限制。評估方式:從機(jī)器評估和人工評估兩方面展開。機(jī)器評估使用ROUGE-L、BLEU、METEOR等詞匯相似度指標(biāo),BERTScore語義相似度指標(biāo),TF