學(xué)建模相關(guān)性分析實(shí)戰(zhàn):從皮爾遜到典型相關(guān)的核心方法與避坑指南)
1. 項(xiàng)目概述從“算個(gè)系數(shù)”到“洞察關(guān)系”的思維躍遷又到了備戰(zhàn)國(guó)賽、美賽的關(guān)鍵時(shí)期最近和幾個(gè)備賽的學(xué)弟學(xué)妹交流發(fā)現(xiàn)大家對(duì)“相關(guān)性分析”的理解還停留在“用SPSS點(diǎn)一下看看p值小于0.05就完事”的階段。這讓我想起自己第一次參加建模時(shí)也是這么干的結(jié)果在論文的“模型檢驗(yàn)”部分被評(píng)委老師問得啞口無言。相關(guān)性分析絕不僅僅是報(bào)告一個(gè)皮爾遜或斯皮爾曼系數(shù)那么簡(jiǎn)單。它本質(zhì)上是一種關(guān)系探測(cè)與量化的思維工具其核心價(jià)值在于為后續(xù)更復(fù)雜的因果推斷、預(yù)測(cè)建?;蛳到y(tǒng)分析提供堅(jiān)實(shí)的數(shù)據(jù)關(guān)系證據(jù)和篩選依據(jù)。備戰(zhàn)數(shù)學(xué)建模尤其是到了中后期你需要掌握的不僅是“如何算”更是“何時(shí)用”、“怎么解讀”以及“如何避免陷阱”。今天我們就拋開那些枯燥的教科書定義結(jié)合我這些年當(dāng)隊(duì)員、當(dāng)教練、當(dāng)評(píng)委踩過的坑和總結(jié)的經(jīng)驗(yàn)把相關(guān)性分析這塊硬骨頭掰開了、揉碎了講透它。簡(jiǎn)單來說相關(guān)性分析在數(shù)學(xué)建模中扮演著“偵察兵”和“過濾器”的雙重角色。作為偵察兵它幫你從海量變量中快速鎖定哪些變量之間可能存在“協(xié)同變化”的線索為后續(xù)建立回歸、分類或因果模型指明方向。作為過濾器它能在建模前期幫你剔除高度共線性的變量防止模型過擬合或結(jié)果失真。無論是國(guó)賽的“空氣質(zhì)量評(píng)價(jià)”還是美賽的“生態(tài)系統(tǒng)分析”變量間的關(guān)系梳理都是第一步也是最容易失分的一步。這篇文章我將圍繞皮爾遜相關(guān)、斯皮爾曼相關(guān)、典型相關(guān)分析這三大主力以及它們?cè)趯?shí)際建模中的應(yīng)用場(chǎng)景、操作要點(diǎn)和避坑指南進(jìn)行深度拆解。目標(biāo)是讓你看完后不僅能熟練操作更能形成一套完整的數(shù)據(jù)關(guān)系分析思維框架在論文中寫出讓評(píng)委眼前一亮的分析段落。2. 核心思路與方案選型為什么是這三個(gè)當(dāng)你拿到一份數(shù)據(jù)集面對(duì)十幾個(gè)甚至幾十個(gè)變量時(shí)第一反應(yīng)不應(yīng)該是把所有變量?jī)蓛山M合去算相關(guān)性。那會(huì)得到一張巨大且混亂的相關(guān)性矩陣除了讓你眼花繚亂意義不大。正確的思路是分步走、有目的。2.1 第一步明確分析目標(biāo)與數(shù)據(jù)特性在按任何計(jì)算按鈕之前先問自己三個(gè)問題我的模型目標(biāo)是什么是預(yù)測(cè)如預(yù)測(cè)房?jī)r(jià)是分類如判斷信用好壞還是探索性分析如研究環(huán)境因素與健康指標(biāo)的關(guān)系目標(biāo)決定了你關(guān)注的相關(guān)性類型。我的變量是什么類型這是選擇方法的基礎(chǔ)。連續(xù) vs 連續(xù)比如“GDP”和“人均收入”。這是最理想的情況選擇面最廣。有序 vs 有序 / 連續(xù) vs 有序比如“滿意度等級(jí)1-5”和“收入水平低、中、高”。這時(shí)連續(xù)變量的假設(shè)可能不成立。數(shù)據(jù)分布如何是否服從正態(tài)分布是否存在異常值這直接決定了皮爾遜相關(guān)是否有效。我關(guān)心的是線性關(guān)系還是單調(diào)關(guān)系線性關(guān)系意味著一個(gè)變量增加另一個(gè)變量以恒定比例增加或減少在散點(diǎn)圖上大致呈直線。單調(diào)關(guān)系只關(guān)心變化方向是否一致同增同減不關(guān)心具體是不是直線?;谶@三個(gè)問題的答案我們?cè)賮砜纯礊槭裁雌栠d、斯皮爾曼和典型相關(guān)是黃金組合。皮爾遜積矩相關(guān)系數(shù)這是你的“首選偵察兵”。它衡量?jī)蓚€(gè)連續(xù)變量之間的線性相關(guān)程度。它的核心假設(shè)是數(shù)據(jù)服從二元正態(tài)分布至少近似且關(guān)系是線性的。它的值在-1到1之間絕對(duì)值越大線性相關(guān)性越強(qiáng)。在建模初期對(duì)于連續(xù)變量我總會(huì)先計(jì)算皮爾遜相關(guān)矩陣快速瀏覽一遍它能非常直觀地告訴我哪些變量間可能存在強(qiáng)烈的線性關(guān)聯(lián)為后續(xù)的多元線性回歸等模型提供變量初篩依據(jù)。注意皮爾遜相關(guān)對(duì)異常值極其敏感一個(gè)極端的離群點(diǎn)可能完全扭曲相關(guān)系數(shù)得出誤導(dǎo)性結(jié)論。因此計(jì)算前務(wù)必進(jìn)行數(shù)據(jù)可視化如散點(diǎn)圖檢查。斯皮爾曼等級(jí)相關(guān)系數(shù)這是你的“穩(wěn)健型備用偵察兵”。當(dāng)數(shù)據(jù)不滿足正態(tài)分布假設(shè)或者你懷疑存在異常值又或者你的變量本身就是等級(jí)數(shù)據(jù)如比賽名次、滿意度評(píng)分時(shí)斯皮爾曼相關(guān)就該上場(chǎng)了。它的原理是將原始數(shù)據(jù)排序轉(zhuǎn)換為秩次即排名然后計(jì)算這些秩次之間的皮爾遜相關(guān)。因此它衡量的是兩個(gè)變量之間的單調(diào)關(guān)系對(duì)異常值和數(shù)據(jù)分布形態(tài)不敏感。在數(shù)學(xué)建模中遇到社會(huì)調(diào)查問卷數(shù)據(jù)李克特量表、主觀評(píng)價(jià)數(shù)據(jù)或存在明顯偏態(tài)的經(jīng)濟(jì)數(shù)據(jù)時(shí)斯皮爾曼比皮爾遜更可靠。典型相關(guān)分析這是你的“高級(jí)關(guān)系分析師”。前面兩者都是分析兩個(gè)變量之間的關(guān)系。但現(xiàn)實(shí)中我們常常需要研究?jī)山M變量之間的整體相關(guān)性。比如在“城市發(fā)展綜合評(píng)價(jià)”問題中我們有一組“經(jīng)濟(jì)指標(biāo)”GDP、財(cái)政收入、固定資產(chǎn)投資和另一組“社會(huì)指標(biāo)”人均可支配收入、教育支出、醫(yī)療床位數(shù)。CCA要回答的問題是這兩組指標(biāo)整體上是怎么關(guān)聯(lián)的它能從每組變量中分別提取出一個(gè)“代表”稱為典型變量使得這兩個(gè)代表之間的相關(guān)性最大化。這個(gè)最大的相關(guān)系數(shù)就是第一典型相關(guān)系數(shù)。它還能繼續(xù)提取第二對(duì)、第三對(duì)代表形成多層次的關(guān)聯(lián)分析。這在處理高維數(shù)據(jù)、進(jìn)行指標(biāo)降維和構(gòu)建綜合評(píng)估體系時(shí)威力巨大。選型決策流程圖心法分析兩個(gè)連續(xù)變量的線性關(guān)系且數(shù)據(jù)大致正態(tài)、無嚴(yán)重異常值 -皮爾遜。分析兩個(gè)變量的單調(diào)關(guān)系或數(shù)據(jù)為等級(jí)、或存在異常值、或分布未知 -斯皮爾曼。分析兩組變量之間的整體相關(guān)結(jié)構(gòu) -典型相關(guān)分析。3. 核心細(xì)節(jié)解析與實(shí)操要點(diǎn)知道了“用什么”下一步就是“怎么用對(duì)”。下面我們深入到每個(gè)方法的細(xì)節(jié)中。3.1 皮爾遜相關(guān)不止于一個(gè)r值皮爾遜相關(guān)系數(shù)r的計(jì)算公式大家都會(huì)背但建模論文里如果只寫一個(gè)r0.85那是遠(yuǎn)遠(yuǎn)不夠的。完整的分析必須包含假設(shè)檢驗(yàn)。原假設(shè)H0兩個(gè)變量總體相關(guān)系數(shù)為0即無線性相關(guān)。備擇假設(shè)H1兩個(gè)變量總體相關(guān)系數(shù)不為0。我們通過計(jì)算得到的r是樣本相關(guān)系數(shù)需要檢驗(yàn)它是否顯著地不等于0。這通常通過t檢驗(yàn)來完成最終會(huì)得到一個(gè)p值。實(shí)操要點(diǎn)與論文呈現(xiàn) 在論文中相關(guān)性分析的結(jié)果應(yīng)以相關(guān)性矩陣表的形式呈現(xiàn)并且強(qiáng)烈建議同時(shí)給出相關(guān)系數(shù)和對(duì)應(yīng)的p值。一個(gè)專業(yè)的表格示例如下變量GDP人均收入科研投入污染指數(shù)GDP10.92 (p0.001)0.78 (p0.003)0.65 (p0.021)人均收入0.92 (p0.001)10.71 (p0.008)0.58 (p0.045)科研投入0.78 (p0.003)0.71 (p0.008)10.21 (p0.512)污染指數(shù)0.65 (p0.021)0.58 (p0.045)0.21 (p0.512)1注對(duì)角線為1矩陣對(duì)稱。通常用或在數(shù)值上標(biāo)表示顯著性水平如 p0.05*, p0.01并在表注中說明*關(guān)鍵解讀GDP與人均收入的相關(guān)系數(shù)高達(dá)0.92且p0.001表明二者存在極強(qiáng)的顯著正線性相關(guān)。科研投入與污染指數(shù)的相關(guān)系數(shù)為0.21p0.5120.05不能拒絕原假設(shè)即從統(tǒng)計(jì)上看二者沒有顯著的線性相關(guān)關(guān)系。注意不能說“二者不相關(guān)”只能說“未發(fā)現(xiàn)顯著相關(guān)”這是嚴(yán)謹(jǐn)?shù)谋硎觥O嚓P(guān)系數(shù)大小與顯著性是兩個(gè)概念。一個(gè)相關(guān)系數(shù)可能很大如0.6但如果p值不顯著如p0.1我們也不能認(rèn)為它相關(guān)。反之一個(gè)很小的相關(guān)系數(shù)如0.1如果樣本量極大也可能變得顯著p0.05但這種“顯著”可能沒有實(shí)際意義。因此要結(jié)合系數(shù)大小和顯著性共同判斷。3.2 斯皮爾曼相關(guān)當(dāng)數(shù)據(jù)“不聽話”時(shí)斯皮爾曼相關(guān)的計(jì)算不依賴于原始數(shù)值只依賴于它們的排名。這使得它非常穩(wěn)健。假設(shè)我們有5個(gè)城市在“綠化面積”和“市民幸福感評(píng)分”上的數(shù)據(jù)原始數(shù)據(jù)可能分布奇怪但排序后計(jì)算就清晰了。實(shí)操心得處理并列排名如果出現(xiàn)相同數(shù)值它們的秩次應(yīng)取平均值。例如兩個(gè)第二名并列則它們的秩次都是(23)/22.5。大多數(shù)統(tǒng)計(jì)軟件如SPSS, R, Python的scipy.stats會(huì)自動(dòng)處理。結(jié)果解讀斯皮爾曼相關(guān)系數(shù)ρ(rho) 的范圍和意義與皮爾遜r類似但它解釋的是單調(diào)關(guān)系的強(qiáng)度和方向。在論文中同樣需要報(bào)告ρ值和 p 值。與皮爾遜對(duì)比一個(gè)非常實(shí)用的技巧是同時(shí)計(jì)算皮爾遜和斯皮爾曼相關(guān)系數(shù)。如果兩者結(jié)果相差很大比如皮爾遜很弱但斯皮爾曼很強(qiáng)那很可能你的數(shù)據(jù)中存在強(qiáng)烈的單調(diào)但非線性關(guān)系如指數(shù)關(guān)系、對(duì)數(shù)關(guān)系或者存在異常值干擾了皮爾遜相關(guān)。這個(gè)對(duì)比本身就是一項(xiàng)有價(jià)值的分析。3.3 典型相關(guān)分析挖掘組間關(guān)聯(lián)的寶藏CCA的數(shù)學(xué)原理相對(duì)復(fù)雜涉及特征值分解但在應(yīng)用層面我們可以聚焦于它的輸出和解讀。以研究“經(jīng)濟(jì)發(fā)展組”GDP, 貿(mào)易額和“民生福祉組”人均收入 預(yù)期壽命 文盲率的關(guān)系為例。操作流程數(shù)據(jù)準(zhǔn)備將變量分為明確的兩組。每組變量?jī)?nèi)部最好先進(jìn)行標(biāo)準(zhǔn)化消除量綱影響這是很多教程里容易忽略但至關(guān)重要的一步。軟件求解使用統(tǒng)計(jì)軟件R的cancor函數(shù)Python的sklearn.cross_decomposition.CCA或SPSS的宏進(jìn)行計(jì)算。結(jié)果解讀這是CCA最難也是最重要的部分。輸出通常包括典型相關(guān)系數(shù)第一個(gè)系數(shù)最大表示兩組變量間最強(qiáng)的整體關(guān)聯(lián)強(qiáng)度。需要檢驗(yàn)其顯著性通常使用Bartlett的卡方近似檢驗(yàn)。典型載荷也叫結(jié)構(gòu)相關(guān)系數(shù)是原始變量與本組提取出的典型變量之間的相關(guān)系數(shù)。它用于解釋典型變量的實(shí)際含義。典型權(quán)重用于構(gòu)建典型變量的線性組合系數(shù)。但解釋時(shí)更推薦使用典型載荷因?yàn)樗€(wěn)定不受變量縮放影響。避坑指南樣本量要求CCA對(duì)樣本量要求較高。一個(gè)經(jīng)驗(yàn)法則是樣本數(shù)至少是兩組變量總數(shù)之和的10倍。樣本量不足容易導(dǎo)致過擬合結(jié)果不可靠。多重共線性如果某一組內(nèi)部的變量高度相關(guān)共線性會(huì)影響典型權(quán)重的估計(jì)導(dǎo)致解釋困難。在運(yùn)行CCA前最好先檢查每組內(nèi)部的相關(guān)系數(shù)矩陣考慮是否先進(jìn)行主成分分析PCA降維。解釋聚焦于第一對(duì)典型變量通常只有第一對(duì)最多前兩對(duì)典型變量是顯著且有實(shí)際意義的。在論文中應(yīng)重點(diǎn)解釋這些顯著的對(duì)子。例如“第一典型變量顯示‘經(jīng)濟(jì)發(fā)展組’主要由GDP驅(qū)動(dòng)而‘民生福祉組’主要由人均收入驅(qū)動(dòng)二者典型相關(guān)系數(shù)為0.95表明經(jīng)濟(jì)增長(zhǎng)與居民收入提升存在極強(qiáng)的協(xié)同效應(yīng)?!?. 完整建模流程中的整合應(yīng)用相關(guān)性分析不是孤立的步驟它必須嵌入到完整的建模工作流中才有價(jià)值。下面我以一個(gè)假設(shè)的賽題“區(qū)域科技創(chuàng)新能力與經(jīng)濟(jì)發(fā)展水平的關(guān)聯(lián)性研究”為例展示如何串聯(lián)應(yīng)用。4.1 階段一數(shù)據(jù)初探與變量篩選拿到數(shù)據(jù)假設(shè)有15個(gè)經(jīng)濟(jì)指標(biāo)和10個(gè)科技指標(biāo)第一步不是做CCA。組內(nèi)初篩皮爾遜/斯皮爾曼分別計(jì)算經(jīng)濟(jì)指標(biāo)組內(nèi)部、科技指標(biāo)組內(nèi)部的相關(guān)矩陣。目的是找出組內(nèi)高度共線性的指標(biāo)。比如發(fā)現(xiàn)“研發(fā)經(jīng)費(fèi)內(nèi)部支出”和“研發(fā)人員全時(shí)當(dāng)量”相關(guān)系數(shù)高達(dá)0.98那么它們幾乎攜帶相同信息可以考慮只保留一個(gè)或先用PCA合成一個(gè)新因子以避免后續(xù)回歸或CCA中的多重共線性問題。組間關(guān)聯(lián)初探皮爾遜/斯皮爾曼可以挑選每組中最有代表性的核心指標(biāo)如經(jīng)濟(jì)組的“人均GDP”科技組的“發(fā)明專利授權(quán)量”計(jì)算它們之間的相關(guān)系數(shù)對(duì)整體關(guān)系有個(gè)初步感知。4.2 階段二核心關(guān)系挖掘典型相關(guān)分析在初步清洗和篩選后我們形成了兩組相對(duì)獨(dú)立、內(nèi)部結(jié)構(gòu)清晰的變量集。執(zhí)行CCA將處理后的經(jīng)濟(jì)指標(biāo)組和科技指標(biāo)組輸入CCA模型。檢驗(yàn)與提取查看典型相關(guān)系數(shù)的顯著性檢驗(yàn)結(jié)果如p0.05。假設(shè)前兩對(duì)典型變量顯著。解讀典型變量分析第一對(duì)典型變量的載荷。發(fā)現(xiàn)經(jīng)濟(jì)組這邊“第三產(chǎn)業(yè)占比”和“高新技術(shù)產(chǎn)業(yè)產(chǎn)值占比”載荷最高科技組那邊“技術(shù)市場(chǎng)成交額”和“科技論文發(fā)表量”載荷最高。那么第一典型關(guān)系可以解讀為“產(chǎn)業(yè)結(jié)構(gòu)高化與科技市場(chǎng)活躍度、知識(shí)產(chǎn)出的強(qiáng)關(guān)聯(lián)”。分析第二對(duì)典型變量??赡馨l(fā)現(xiàn)經(jīng)濟(jì)組的“固定資產(chǎn)投資”和科技組的“大型科研儀器共享率”載荷高解讀為“硬件投入與科研資源利用效率的關(guān)聯(lián)”??梢暬L制典型載荷圖將兩組變量在第一、第二典型變量上的載荷繪制在同一個(gè)二維坐標(biāo)系中??梢灾庇^地看到哪些經(jīng)濟(jì)指標(biāo)和哪些科技指標(biāo)在空間上靠近暗示它們關(guān)系密切。4.3 階段三為預(yù)測(cè)模型服務(wù)如果我們的最終目標(biāo)是構(gòu)建一個(gè)以經(jīng)濟(jì)發(fā)展水平為因變量的預(yù)測(cè)模型那么之前的分析就是完美的前置工作。提供預(yù)測(cè)變量候選通過組間相關(guān)性分析尤其是典型相關(guān)分析我們找到了那些與經(jīng)濟(jì)發(fā)展指標(biāo)關(guān)系最緊密的科技指標(biāo)。這些指標(biāo)可以作為構(gòu)建回歸模型時(shí)重點(diǎn)考慮的自變量。避免共線性輸入通過組內(nèi)相關(guān)性分析我們確保了送入回歸模型的自變量之間沒有嚴(yán)重的多重共線性提高了模型的穩(wěn)定性和可解釋性。5. 常見問題、誤區(qū)與排查技巧實(shí)錄這里總結(jié)幾個(gè)我評(píng)審論文和指導(dǎo)隊(duì)伍時(shí)最高頻出現(xiàn)的問題。5.1 誤區(qū)一相關(guān)等于因果這是最經(jīng)典、最嚴(yán)重的錯(cuò)誤。相關(guān)系數(shù)高只能說明兩個(gè)變量“有關(guān)聯(lián)”但絕對(duì)不能證明是“誰導(dǎo)致了誰”。例如夏天冰淇淋銷量和溺水事故數(shù)高度正相關(guān)但顯然不是冰淇淋導(dǎo)致溺水??赡苁堑谌齻€(gè)變量——“高溫天氣”同時(shí)導(dǎo)致了二者增加。在建模論文中任何基于相關(guān)分析得出的“XX促進(jìn)了YY”、“XX對(duì)YY有積極影響”的結(jié)論如果沒有更嚴(yán)謹(jǐn)?shù)哪P腿绺裉m杰因果檢驗(yàn)、結(jié)構(gòu)方程模型等支撐都是不嚴(yán)謹(jǐn)?shù)臅?huì)被扣分。正確做法在論文中表述為“XX與YY之間存在顯著的正/負(fù)相關(guān)關(guān)系”或“數(shù)據(jù)顯示XX與YY的變動(dòng)趨勢(shì)協(xié)同”為后續(xù)的因果分析做鋪墊而非定論。5.2 誤區(qū)二忽視可視化與假設(shè)檢查直接拋出一張相關(guān)性矩陣表沒有任何散點(diǎn)圖或分布檢查是新手常見問題。皮爾遜相關(guān)的有效性建立在數(shù)據(jù)線性、正態(tài)等假設(shè)上。排查技巧繪制散點(diǎn)圖矩陣這是必須做的一步一眼就能看出關(guān)系是否是線性是否存在異常值是否存在異方差等問題。一個(gè)彎曲的散點(diǎn)圖即使算出很高的皮爾遜相關(guān)也是沒有意義的。正態(tài)性檢驗(yàn)對(duì)于關(guān)鍵變量可以使用Q-Q圖、Shapiro-Wilk檢驗(yàn)等方法檢查正態(tài)性。如果嚴(yán)重偏離優(yōu)先使用斯皮爾曼相關(guān)。異常值處理通過箱線圖或3σ原則識(shí)別異常值。思考異常值的成因是數(shù)據(jù)錄入錯(cuò)誤還是特殊事件導(dǎo)致決定是修正、剔除還是保留。如果保留應(yīng)使用斯皮爾曼相關(guān)或穩(wěn)健的相關(guān)性計(jì)算方法。5.3 誤區(qū)三對(duì)p值的機(jī)械理解“p0.05就是顯著p0.05就是不相關(guān)”這種二元思維很危險(xiǎn)。深度理解p值受樣本量影響巨大大樣本下即使非常微弱的相關(guān)系數(shù)如0.05也可能產(chǎn)生極小的p值顯著。這時(shí)要結(jié)合相關(guān)系數(shù)大小判斷實(shí)際意義。一個(gè)0.05的相關(guān)性即使統(tǒng)計(jì)顯著在實(shí)際問題中也可能毫無價(jià)值。p0.05不意味著“沒有關(guān)系”它只意味著“在當(dāng)前樣本下沒有足夠證據(jù)證明總體相關(guān)系數(shù)不為0”。可能關(guān)系確實(shí)很弱也可能是樣本量太小或者關(guān)系是非線性/非單調(diào)的而你的方法沒檢測(cè)出來。多重比較問題當(dāng)你對(duì)幾十個(gè)變量做兩兩相關(guān)檢驗(yàn)時(shí)比如檢驗(yàn)了100次即使所有變量實(shí)際都不相關(guān)純粹由于隨機(jī)性你平均也會(huì)得到5個(gè)100*0.05“顯著”的結(jié)果。這就是假陽性。對(duì)于大規(guī)模的相關(guān)性篩選需要考慮使用更嚴(yán)格的顯著性水平如Bonferroni校正來控制整體錯(cuò)誤率。5.4 軟件操作翻車點(diǎn)Python (pandasscipy)import pandas as pd import scipy.stats as stats # 計(jì)算皮爾遜相關(guān)和p值 pearson_corr, pearson_p stats.pearsonr(df[變量A], df[變量B]) # 計(jì)算斯皮爾曼相關(guān)和p值 spearman_corr, spearman_p stats.spearmanr(df[變量A], df[變量B]) # 計(jì)算整個(gè)數(shù)據(jù)框的相關(guān)矩陣及p值矩陣需自己循環(huán)或使用pingouin庫(kù) # 推薦使用 pingouin 庫(kù)非常方便 # import pingouin as pg # pg.pairwise_corr(df, methodpearson)翻車點(diǎn)DataFrame.corr()方法默認(rèn)計(jì)算皮爾遜相關(guān)且不提供p值很多同學(xué)直接用了這個(gè)結(jié)果做統(tǒng)計(jì)推斷這是錯(cuò)誤的。必須使用統(tǒng)計(jì)檢驗(yàn)函數(shù)來獲取p值。MATLAB:[R, P] corrcoef(X); % 皮爾遜相關(guān)矩陣R和對(duì)應(yīng)的P值矩陣P [rho, pval] corr(X, Type, Spearman); % 斯皮爾曼翻車點(diǎn)corrcoef輸入是一個(gè)矩陣每列是一個(gè)變量。要確保數(shù)據(jù)中沒有NaN否則整行都會(huì)被剔除可能導(dǎo)致結(jié)果偏差。SPSS 操作分析 - 相關(guān) - 雙變量。勾選“皮爾遜”和/或“斯皮爾曼”一定要勾選“標(biāo)記顯著性相關(guān)性”和“在方框中顯示實(shí)際顯著性水平”。翻車點(diǎn)SPSS默認(rèn)會(huì)在顯著的結(jié)果上打星號(hào)(或*)但很多同學(xué)在論文中直接截圖這張表卻不解釋星號(hào)的含義* p0.05, ** p0.01這是不規(guī)范的。必須在圖注或文中說明。5.5 論文寫作表述要點(diǎn)在論文的“數(shù)據(jù)預(yù)處理”或“模型建立”部分描述相關(guān)性分析時(shí)一個(gè)規(guī)范的段落應(yīng)該包括目的“為探究各影響因素間的內(nèi)在聯(lián)系并篩選后續(xù)建模的關(guān)鍵變量首先對(duì)XX指標(biāo)進(jìn)行了相關(guān)性分析?!狈椒ā拌b于部分指標(biāo)數(shù)據(jù)分布不符合正態(tài)性通過Q-Q圖及Shapiro-Wilk檢驗(yàn)判斷本研究主要采用斯皮爾曼等級(jí)相關(guān)系數(shù)進(jìn)行分析并輔以皮爾遜相關(guān)系數(shù)作為對(duì)比?!苯Y(jié)果“分析結(jié)果見表1表明A指標(biāo)與B指標(biāo)存在極強(qiáng)的顯著正相關(guān)ρ0.88, p0.001而與C指標(biāo)的相關(guān)性不顯著ρ0.15, p0.32?!焙?jiǎn)要解讀與過渡“強(qiáng)相關(guān)性提示A與B可能受共同潛在因素影響在后續(xù)的回歸模型中需注意其共線性問題。基于此分析我們選取了與核心因變量Y顯著相關(guān)的X1, X2, X3作為候選自變量集?!弊詈笥涀∠嚓P(guān)性分析是手段不是目的。它的價(jià)值在于為你后續(xù)更復(fù)雜的建模任務(wù)照亮前路排除陷阱。在緊張的比賽時(shí)間里花上半小時(shí)做好嚴(yán)謹(jǐn)?shù)南嚓P(guān)性分析與可視化往往能讓你的整篇論文邏輯鏈條更加扎實(shí)更能經(jīng)得起評(píng)委的推敲。