同過濾實(shí)戰(zhàn):MovieLens評分預(yù)測與Embedding實(shí)現(xiàn))
簡介一份面向推薦系統(tǒng)初學(xué)者與PyTorch使用者的實(shí)戰(zhàn)型PDF文檔以MovieLens公開數(shù)據(jù)集為載體系統(tǒng)講解協(xié)同過濾算法的完整實(shí)現(xiàn)流程。文檔共29頁壓縮包內(nèi)僅含1個PDF文件約2.02MB輕量便攜。內(nèi)容從推薦系統(tǒng)基礎(chǔ)與常見類型切入依次介紹基于用戶和基于物品的協(xié)同過濾原理并結(jié)合PyTorch動態(tài)計(jì)算圖特點(diǎn)給出張量操作、自動求導(dǎo)、模型定義、損失函數(shù)與優(yōu)化器選擇、訓(xùn)練循環(huán)及RMSE、MAE等評估指標(biāo)的詳細(xì)實(shí)現(xiàn)步驟。全文支持目錄跳轉(zhuǎn)和左側(cè)大綱定位便于按章節(jié)反復(fù)查閱也可作為課程設(shè)計(jì)或入門實(shí)踐參考。目前已有70人學(xué)習(xí)下載對希望快速上手推薦系統(tǒng)項(xiàng)目并理解算法細(xì)節(jié)的讀者來說是一份結(jié)構(gòu)清晰、可直接對照練習(xí)的實(shí)用資料。1. 協(xié)同過濾算法在MovieLens上的PyTorch實(shí)現(xiàn)為什么要自己寫一遍在推薦系統(tǒng)面試和課程設(shè)計(jì)里標(biāo)題這個組合幾乎是標(biāo)配任務(wù)把 MovieLens 的評分表拆開用 PyTorch 寫一個協(xié)同過濾模型讓用戶向量和物品向量的內(nèi)積去擬合真實(shí)評分。它把推薦系統(tǒng)最核心的五個環(huán)節(jié)——數(shù)據(jù)、模型、訓(xùn)練、評估、調(diào)參——壓縮到一個 CPU 筆記本就能跑完的最小閉環(huán)里。適合剛學(xué)完 PyTorch 教程卻不知道做什么項(xiàng)目的人也適合手推過矩陣分解公式、但沒寫過完整訓(xùn)練循環(huán)的候選人和學(xué)生。跑通這個項(xiàng)目你會發(fā)現(xiàn)Embedding、隱因子和評分預(yù)測是同一件事所謂協(xié)同過濾就是把用戶和物品各學(xué)一條向量讓它們的內(nèi)積盡量逼近真實(shí)評分同時用戶偏置和物品偏置解釋掉大家打分手松手緊的問題。這個認(rèn)知比背公式有用得多。2. 準(zhǔn)備MovieLens數(shù)據(jù)和PyTorch環(huán)境從原始評分表到可訓(xùn)練的DataLoader在這個實(shí)現(xiàn)鏈路上數(shù)據(jù)集和環(huán)境準(zhǔn)備往往被教程一筆帶過但實(shí)際返工大多出在這一步索引對不上、測試集里出現(xiàn)訓(xùn)練集沒見過的用戶、環(huán)境版本不對導(dǎo)致裝了 GPU 版卻跑不起來。我一般先把數(shù)據(jù)看清楚再搭環(huán)境最后寫 Dataset順序反了容易越改越亂。2.1 MovieLens 100K到底有哪些文件先搞懂u.data和u.itemMovieLens 100K 是 GroupLens 發(fā)布的公開學(xué)術(shù)數(shù)據(jù)集解壓后是一個 ml-100k 目錄。最核心的文件是u.data里面是制表符分隔的評分記錄四列分別是用戶 ID、電影 ID、1 到 5 的整數(shù)評分、UNIX 時間戳。整個數(shù)據(jù)集包含 943 個用戶對 1682 部電影的 10 萬條評分稀疏度接近 93.7%。也就是說絕大多數(shù)用戶和電影之間沒有記錄協(xié)同過濾要解決的就是從這里挑出用戶可能會看的電影。同目錄下的u.item負(fù)責(zé)電影信息映射比如電影 ID 對應(yīng)什么標(biāo)題、屬于什么類型u.user是用戶人口屬性。如果只是復(fù)現(xiàn)評分預(yù)測這兩個文件不是必需但做冷啟動分析和結(jié)果解釋時會用到。另外ua.base和ua.test是官方切分好的訓(xùn)練測試集訓(xùn)練集 8 萬、測試集 2 萬新手直接用這兩個文件能省掉自己切分帶來的偏差問題。需要強(qiáng)調(diào)一點(diǎn)這個數(shù)據(jù)集的標(biāo)簽是顯式評分評分缺省不代表用戶討厭只是沒看過。不要把沒評分的條目當(dāng)負(fù)樣本填 0 去訓(xùn)練這個認(rèn)知會直接影響后面 loss 函數(shù)的選擇。2.2 用Anaconda配置PyTorch環(huán)境CPU版就能跑不必要為了這個題上GPU很多人在 PyTorch 安裝這一步糾結(jié)半天實(shí)際上標(biāo)題里這個項(xiàng)目 CPU 完全能跑。我常用的方式是先用 Anaconda 或 Miniconda 建一個獨(dú)立的 Python 3.10 環(huán)境再按 PyTorch 官網(wǎng)生成的命令安裝對應(yīng)版本。官網(wǎng)會提供 Python 和 PyTorch 版本的對應(yīng)關(guān)系不用手動去記conda 會幫你解析依賴。conda create -n rec python3.10 -y conda activate rec pip install torch torchvision --index-url https://download.pytorch.org/whl/cpu這段命令的第三行裝的是 CPU 版 PyTorch不需要 NVIDIA 驅(qū)動也不需要 CUDA。如果你已經(jīng)裝過 CUDA 版 PyTorch那就正常用如果手頭是 AMD 顯卡、人在 WSL 里想折騰 7900XTX那需要的是 ROCm 版 PyTorch配置成本遠(yuǎn)高于這個項(xiàng)目的收益。所以我的建議一直是用 Anaconda 先把 CPU 版跑通確認(rèn)數(shù)據(jù)、模型、評估鏈路都沒問題再考慮是否值得上 GPU。安裝 PyTorch 不是必須配有 GPU這個體量的數(shù)據(jù)用 CPU 訓(xùn)練反而省心。裝好之后用幾行代碼驗(yàn)證環(huán)境import torch print(torch.__version__) a torch.randn(100, 32) b torch.randn(32, 50) print((a b).shape)這段代碼的邏輯很簡單能打印出版本號、矩陣乘能正常出 shape說明 PyTorch 基礎(chǔ)框架安裝成功。CPU 版在 100K 數(shù)據(jù)上訓(xùn)練一個 epoch 一般是秒級到十幾秒瓶頸不在算力而在你寫的索引轉(zhuǎn)換和數(shù)據(jù)加載是否合理。2.3 定義RatingDataset把評分表映射成Embedding能吃的索引寫模型之前必須先做一件事把u.data里的用戶 ID 和電影 ID 重新編碼成從 0 開始的連續(xù)整數(shù)。原因在于nn.Embedding的輸入索引必須在[0, size)區(qū)間內(nèi)。MovieLens 100K 的用戶 ID 恰好是 1 到 943 連續(xù)物品是 1 到 1682 連續(xù)直接減 1 也能用但一旦換數(shù)據(jù)集ID 往往不連續(xù)或有缺失所以統(tǒng)一用 pandas 的 category 編碼最保險import pandas as pd df pd.read_csv(ml-100k/u.data, sep\t, names[uid, iid, rating, ts]) df[uid_idx] df[uid].astype(category).cat.codes df[iid_idx] df[iid].astype(category).cat.codes num_users df[uid_idx].nunique() num_items df[iid_idx].nunique()這里有個順序上的坑先對全量數(shù)據(jù)做 category 編碼再做訓(xùn)練測試切分。如果先切分再編碼測試集里可能遇到訓(xùn)練集沒有的用戶 ID那部分樣本在 predict 時根本查不到 Embedding 行程序要么報(bào)錯要么悄悄出錯。接著定義一個標(biāo)準(zhǔn) PyTorch Dataset把每一行評分變成三元組import torch from torch.utils.data import Dataset, DataLoader class RatingDataset(Dataset): def __init__(self, df): self.users torch.tensor(df[uid_idx].values, dtypetorch.long) self.items torch.tensor(df[iid_idx].values, dtypetorch.long) self.ratings torch.tensor(df[rating].values, dtypetorch.float32) def __len__(self): return len(self.users) def __getitem__(self, idx): return self.users[idx], self.items[idx], self.ratings[idx]這個類的關(guān)鍵點(diǎn)在于 dtype。用戶索引和物品索引必須用 long因?yàn)閚n.Embedding只接受torch.long類型評分用 float32因?yàn)楹罄m(xù) MSE 損失要求預(yù)測和標(biāo)簽同類型。DataLoader 在取數(shù)據(jù)時默認(rèn)會做 stack把一組三元組拼成 batch所以模型看到的是三個張量用戶 ID 批、物品 ID 批、評分批。切分和裝載我一般這樣寫from sklearn.model_selection import train_test_split train_df, test_df train_test_split( df, test_size0.2, random_state42 ) train_ds RatingDataset(train_df) test_ds RatingDataset(test_df) train_loader DataLoader(train_ds, batch_size256, shuffleTrue) test_loader DataLoader(test_ds, batch_size1024, shuffleFalse)這樣得到的數(shù)據(jù)流是(users: (256,), items: (256,), ratings: (256,))batch_size256 在 CPU 上訓(xùn)練效率很高。random_state 固定成 42保證每次重跑結(jié)果一致這是后面調(diào)參對比的前提。如果你希望更接近官方協(xié)議直接用ua.base和ua.test零切分代碼也能避免自己切分帶來的評估糾紛。提示如果訓(xùn)練數(shù)據(jù)量變大比如換到 ml-1m記得給 DataLoader 加num_workers4和pin_memoryTrue否則數(shù)據(jù)加載會拖慢訓(xùn)練。3. 用PyTorch實(shí)現(xiàn)協(xié)同過濾模型從Embedding點(diǎn)積到帶偏置的MF模型這一章是標(biāo)題的核心。協(xié)同過濾在這個標(biāo)題里指的就是矩陣分解MF把用戶-物品評分矩陣近似分解成用戶隱因子矩陣和物品隱因子矩陣的乘積。PyTorch 里實(shí)現(xiàn)起來非常直白nn.Embedding本身就是一張可學(xué)習(xí)的查找表行號就是索引。3.1 最小可行模型兩個nn.Embedding求內(nèi)積先寫一個不摻任何額外花活的版本把框架立起來import torch.nn as nn class MatrixFactorization(nn.Module): def __init__(self, num_users, num_items, emb_dim32): super().__init__() self.user_emb nn.Embedding(num_users, emb_dim) self.item_emb nn.Embedding(num_items, emb_dim) def forward(self, users, items): u_vec self.user_emb(users) # (batch, emb_dim) i_vec self.item_emb(items) # (batch, emb_dim) return (u_vec * i_vec).sum(dim1) # (batch,)forward 里做的事對應(yīng)公式R_pred P_u · Q_i^T。u_vec和i_vec是同一個 batch 里每個用戶的隱向量和每個物品的隱向量逐元素相乘再求和得到的就是預(yù)測評分。embedding 維度 emb_dim 是隱因子個數(shù)通常取 16 到 64MovieLens 100K 這種整理過的評分矩陣32 作為起點(diǎn)最穩(wěn)妥。矩陣分解怎么理解每個用戶被壓成一個 32 維向量每個物品也是 32 維。向量的每一維不像動作片得分那樣有顯式含義而是模型自己學(xué)出來的潛語義。兩個向量方向越一致內(nèi)積越大預(yù)測評分越高。這就是協(xié)同過濾里最核心的隱語義模型思想也是面試官最愛問的SVD 和 MF 的區(qū)別的落腳點(diǎn)。3.2 加入用戶偏置、物品偏置和全局偏置評分預(yù)測更貼合現(xiàn)實(shí)最小模型有個明顯短板它假設(shè)評分只由用戶和物品的向量交互決定但人打分習(xí)慣差異很大有人給啥都是 4 星有人給啥都是 2 星。用向量去擬合這種習(xí)慣性偏差既浪費(fèi)表達(dá)力又容易把向量學(xué)歪。所以工程上的 MF 幾乎都會加三項(xiàng)偏置全局平均分、用戶偏置、物品偏置。用戶偏置回答這個用戶比全局平均多打了幾分物品偏置回答這部電影比全局平均高幾分剩下解釋不了的部分才交給隱向量交互。帶偏置的模型代碼class BiasMF(nn.Module): def __init__(self, num_users, num_items, emb_dim32): super().__init__() self.user_emb nn.Embedding(num_users, emb_dim) self.item_emb nn.Embedding(num_items, emb_dim) self.user_bias nn.Embedding(num_users, 1) self.item_bias nn.Embedding(num_items, 1) self.global_bias nn.Parameter(torch.zeros(1)) def forward(self, users, items): u_vec self.user_emb(users) i_vec self.item_emb(items) pred (u_vec * i_vec).sum(dim1) pred pred self.user_bias(users).squeeze(1) pred pred self.item_bias(items).squeeze(1) pred pred self.global_bias return predsqueeze(1)是把形狀為(batch, 1)的偏置壓成(batch,)方便與 pred 直接相加。global_bias是一個長度為 1 的可學(xué)習(xí)參數(shù)初始化成 0訓(xùn)練中會自動逼近訓(xùn)練集的評分均值。注意返回的 pred 是(batch,)而不是(batch, 1)后面 MSE 損失對這兩種形狀都能處理但建議保持和 rating 張量完全一致排查問題時少一個維度隱患。加了偏置之后RMSE 通常比純點(diǎn)積模型好 0.05 到 0.1而且某個用戶普遍打高分這類規(guī)律不再占用隱向量容量。這也是為什么工業(yè)界基礎(chǔ) MF 實(shí)現(xiàn)幾乎都帶偏置不帶反而會讓模型把簡單規(guī)律和復(fù)雜偏好混在一個空間里學(xué)。3.3 Embedding的初始化和正則化默認(rèn)參數(shù)會讓loss一開始就飛直接用nn.Embedding不加任何處理模型能跑但 loss 曲線會很難看。nn.Embedding默認(rèn)按標(biāo)準(zhǔn)正態(tài)分布 N(0,1) 初始化當(dāng) emb_dim32 時兩個隨機(jī)向量的內(nèi)積期望能達(dá)到幾十而評分范圍只有 1 到 5。內(nèi)積初始就比目標(biāo)大一個數(shù)量級早期梯度會拉得很猛表現(xiàn)為 train_loss 忽高忽低。解決辦法是手動把 Embedding 的初始化方差壓小比如 std0.1同時配合 weight_decay 做 L2 正則def init_embedding(m): if isinstance(m, nn.Embedding): nn.init.normal_(m.weight, mean0.0, std0.1) model BiasMF(num_users, num_items, emb_dim32) model.apply(init_embedding) optimizer torch.optim.Adam( model.parameters(), lr0.01, weight_decay1e-5 )std0.1 意味著兩個初始向量內(nèi)積的期望大概在 0.1 左右落在評分區(qū)間附近訓(xùn)練一開始 loss 不會爆炸。weight_decay1e-5 讓 Embedding 權(quán)重向 0 收縮避免模型把個別用戶的一兩個評分背下來。對 100K 數(shù)據(jù)集、約 8.4 萬參數(shù)量的模型來說這個正則強(qiáng)度足夠如果觀察到驗(yàn)證 loss 反彈可以把 weight_decay 提到 1e-4。embedding 維度本身也是正則手段維度越小容量越小。我調(diào)參時習(xí)慣從 8 到 64 逐檔試每次只動維度記錄 train 和 test 的 RMSE而不是同時改學(xué)習(xí)率和 batch size。手動初始化 std 這個細(xì)節(jié)很多人忽略但它對訓(xùn)練穩(wěn)定性影響很大尤其是你換用更大 emb_dim 時std 不跟著降loss 大概率飄。提示model.apply(init_embedding)會把三個 Embedding 表都初始化。如果你介意偏置表也從正態(tài)分布起跳可以在 apply 之后單獨(dú)把user_bias.item_bias再置零實(shí)際影響很小。4. 訓(xùn)練與評估把MSE、RMSE和Top-K召回分別算清楚模型寫好后訓(xùn)練循環(huán)和評估方式?jīng)Q定了你看到的結(jié)果是否有說服力。很多教程只貼一個 train 函數(shù)然后說loss 降了但推薦系統(tǒng)光看 loss 不夠線上真正關(guān)心的是推薦頭部有沒有命中用戶真實(shí)想看的物品。這一章把訓(xùn)練循環(huán)和最常用的兩類評估指標(biāo)都說清楚。4.1 訓(xùn)練循環(huán)的固定寫法MSELoss配合Adam監(jiān)控驗(yàn)證集訓(xùn)練循環(huán)是推薦系統(tǒng)項(xiàng)目里最模板化的代碼差異只在數(shù)據(jù)加載和模型 forward。我通常把單 epoch 訓(xùn)練寫成獨(dú)立函數(shù)方便多次調(diào)用def train_one_epoch(model, loader, optimizer, criterion): model.train() total_loss 0.0 for users, items, ratings in loader: optimizer.zero_grad() pred model(users, items) loss criterion(pred, ratings) loss.backward() optimizer.step() total_loss loss.item() * len(ratings) return total_loss / len(loader.dataset) model BiasMF(num_users, num_items, emb_dim32) init_embedding(model) criterion nn.MSELoss() optimizer torch.optim.Adam(model.parameters(), lr0.01, weight_decay1e-5) for epoch in range(20): train_loss train_one_epoch(model, train_loader, optimizer, criterion) print(fepoch{epoch:02d} train_loss{train_loss:.4f})為什么用 MSELoss評分預(yù)測是回歸任務(wù)MSE 對預(yù)測偏差做平方懲罰大偏差被放大梯度更平穩(wěn)。使用 Adam 時lr0.01 在 100K 規(guī)模上是合適的起點(diǎn)如果訓(xùn)練 loss 來回抖動降到 0.005如果一直不降查數(shù)據(jù)編碼或 Embedding 初始化是否生效。這里有個容易忽略的細(xì)節(jié)total_loss loss.item() * len(ratings)。loss.item()是當(dāng)前 batch 的平均損失乘上 batch 里樣本數(shù)再累加最后除以整個數(shù)據(jù)集樣本數(shù)才得到 epoch 級別的平均 loss。如果直接對每個 batch 的 loss.item() 做算術(shù)平均結(jié)果會被小 batch 的權(quán)重拉偏。訓(xùn)練中真正要盯的不是 train_loss而是驗(yàn)證集上的 RMSE。我習(xí)慣每兩個 epoch 在test_loader上跑一次評估連續(xù)三輪驗(yàn)證 RMSE 不降或者回升就保存當(dāng)前模型或直接停止。這是最簡單有效的防過擬合手段比任何花哨的正則都實(shí)用。4.2 評估指標(biāo)RMSE之外按用戶算Top-K命中率模型訓(xùn)練完之后不同指標(biāo)回答的問題不同。RMSE 衡量預(yù)測分?jǐn)?shù)和真實(shí)分?jǐn)?shù)的平均偏差MAE 是同樣的偏差但不用平方大誤差懲罰小一些。而 Top-K 召回或命中率看的是用戶真實(shí)看過的物品有多少出現(xiàn)在模型給出的前 K 個推薦里更貼近業(yè)務(wù)目標(biāo)。如果只報(bào) RMSE你要知道它與排序質(zhì)量并不完全一致一個 RMSE 更低的模型不一定在 Top-K 推薦里表現(xiàn)更好。因?yàn)?Top-K 只關(guān)心頭部順序?qū)︻A(yù)測絕對誤差不那么敏感。在 MovieLens 100K 上一個常見且可復(fù)現(xiàn)的 Top-K 評估是對每個測試用戶把所有未與該用戶交互過的物品打一遍分取分?jǐn)?shù)最高的 K 個看里面命中了多少測試集里該用戶真正看過的物品。代碼實(shí)現(xiàn)如下import numpy as np def evaluate_hit(model, train_df, test_df, item_ids, k10): model.eval() hits, total 0, 0 item_ids_np item_ids.cpu().numpy() with torch.no_grad(): for uid, group in test_df.groupby(uid_idx): seen set(train_df[train_df[uid_idx] uid][iid_idx].values) candidates [i for i in item_ids_np if i not in seen] if not candidates: continue uid_tensor torch.full((len(candidates),), uid, dtypetorch.long) cand_tensor torch.tensor(candidates, dtypetorch.long) scores model(uid_tensor, cand_tensor).cpu().numpy() top_k candidates[np.argsort(scores)[::-1][:k]] hits len(set(top_k) set(group[iid_idx].values)) total 1 return hits / max(total, 1)調(diào)用前需要準(zhǔn)備好全量物品 ID 張量item_ids torch.tensor(df[iid_idx].unique(), dtypetorch.long) hit_rate evaluate_hit(model, train_df, test_df, item_ids, k10)這段評估代碼有幾個關(guān)鍵點(diǎn)。seen是訓(xùn)練集中該用戶交互過的物品候選集里必須排除不然模型記住了訓(xùn)練集里已經(jīng)看過的電影Top-K 命中會虛高。total是參與評估的測試用戶數(shù)返回值是平均每個用戶前 10 個推薦里有多少個真實(shí)物品。它不要求你預(yù)測出用戶看過的所有物品只關(guān)心推薦頭部有沒有撞上真實(shí)行為。在 100K 規(guī)模下943 個用戶、每個用戶給 1682 個物品打分一次全量評估只要幾秒到十幾秒。如果日后換到 ml-1m這個寫法會太慢屆時的常見做法是負(fù)采樣給每個用戶隨機(jī)抽 100 到 150 個未交互物品加上真實(shí)測試物品組成候選集打分速度和內(nèi)存都能接受。4.3 一組能復(fù)現(xiàn)的默認(rèn)參數(shù)和結(jié)果參考以下是我在這個項(xiàng)目上常用的起始配置按這個跑能穩(wěn)定出一個合理基線參數(shù)建議值調(diào)參方向emb_dim328-64 逐檔試lr0.01抖動時降到 0.005batch_size256太大收斂慢太小噪聲大weight_decay1e-5過擬合時提高到 1e-4epochs20-40配合早停損失函數(shù)MSELoss預(yù)測評分用 MSE用 BiasMF 在 100K 隨機(jī)切分 20% 測試集上驗(yàn)證 RMSE 大約在 0.95 到 1.05 之間MAE 在 0.74 到 0.78 左右。如果只預(yù)測全局均值RMSE 約 1.13 上下所以 0.95-1.0 的 RMSE 說明模型學(xué)到了明顯信號但離完美還很遠(yuǎn)。網(wǎng)上有人曬 0.85 的 RMSE多半用了更復(fù)雜的 SVD 變體、更長的訓(xùn)練周期或者按用戶切分的評估方式數(shù)字之間不一定能直接橫向?qū)Ρ?。到這里你已經(jīng)有了數(shù)據(jù)、模型、訓(xùn)練和評估的完整鏈路。下一章是更值錢的哪些細(xì)節(jié)會讓模型悄悄翻車。5. PyTorch協(xié)同過濾避坑指南五個常見的翻車細(xì)節(jié)這一章把復(fù)現(xiàn)類似項(xiàng)目時最常見的問題整理成五條每條按現(xiàn)象、原因、解決來寫。踩過這些坑之后再去調(diào)參、展示結(jié)果會從容很多。5.1 索引錯位DataFrame里的ID不等于Embedding的索引現(xiàn)象訓(xùn)練時偶爾報(bào) IndexError或者模型評估結(jié)果完全反常。原因u.data里的用戶 ID 從 1 開始物品 ID 也是從 1 開始而nn.Embedding的輸入索引要從 0 開始。如果你直接拿原始 ID 喂給模型num_users943合法索引是 0 到 942用戶 ID 等于 943 的那條樣本就會越界。換到別的數(shù)據(jù)集更可能出現(xiàn)物品 ID 不連續(xù)、最大 ID 超過 Embedding size 的情況。解決在讀取數(shù)據(jù)后用astype(category).cat.codes把原始 ID 重編碼成 0 到 N-1 的整數(shù)而且要在全量數(shù)據(jù)上先編碼再切分。模型里所有 Embedding 的num_users和num_items都取編碼后的nunique()。這條做對了能避免一半以上的報(bào)錯。5.2 隨機(jī)切分造成的光環(huán)你的RMSE可能虛低現(xiàn)象同一份代碼隨機(jī)切分測試集下 RMSE 很漂亮換成官方ua.base/ua.test后 RMSE 漲了不少。原因隨機(jī)切分允許同一個用戶、同一部電影的評分同時出現(xiàn)在訓(xùn)練集和測試集模型在 train 階段見過這個用戶和這部電影的偏置預(yù)測自然占便宜?,F(xiàn)實(shí)中你要推薦的是用戶沒看過的電影所以隨機(jī)切分會把測試難度做小也讓不同實(shí)現(xiàn)之間的對比失去公平性。解決用官方切分或者至少按用戶劃分整個用戶的所有評分要么在訓(xùn)練集要么在測試集。如果是跟時間排序有關(guān)的場景按ts時間戳劃分更貼近真實(shí)線上。作為課程項(xiàng)目隨機(jī)切分也夠用但匯報(bào)結(jié)果時務(wù)必說明切分方式否則你的 RMSE 和別人的不具可比性。5.3 過擬合訓(xùn)練loss一直降驗(yàn)證loss卻開始反彈現(xiàn)象訓(xùn)練集 RMSE 降到 0.7 以下驗(yàn)證 RMSE 先降到 0.96 又開始往 1.05 走。原因模型參數(shù)主要來自 Embedding 表數(shù)十萬級參數(shù)面對 8 萬級訓(xùn)練樣本完全有能力記住個別評分的噪聲。一開始 train_loss 下降得快因?yàn)槟P驮跀M合訓(xùn)練分布隨后驗(yàn)證集不再受益因?yàn)槟P烷_始背題目。解決第一優(yōu)先加 weight_decay從 1e-5 調(diào)到 1e-4第二使用早停每兩個 epoch 檢查驗(yàn)證 RMSE連續(xù)三輪沒有改善就停止第三降低 emb_dim讓隱因子從 32 降到 16減少容量。推薦做法是三個手段都留一點(diǎn)不要靠一個參數(shù)硬扛。5.4 把評分缺省當(dāng)負(fù)樣本這是顯式反饋任務(wù)的典型錯位現(xiàn)象為了提高 Top-K 指標(biāo)把用戶沒評分的物品全部當(dāng)作負(fù)樣本用 0 標(biāo)簽或 Binary Cross Entropy 訓(xùn)練結(jié)果 RMSE 和 MAE 完全沒法看。原因MovieLens 的缺省值不代表用戶討厭。用戶沒看過這部電影和用戶看了不喜歡是兩個完全不同的信號。顯式評分任務(wù)應(yīng)該回歸 1 到 5 的評分把它當(dāng)成隱式反饋任務(wù)需要額外設(shè)計(jì)負(fù)采樣策略并且不能只用 RMSE 作為主要評估方式。解決在這個標(biāo)題的鏈路里直接用 MSE 回歸評分即可不需要負(fù)樣本。除非后續(xù)做隱式反饋方向比如預(yù)測用戶是否會點(diǎn)擊那才需要采樣真實(shí)負(fù)樣本一般每個正樣本配 1 到 4 個負(fù)樣本避免全量負(fù)樣本導(dǎo)致訓(xùn)練太慢、分布太偏。5.5 不要迷信GPU100K數(shù)據(jù)上CPU反而更高效現(xiàn)象在只有 CPU 的環(huán)境上訓(xùn)練又快又穩(wěn)把同一份代碼搬到 GPU每個 epoch 反而慢了或者顯存占用高得離譜。原因模型太小、數(shù)據(jù)量太小GPU 的 kernel launch 開銷占比過大加上 WSL 或 AMD ROCm 環(huán)境還需額外配置收益為負(fù)。很多人一開始被深度學(xué)習(xí)必須 GPU帶偏其實(shí)本任務(wù) CPU 完全夠用安裝 PyTorch 不是必須裝有 GPU。解決先把 CUDA 的念頭放一邊用 CPU 版 PyTorch 跑通整個項(xiàng)目。如果確實(shí)在 WSL 里配了 GPU 環(huán)境確認(rèn) PyTorch 版本能否被torch.cuda.is_available()或 ROCm 對應(yīng)接口識別能識別就正常用不能識別就老實(shí)回 CPU 跑。像 7900XTX 這種 AMD 卡在 WSL 里折騰 ROCm 的時間足夠這個項(xiàng)目優(yōu)化十輪了。6. 進(jìn)階把評估換得更真實(shí)Embedding可視化才更有說服力能走到這一步說明你已經(jīng)有了穩(wěn)定跑的基線和評估函數(shù)。剩下值得花時間的不是無限調(diào)參而是把評估口徑和可視化做扎實(shí)。6.1 按時間切分模擬預(yù)測未來的離線評估隨機(jī)切分適合快速實(shí)驗(yàn)但對推薦系統(tǒng)的真實(shí)部署場景說服力有限。更真實(shí)的做法是按時間戳切分用前 80% 時間段的數(shù)據(jù)訓(xùn)練用后 20% 的數(shù)據(jù)測試。代碼非常簡單cutoff df[ts].quantile(0.8) train_df df[df[ts] cutoff] test_df df[df[ts] cutoff]這樣做之后模型只能從歷史交互里學(xué)規(guī)律再去預(yù)測之后發(fā)生的評分和線上場景基本一致。你可能會發(fā)現(xiàn) RMSE 比隨機(jī)切分略差這很正常時間靠后的樣本里有大量新電影和活躍用戶本來就更難預(yù)測。6.2 把Item Embedding用PCA投影出來訓(xùn)練完的item_emb是(num_items, 32)的矩陣每一行是一部電影在潛語義空間里的坐標(biāo)。用 PCA 降到二維再按電影類型上色可以直觀驗(yàn)證向量是否學(xué)到了語義from sklearn.decomposition import PCA item_emb model.item_emb.weight.detach().numpy() pca PCA(n_components2).fit_transform(item_emb)觀察結(jié)論比想象中常見動作片和科幻片往往聚在一起經(jīng)典老片也可能形成一個團(tuán)。如果 cluster 完全看不出類別不一定代表訓(xùn)練失敗也可能是 embedding 維度太短、epoch 太少或者評分偏好本身與電影類型維度不完全一致。把 PCA 散點(diǎn)圖放進(jìn)報(bào)告里比只貼一張 loss 下降圖更有說服力。6.3 固定種子、單變量調(diào)參結(jié)果才有積累價值回看這個標(biāo)題的整個鏈路最后要養(yǎng)成的習(xí)慣是每次實(shí)驗(yàn)固定 seed、固定切分、固定評估函數(shù)只改一個超參。我第一次跑通這個項(xiàng)目時最狼狽的一次調(diào)參是同時動了 embedding 維度、學(xué)習(xí)率和測試集切分跑了一晚上最后根本分不清是哪個調(diào)整讓結(jié)果變好。從那以后每次改參只動一個變量復(fù)制一條實(shí)驗(yàn)記錄seed、embedding 維度、lr、weight_decay、train RMSE、test RMSE、Top-K 命中率??窟@套笨辦法后續(xù)每次實(shí)驗(yàn)都是對之前結(jié)果的小步改進(jìn)而不是推倒重來。希望幫到你。本文還有配套的精品資源點(diǎn)擊獲取