Transformer時間序列預測:從單步到多步的完整指南)
簡介本資源是一套基于PyTorch實現(xiàn)的Transformer時間序列預測完整實驗方案面向機器學習初學者與時間序列建模實踐者聚焦單步與多步預測兩大核心任務適用于氣象、能源、金融等領域的時序數(shù)據(jù)分析場景。壓縮包共10個文件3.21MB包含2個核心訓練腳本transformer-singlestep.py與transformer-multistep.py、1個真實溫度數(shù)據(jù)集daily-min-temperatures.csv、1張預測效果可視化圖transformer-future200.png、1個動態(tài)訓練過程演示gifresult.gif、1份環(huán)境依賴說明requirements.txt及README文檔等結構清晰、開箱即用。已有2909人學習下載所有代碼均經(jīng)實測可直接運行附帶每日最低溫度數(shù)據(jù)上的100輪訓練結果與多步預測對比分析便于讀者理解模型輸入構造、位置編碼設計、掩碼機制應用及輸出解碼邏輯是深入掌握Transformer在時序領域落地的優(yōu)質(zhì)實踐素材。 拿到一個時間序列預測需求時很多人第一反應是先套LSTM。我一開始也是這么干的但項目數(shù)據(jù)拉長到幾百個時間步后LSTM訓練慢不說往后預測的曲線像一個被壓扁的彈簧越來越“平”。朋友建議試試Transformer我?guī)е鴮⑿艑⒁傻膽B(tài)度用Pytorch從零搭了一套單步和多步預測實驗。沒想到的是模型把長距離依賴抓得很穩(wěn)預測結果比LSTM明顯更貼合趨勢。這篇文章就是這次實驗的記錄從為什么選Transformer、單步/多步怎么設計到Pytorch完整實現(xiàn)和踩坑實錄都會拆開講。適合已經(jīng)會上手Pytorch、但還沒用Transformer處理過時間序列的同學也適合做量化、銷量預測、設備監(jiān)測等場景的工程師參考。我會盡量把每個關鍵選擇背后的原因?qū)懬宄皇侵粊G代碼。1. 整體設計與思路拆解1.1 為什么用Transformer而不是LSTM在時間序列上做預測本質(zhì)上是在建?!斑^去的時間點如何影響未來”。LSTM和GRU的思路是遞歸地、逐步地把信息往后傳這種過程的優(yōu)點是參數(shù)少、可解釋性強但缺點也很明顯訓練是串行的序列一長梯度消失和長期依賴丟失的問題就會顯現(xiàn)。Transformer的設計是直接計算序列中任意兩個位置之間的關聯(lián)度通過多頭注意力機制一次性看到全局信息。放在時間序列里這就意味著模型可以自己學會“第1個時間點對第50個時間點很重要”而不是像RNN那樣靠門控一路“背”過去。不過話說回來Transformer也不是沒有代價。它不像LSTM自帶順序概念必須靠位置編碼把順序信息硬塞進輸入而且注意力矩陣的空間復雜度是O(n^2)窗口特別長的時候會吃顯存。這決定了我們在實驗里不能無腦堆窗口需要在數(shù)據(jù)長度和模型容量之間做取舍。但總體上對于中等長度幾十到幾百個時間點的時間序列Transformer的精度和訓練效率都很有競爭力。我在做實驗對比時同一個數(shù)據(jù)切了兩份一份用兩層LSTM一份用兩層Transformer encoder。LSTM訓練了接近200個epoch才收斂Transformer在100個epoch左右就已經(jīng)更好了尤其在后半段的預測曲線上Transformer更貼近原始趨勢。這其實不難理解時間序列里“之前一段時間的形態(tài)”往往比“最后一個點的值”更重要而注意力機制天生擅長捕捉這種形態(tài)。1.2 單步預測和多步預測的差異單步預測是經(jīng)典的監(jiān)督學習任務輸入過去一段序列輸出下一個時間點的值。多步預測的難度要高一個檔次因為輸出的是一個連續(xù)的未來區(qū)間不只是“下一個點”的精確值還要考慮未來多個點之間的疊加誤差。我在實驗中分別實現(xiàn)了兩種多步方案這里先做一個直觀對比指標直接多步遞歸多步實現(xiàn)復雜度輸出層維度設為horizon簡單需要把預測值拼回輸入循環(huán)推理推理速度快一次forward得到K個點慢要連續(xù)forward K次誤差累積幾乎沒有因為K個點同時輸出明顯越往后越偏訓練難度需要同時擬合K個標簽數(shù)據(jù)量小時難度大訓練時仍是單步難度低適用場景horizon較大、訓練數(shù)據(jù)充足小規(guī)??焖賹嶒灐⒛P偷谥苯佣嗖紻irect Multi-stepTransformer輸出層的維度直接設為horizon長度讓模型一次生成未來K個點。缺點是模型要同時擬合K個輸出訓練難度高但推理快。遞歸多步Recursive Multi-step先用單步模型預測出下一個點再把這個預測值當輸入滑進窗口繼續(xù)預測下下個點。實現(xiàn)簡單但誤差會隨著步數(shù)累積越往后越偏。還有一種Teacher Forcing的訓練方式只在訓練時用真實值替代預測值喂養(yǎng)模型推理時再用預測值這個后面在訓練循環(huán)里會講。這兩個方案我都跑了也記錄了各自的loss曲線和誤差指標。直接多步在horizon比較大時會比遞歸更穩(wěn)但前提是訓練數(shù)據(jù)要充足遞歸多步在小樣本上更靈活適合快速迭代。建議你在自己的數(shù)據(jù)上都試試對比后再選。2. 核心細節(jié)解析與實操要點2.1 位置編碼不能省但不要照搬NLPTransformer本身沒有順序感。把序列順序打亂注意力算出來的結果是一模一樣的。所以位置編碼是Transformer做時序預測繞不開的基礎。NLP里常見的是正弦位置編碼把位置索引用sin/cos函數(shù)映射到embedding維度上。在時間序列里這個方式一樣能用但我測試下來直接把時間戳比如間隔、周幾、小時作為額外特征拼進輸入效果往往更好尤其是數(shù)據(jù)有明顯周期性的場景。實用的做法是“加”而不是“拼”把正弦位置編碼加到輸入embedding上然后額外把標準化后的時間特征拼在輸入特征維度后面。這樣模型既能感知絕對位置也能感知周期性信息。代碼實現(xiàn)時位置編碼的維度要和d_model一致否則維度對不上沒法加。為什么要乘sqrt(d_model)這是Transformer原論文里的一個細節(jié)。輸入經(jīng)過embedding后數(shù)值范圍通常會比較小直接往上面加位置編碼位置信息很容易蓋過原始特征。乘上sqrt(d_model)相當于把輸入embedding放大到和位置編碼一個量級讓兩者在相加時都能保留有效信息。我在實驗里試過不乘這個系數(shù)訓練loss收斂明顯變慢所以這個細節(jié)不建議省。2.2 數(shù)據(jù)預處理決定模型上限先講一個我踩過的坑一開始我直接用整個序列的均值和方差做歸一化訓練loss很漂亮但測試特別差。后來才意識到這是把未來信息透漏給了訓練過程也就是典型的數(shù)據(jù)泄漏。正確的做法是只在訓練集上fit scaler再用同一套scaler去transform驗證集和測試集?;瑒哟翱诘臉嬙煲仓档眉毱?。單步預測時每條樣本是[look_back, feature_dim]的輸入和[1]的標簽多步預測時標簽就變成[horizon]或者[horizon, feature_dim]。窗口長度look_back一般取序列長度的10%~20%不能太短也不能太長。我常用look_back24或48來預測未來6~12個點效果比拍腦袋定的窗口好不少。另外如果數(shù)據(jù)有缺失不要用均值填充盡量用前向填充或插值避免引入錯誤的局部趨勢。關于歸一化我一般用MinMaxScaler。它在數(shù)據(jù)有明顯上下界時非常穩(wěn)能讓模型更快收斂。StandardScaler也不是不行但對異常值更敏感。如果數(shù)據(jù)里有特別大的尖峰MinMax可能把正常值壓得太扁這時候可以先做一輪異常值截斷再用。不要一上來就把所有數(shù)據(jù)丟進模型先畫圖看分布這個習慣能省掉后面很多麻煩。2.3 核心超參數(shù)怎么定才有得跑下面是這次實驗里的核心超參數(shù)可以直接照抄參數(shù)數(shù)值說明d_model64輸入embedding和注意力投影的維度nhead4多頭注意力頭數(shù)需能被d_model整除num_encoder_layers2標準Transformer里encoder層數(shù)我用了2層dim_feedforward256前饋網(wǎng)絡隱藏層維度dropout0.1防止過擬合batch_size64顯存不大就調(diào)小建議32~128learning_rate1e-3初始學習率配合cosine調(diào)度epochs100早停耐心值建議設20注意nhead一定要能整除d_model否則Pytorch會直接報錯。層數(shù)不是越多越好我試過4層在數(shù)據(jù)量不大的情況下反而更容易過擬合。學習率建議用AdamW 余弦退火Transformer對學習率比LSTM敏感固定學習率容易震蕩。dim_feedforward我習慣設成d_model的4倍左右太大參數(shù)量漲得快太小表達能力受限。還有一個常被忽略的參數(shù)是dropout。時間序列訓練數(shù)據(jù)一般不會特別大dropout設太小容易過擬合設太大又可能欠擬合。0.1到0.2之間是個安全區(qū)間。如果你的數(shù)據(jù)量超過十幾萬條可以把dropout降到0.05加快收斂。3. 實操過程與核心環(huán)節(jié)實現(xiàn)3.1 環(huán)境搭建與項目結構動手前先把環(huán)境理順。我習慣用conda建一個獨立環(huán)境避免跟其他項目打架。conda create -n ts_transformer python3.9 -y conda activate ts_transformer pip install torch2.1.2 --index-url https://download.pytorch.org/whl/cu118 pip install numpy pandas matplotlib scikit-learn如果你用的是GPU機器裝完后第一時間檢查一下CUDA是否可用python -c import torch; print(torch.cuda.is_available(), torch.cuda.device_count())輸出“True 1”就說明Pytorch能用GPU了。如果輸出False不是驅(qū)動問題就是Pytorch版本沒選對。我還在Jetson等嵌入式設備上裝過那又得單獨挑適配版本不建議新手一上來就碰。項目目錄我習慣這樣組織time_series_transformer/ ├── data.csv # 原始數(shù)據(jù) ├── dataset.py # 數(shù)據(jù)集與預處理工具 ├── model.py # Transformer模型定義 ├── train.py # 單步/多步訓練腳本 ├── evaluate.py # 評估與可視化 └── requirements.txt這個結構看著簡單但足夠用。實驗迭代時最怕把所有代碼堆在一個文件里改一個地方牽一發(fā)動全身。把數(shù)據(jù)、模型、訓練、評估拆開后面換數(shù)據(jù)集或者換模型會輕松很多。3.2 數(shù)據(jù)準備與Dataset類為了把實驗說透我用了一段周期信號疊加噪聲的數(shù)據(jù)模擬傳感器讀數(shù)或者銷量曲線。你也可以換成自己的csv只要確保日期列按時間升序排列。import numpy as np import pandas as pd from torch.utils.data import Dataset, DataLoader # 生成示例數(shù)據(jù)正弦 線性趨勢 噪聲 np.random.seed(42) t np.arange(0, 1200) signal 10 * np.sin(2 * np.pi * t / 50) salary t * 0.01 noise np.random.normal(0, 1, sizet.shape) data signal salary noise注意這個數(shù)據(jù)只是示例真正項目里數(shù)據(jù)要復雜得多但處理和建模邏輯是一樣的。這里我故意加了一個單調(diào)趨勢是想看Transformer能不能在趨勢和周期并存時學出結構。接下來是滑動窗口。我寫了一個繼承Dataset的類輸入是[look_back, feature_dim]序列標簽是未來horizon個點。class TimeSeriesDataset(Dataset): def __init__(self, data, look_back24, horizon6, step1): self.x, self.y [], [] for i in range(0, len(data) - look_back - horizon 1, step): x data[i:i look_back] y data[i look_back:i look_back horizon] self.x.append(x) self.y.append(y) self.x np.array(self.x, dtypenp.float32) self.y np.array(self.y, dtypenp.float32) def __len__(self): return len(self.x) def __getitem__(self, idx): return self.x[idx], self.y[idx]需要注意這里的data是一維數(shù)組所以我構建x時每個時間點只有1個特征。如果有多維特征沿著最后一個維度拼接即可上一節(jié)的“拼時間戳”也是在這里做。構造好的樣本可以用DataLoader加載look_back, horizon 24, 6 dataset TimeSeriesDataset(data, look_back, horizon) # 按時間順序切分 train_size int(0.7 * len(dataset)) val_size int(0.15 * len(dataset)) test_size len(dataset) - train_size - val_size train_data, val_data, test_data torch.utils.data.random_split( dataset, [train_size, val_size, test_size], generatortorch.Generator().manual_seed(42) )這里要特別提醒random_split會在內(nèi)部做隨機打亂但因為我們構造樣本時本身就是按時間順序滑動窗口生成的可能不太合適。更穩(wěn)妥的做法是直接按索引切分不調(diào)用random_split具體看你自己需求。如果是嚴格的時序預測建議手動切片保證訓練集在時間上完全早于驗證集和測試集。3.3 Transformer模型核心實現(xiàn)標準Transformer結構里包含Encoder和Decoder。但時間序列預測不一定需要Decoder尤其是單步預測和直接多步預測用Encoder堆疊后接一個全連接輸出層就能取得不錯的效果。我在實驗中選的是Encoder-only方案結構更輕訓練更快。如果想做遞歸多步同樣可以復用這個Encoder只是在推理時多繞幾圈。下面是完整的模型定義位置編碼和Encoder主體都放進去。import torch import torch.nn as nn import math class PositionalEncoding(nn.Module): def __init__(self, d_model, dropout0.1, max_len5000): super().__init__() self.dropout nn.Dropout(pdropout) pe torch.zeros(max_len, d_model) position torch.arange(0, max_len, dtypetorch.float).unsqueeze(1) div_term torch.exp(torch.arange(0, d_model, 2).float() * (-math.log(10000.0) / d_model)) pe[:, 0::2] torch.sin(position * div_term) pe[:, 1::2] torch.cos(position * div_term) pe pe.unsqueeze(0) self.register_buffer(pe, pe) def forward(self, x): x x self.pe[:, :x.size(1), :] return self.dropout(x) class TimeSeriesTransformer(nn.Module): def __init__(self, feature_dim1, d_model64, nhead4, num_layers2, dropout0.1): super().__init__() self.d_model d_model self.input_proj nn.Linear(feature_dim, d_model) self.pos_encoder PositionalEncoding(d_model, dropout) encoder_layer nn.TransformerEncoderLayer( d_modeld_model, nheadnhead, dim_feedforward256, dropoutdropout, batch_firstTrue, ) self.transformer_encoder nn.TransformerEncoder(encoder_layer, num_layersnum_layers) def forward(self, x): # x: [batch, seq_len, feature_dim] x self.input_proj(x) * math.sqrt(self.d_model) x self.pos_encoder(x) x self.transformer_encoder(x) return x在單步任務里輸出層可以只取編碼序列的最后一幀再接一個Linear。在多步任務里要么對最后一幀輸出horizon維要么把整個編碼序列壓平再接全連接。后者參數(shù)量大一般用前者class SingleStepHead(nn.Module): def __init__(self, d_model): super().__init__() self.fc nn.Linear(d_model, 1) def forward(self, enc_output): return self.fc(enc_output[:, -1, :]) # 取最后一個位置的編碼 class MultiStepHead(nn.Module): def __init__(self, d_model, horizon): super().__init__() self.fc nn.Linear(d_model, horizon) def forward(self, enc_output): return self.fc(enc_output[:, -1, :])為什么取“最后一個位置的編碼”而不是所有位置的編碼因為TransformerEncoder每一層都會做全局注意力也就是說每個位置的輸出都已經(jīng)包含了對整個序列的“總結”。最后一個位置在時間上離預測目標最近拿它做輸出頭的信息瓶頸最合適。如果要保留更多細節(jié)也可以把最后幾幀拼起來但代價是參數(shù)量增加收益不一定明顯。3.4 單步預測訓練流程訓練循環(huán)本身不復雜但有幾個地方我會特別注意。第一個是loss單步用MSE這是回歸任務的標配。第二個是優(yōu)化器AdamW配合余弦退火幾乎是當前Transformer訓練的標準配置比單純用Adam穩(wěn)定。def train_model(model, train_loader, val_loader, epochs50, lr1e-3): device cuda if torch.cuda.is_available() else cpu model model.to(device) criterion nn.MSELoss() optimizer torch.optim.AdamW(model.parameters(), lrlr) scheduler torch.optim.lr_scheduler.CosineAnnealingLR(optimizer, T_maxepochs) for epoch in range(epochs): model.train() train_loss 0.0 for x, y in train_loader: x, y x.to(device), y.to(device) optimizer.zero_grad() enc_out model(x) pred model.output_head(enc_out) loss criterion(pred, y) loss.backward() optimizer.step() train_loss loss.item() scheduler.step() val_loss evaluate(model, val_loader, criterion, device) if (epoch 1) % 10 0: print(fEpoch {epoch1}, Train Loss: {train_loss/len(train_loader):.6f}, Val Loss: {val_loss:.6f}) return model寫這段代碼時要注意model.output_head是我們在外部掛上去的。一個更方便的做法是在TimeSeriesTransformer里增加一個head_type參數(shù)直接在構造函數(shù)里決定使用單步頭還是多步頭這樣訓練代碼可以共用。訓練時如果loss長時間不下降先查兩件事學習率是不是太大數(shù)據(jù)有沒有標準化。絕大多數(shù)奇怪現(xiàn)象都出在這兩處。3.5 多步預測實現(xiàn)方式直接多步訓練起來和單步幾乎一樣只是y的維度從1變成horizon輸出頭換成MultiStepHeadloss仍然用MSE。推理的時候一次拿到的就是未來horizon個點非常直接。遞歸多步需要額外寫一個推理函數(shù)把模型預測出的下一個值拼到輸入序列尾部同時丟掉最前面的點讓窗口“滑”起來。def recursive_forecast(model, history, steps, devicecpu): # history: [look_back, feature_dim] model.eval() history torch.tensor(history, dtypetorch.float32).unsqueeze(0).to(device) preds [] with torch.no_grad(): for _ in range(steps): enc_out model(history) pred model.output_head(enc_out) # [1, 1] preds.append(pred.item()) pred pred.unsqueeze(-1) # [1, 1, 1] history torch.cat([history[:, 1:, :], pred], dim1) return preds這個思路很直觀但坑也在這輸入用的預測值本身就是不準的誤差會隨著步數(shù)增多不斷放大。我實測下來horizon6時還能看horizon24時后面基本變成一條平滑直線。緩解誤差累積有幾個實用技巧訓練時用Teacher Forcing即以一定概率用真實值替代預測值去喂下一步讓模型適應自己的預測對輸出做clip限制預測值的合理范圍避免極端值把窗口帶偏推理階段用確定性策略比如取中位數(shù)而不是單次路徑。3.6 評估與可視化評估指標我用三個MAE、RMSE和R2。MAE好解釋RMSE對大誤差更敏感R2則能反應模型對真實趨勢的擬合程度。from sklearn.metrics import mean_absolute_error, mean_squared_error, r2_score def evaluate_metrics(y_true, y_pred): mae mean_absolute_error(y_true, y_pred) rmse mean_squared_error(y_true, y_pred, squaredFalse) r2 r2_score(y_true, y_pred) return {MAE: mae, RMSE: rmse, R2: r2}畫圖建議用matplotlib把測試集真實值和預測值畫在同一張圖里。多步預測時我會把每個預測窗口的起點和終點連起來畫成階梯狀能更清楚地看到誤差累積發(fā)生在哪個階段。import matplotlib.pyplot as plt plt.figure(figsize(12, 5)) plt.plot(y_true, labelTrue) plt.plot(y_pred, labelPred) plt.legend() plt.title(Time Series Prediction) plt.show()這張圖是判斷模型有沒有“學到東西”的最快方式。如果pred和true的相位都對不上先檢查窗口長度是否合理如果趨勢對但局部抖動不對考慮加更多特征或調(diào)d_model。4. 常見問題與排查技巧實錄4.1 數(shù)據(jù)泄漏最隱蔽也最致命數(shù)據(jù)泄漏是時間序列預測里出現(xiàn)頻率最高的“幽靈問題”。除了歸一化泄漏還有一種是數(shù)據(jù)集劃分時不注意時間順序把未來樣本混進訓練集結果模型在測試集上表現(xiàn)“超神”一到線上就崩。處理辦法是嚴格按時間順序劃分且在構造滑動窗口時讓訓練集只使用該時間點之前的數(shù)據(jù)。另外如果數(shù)據(jù)來自多個實體比如多個城市或設備的序列不能把它們混在一起打亂劃分應該按實體分組切分否則也會出現(xiàn)實體級別的泄漏。我自己的判斷標準很簡單如果訓練集和測試集的MAE差距小得離譜或者測試集比訓練集還好那大概率是泄漏了。正常情況訓練誤差應該略低于測試誤差這個經(jīng)驗雖然不絕對但能幫你快速發(fā)現(xiàn)問題。4.2 訓練Loss不降或變成NaN我遇到過一次Loss變成NaN的情況查了半天發(fā)現(xiàn)是沒有對輸入數(shù)據(jù)做歸一化數(shù)值稍微大一點經(jīng)過多頭注意力里的softmax后就爆炸了。解決方法是先把數(shù)據(jù)縮放到[0, 1]或標準化到均值0方差1再開始訓練。如果標準化后還是NaN檢查一下學習率Transformer的訓練不太吃固定的大學習率建議從1e-4或者3e-4開始試。還有一種可能是位置編碼的max_len不夠序列長度超過上限導致pe切片出問題這種一般會直接報IndexError不太會靜默NaN。另外一個容易忽視的點是batch_first。Pytorch的TransformerEncoderLayer默認batch_firstFalse如果輸入維度是[batch, seq_len, feature]必須顯式設置batch_firstTrue否則會對seq_len維度做batch維處理雖然不報錯但結果完全不對。這種錯誤很難排查因為它表現(xiàn)成loss一直在下降但驗證曲線不對勁。4.3 多步預測后期曲線“平”了多步預測的誤差累積問題前面提過這是所有遞歸式預測的通病。處理思路有兩個方向一是把模型換成直接多步輸出一次性預測完整未來區(qū)間從根源上避免遞歸累積二是引入機器學習里的魯棒性技巧比如訓練時對輸入加小噪聲、預測時對輸出做平滑。我自己的經(jīng)驗是如果horizon不超過10遞歸多步能省顯存且效果不差如果horizon到了24以上直接多步會更穩(wěn)定。建議在實驗設置里同時保留這兩種模式用驗證集決定到底用哪個。有時“曲線平了”也不全是誤差累積的問題可能是數(shù)據(jù)本身的信噪比太低。我畫過頻譜圖之后發(fā)現(xiàn)數(shù)據(jù)里真正可預測的成分只占很小一部分模型很容易傾向于輸出均值附近的值。這時候考慮對數(shù)據(jù)做差分或季節(jié)分解把趨勢和周期拆開建模再對殘差做預測。4.4 顯存和訓練速度問題注意力矩陣的大小是平方級增長的窗口長度從24改成96顯存占用可能直接翻好幾倍。如果顯存不夠優(yōu)先調(diào)小batch_size或者用梯度累積gradient accumulation模擬更大的batch。Pytorch的自動混合精度AMP也值得開torch.cuda.amp里封裝得已經(jīng)很成熟能省不少顯存還能加速訓練。下面是一個簡化的混合精度訓練片段scaler torch.cuda.amp.GradScaler() for x, y in train_loader: optimizer.zero_grad() with torch.cuda.amp.autocast(): pred model(x) loss criterion(pred, y) scaler.scale(loss).backward() scaler.step(optimizer) scaler.update()AMP在NVIDIA GPU上用Pytorch 2.x已經(jīng)非常穩(wěn)定CPU上不用開。還有一個建議盡量用batch_firstTrue的TransformerEncoderLayerPytorch默認是False如果搞錯了維度雖然報錯你會知道但排查起來很煩。4.5 長序列窗口的改進空間標準Transformer處理幾百甚至上千的時間步時顯存和效率都會遇到瓶頸。我這次實驗主要用的是中等長度窗口但如果你遇到超長序列建議看看Transformer的改進變體比如Informer的稀疏注意力、Autoformer的分解機制、PatchTST把時間序列切成patch再編碼。這些都在標準Transformer的思路上做了針對性優(yōu)化很適合高頻金融數(shù)據(jù)、長時間傳感器監(jiān)測這類場景。我后續(xù)也在計劃把PatchTST并進這套實驗框架里做對比。另外提醒一句模型調(diào)參不是全部。數(shù)據(jù)質(zhì)量、特征工程、異常值處理對最終預測效果的影響往往比換模型更明顯。我在做這套實驗時花了將近一半時間在清洗和構建特征上模型本身雖然重要但絕不是唯一變量。做完整套單步、多步實驗后我最深的體會是Transformer不是一個“萬能開關”它適合的是長依賴和多變量交互明顯的時間序列。在這套實驗中我用Pytorch從數(shù)據(jù)預處理、模型搭建到評估可視化完整走了一遍也踩了不少坑。如果你正打算在自己的數(shù)據(jù)上復現(xiàn)建議先把數(shù)據(jù)好好看一眼再按文中的代碼結構一點點搭別急著直接套大模型。先把單步跑通再多步最后再回頭調(diào)超參這樣每一步都能定位到問題。希望這篇記錄能幫你少走點彎路。本文還有配套的精品資源點擊獲取