久久亚洲成a人片熟女精品色一区二区三区|国产精品视频第一精品视频|av天堂热无码手机版|亚洲?v无码久久无遮挡|国产精品偷伦视频免费观看国产|麻豆国产自产精品丰满熟妇|av无码av不卡一区二区|久久亚洲精品中文字

ARTICLE DETAIL

資訊詳情

深耕商務(wù)建站與企業(yè)官網(wǎng)運(yùn)營(yíng)的一線實(shí)戰(zhàn)洞察。

Actor-Critic算法精講:從策略梯度、TD誤差到RLHF與PPO實(shí)戰(zhàn)

Actor-Critic算法精講:從策略梯度、TD誤差到RLHF與PPO實(shí)戰(zhàn) 強(qiáng)化學(xué)習(xí)這兩年在業(yè)界和學(xué)術(shù)圈的熱度不用多說(shuō)從游戲博弈到機(jī)器人控制再到 ChatGPT 背后的 RLHFReinforcement Learning from Human Feedback人類反饋強(qiáng)化學(xué)習(xí)幾乎處處都能看到它的影子。而不管算法包裝成什么樣只要深入到大模型對(duì)齊那一層就必然會(huì)碰到一個(gè)繞不開的組合Actor-Critic 算法。網(wǎng)上關(guān)于強(qiáng)化學(xué)習(xí)的資料很多但普遍存在兩個(gè)問(wèn)題要么只講概念不給推導(dǎo)要么直接甩出一堆公式不講直覺(jué)。這篇教程會(huì)把演員-評(píng)論家算法作為主線從策略梯度為什么需要評(píng)論家講起先把 TD 誤差的數(shù)學(xué)含義拆開再一步步推導(dǎo) Actor-Critic 的更新公式最后結(jié)合 RLHF 場(chǎng)景說(shuō)明 PPO 在語(yǔ)言模型對(duì)齊中的落地方式并給出一份可以運(yùn)行的 PyTorch 示例代碼。適合剛接觸強(qiáng)化學(xué)習(xí)、希望看懂 RLHF 內(nèi)部原理或者準(zhǔn)備在實(shí)際項(xiàng)目中使用 Actor-Critic 框架的開發(fā)者閱讀。1. 強(qiáng)化學(xué)習(xí)與 RLHF 的關(guān)系1.1 什么是強(qiáng)化學(xué)習(xí)強(qiáng)化學(xué)習(xí)研究的是一個(gè)智能體Agent在與環(huán)境Environment交互過(guò)程中如何通過(guò)不斷試錯(cuò)來(lái)學(xué)習(xí)最優(yōu)策略Policy的問(wèn)題。每次交互可以拆解為智能體在當(dāng)前狀態(tài) (s) 下根據(jù)策略 (\pi(a|s)) 選擇一個(gè)動(dòng)作 (a)環(huán)境返回一個(gè)即時(shí)獎(jiǎng)勵(lì) (r)并轉(zhuǎn)移到新狀態(tài) (s)。如此循環(huán)智能體的目標(biāo)不再是最大化某一步的獎(jiǎng)勵(lì)而是最大化長(zhǎng)期累積獎(jiǎng)勵(lì)的期望。這個(gè)過(guò)程和人們常說(shuō)的“監(jiān)督學(xué)習(xí)”有本質(zhì)區(qū)別。監(jiān)督學(xué)習(xí)有明確的標(biāo)準(zhǔn)答案模型通過(guò)擬合標(biāo)簽來(lái)學(xué)習(xí)輸入輸出映射而強(qiáng)化學(xué)習(xí)沒(méi)有標(biāo)準(zhǔn)答案只有獎(jiǎng)勵(lì)信號(hào)。獎(jiǎng)勵(lì)信號(hào)往往稀疏、延遲、存在噪聲這就導(dǎo)致算法必須解決“信用分配”問(wèn)題到底哪一步動(dòng)作導(dǎo)致了最終的高回報(bào)傳統(tǒng)表格型方法在狀態(tài)空間較小時(shí)可以工作一旦狀態(tài)空間連續(xù)或維度很高就必須借助函數(shù)近似例如神經(jīng)網(wǎng)絡(luò)。深度強(qiáng)化學(xué)習(xí)Deep Reinforcement Learning就是“強(qiáng)化學(xué)習(xí) 深度神經(jīng)網(wǎng)絡(luò)”用深度網(wǎng)絡(luò)來(lái)表示策略、價(jià)值函數(shù)或模型。1.2 從強(qiáng)化學(xué)習(xí)到 RLHFRLHF 嚴(yán)格來(lái)說(shuō)并不是一種全新的強(qiáng)化學(xué)習(xí)算法而是一種“訓(xùn)練范式”。它解決的是“如何讓模型行為符合人類偏好”的問(wèn)題。以大語(yǔ)言模型為例普通的監(jiān)督微調(diào)只能讓模型學(xué)會(huì)模仿人類給出的答案但無(wú)法真正理解“什么回答更好”。于是研究者設(shè)計(jì)了一條流程先訓(xùn)練一個(gè)獎(jiǎng)勵(lì)模型Reward Model讓它學(xué)會(huì)對(duì)人類偏好打分。再用強(qiáng)化學(xué)習(xí)算法去優(yōu)化語(yǔ)言模型讓模型生成的回答獲得更高的獎(jiǎng)勵(lì)分?jǐn)?shù)。在這個(gè)流程中語(yǔ)言模型本身就是強(qiáng)化學(xué)習(xí)里的 Actor它負(fù)責(zé)生成文本獎(jiǎng)勵(lì)模型輸出的分?jǐn)?shù)就是獎(jiǎng)勵(lì)信號(hào)。為了讓訓(xùn)練穩(wěn)定通常還會(huì)引入一個(gè)評(píng)論家網(wǎng)絡(luò)Critic來(lái)估計(jì)狀態(tài)價(jià)值或動(dòng)作價(jià)值。因此 RLHF 在實(shí)現(xiàn)層面大量使用 Actor-Critic 框架尤其是 PPOProximal Policy Optimization算法。這也是本文把“Actor-Critic”和“RLHF”放在一起講的原因。1.3 容易混淆的概念實(shí)際閱讀資料時(shí)有幾組概念經(jīng)常被混用先在這里做一次區(qū)分概念含義常見誤區(qū)Actor策略網(wǎng)絡(luò)輸入狀態(tài)輸出動(dòng)作分布被誤認(rèn)為只是“生成動(dòng)作的模型”Critic價(jià)值網(wǎng)絡(luò)輸入狀態(tài)輸出價(jià)值估計(jì)被誤認(rèn)為必須和 Actor 共享結(jié)構(gòu)TD 誤差時(shí)序差分誤差用于衡量真實(shí)獎(jiǎng)勵(lì)與估計(jì)之間的偏差被誤認(rèn)為是“優(yōu)勢(shì)函數(shù)”本身優(yōu)勢(shì)函數(shù)某個(gè)動(dòng)作相對(duì)平均水平的優(yōu)勢(shì)A(s,a)Q(s,a)-V(s)被誤認(rèn)為只能用 TD 誤差估計(jì)RLHF用人類反饋訓(xùn)練獎(jiǎng)勵(lì)模型再用強(qiáng)化學(xué)習(xí)優(yōu)化策略被誤認(rèn)為是一種具體算法理解這些概念后再看 Actor-Critic 推導(dǎo)會(huì)順暢很多。2. 策略梯度與 Actor-Critic 的動(dòng)機(jī)2.1 策略梯度為什么直接用獎(jiǎng)勵(lì)會(huì)不穩(wěn)定在策略梯度方法中我們希望最大化期望累積獎(jiǎng)勵(lì)[ J(\theta) \mathbb{E}{\tau \sim \pi\theta} [R(\tau)] ]其中 (\tau (s_0, a_0, r_0, s_1, a_1, r_1, \dots)) 是一條軌跡(R(\tau) \sum_{t0}^{T} \gamma^t r_t)。對(duì)參數(shù) (\theta) 求梯度可以得到著名的策略梯度定理[ \nabla_\theta J(\theta) \mathbb{E}{\tau \sim \pi\theta} \left[ \sum_{t0}^{T} \nabla_\theta \log \pi_\theta(a_t|s_t) \cdot R_t \right] ]這里的 (R_t \sum_{kt}^{T} \gamma^{k-t} r_k) 是軌跡從時(shí)刻 (t) 起的累積折扣回報(bào)。這個(gè)公式看起來(lái)很簡(jiǎn)單但直接使用存在一個(gè)問(wèn)題方差極大。因?yàn)椴煌壽E之間的回報(bào)差異可能非常大同一個(gè)動(dòng)作在高回報(bào)軌跡和低回報(bào)軌跡中都可能出現(xiàn)算法難以判斷動(dòng)作本身是好是壞。為了降低方差通常會(huì)給獎(jiǎng)勵(lì)減去一個(gè)基線Baseline改成[ \nabla_\theta J(\theta) \mathbb{E} \left[ \sum_t \nabla_\theta \log \pi_\theta(a_t|s_t) \cdot \left( R_t - b(s_t) \right) \right] ]基線 (b(s_t)) 只要不依賴于動(dòng)作 (a_t)就不會(huì)改變梯度的期望但能顯著降低方差。一個(gè)自然的選擇是狀態(tài)價(jià)值函數(shù) (V^\pi(s_t))。于是策略梯度中的“回報(bào)減去基線”就變成了“動(dòng)作價(jià)值減去狀態(tài)價(jià)值”也就是優(yōu)勢(shì)函數(shù) (A^\pi(s_t, a_t) Q^\pi(s_t, a_t) - V^\pi(s_t))。這正是 Actor-Critic 的思想起點(diǎn)。2.2 從 REINFORCE 到 Actor-CriticREINFORCE 是典型的蒙特卡洛策略梯度算法它必須等到一條軌跡結(jié)束后才能計(jì)算累積回報(bào)。這種做法的優(yōu)點(diǎn)是估計(jì)無(wú)偏缺點(diǎn)是方差大、學(xué)習(xí)效率低。如果能在每個(gè)時(shí)間步都獲取一個(gè)“即時(shí)反饋”就可以更快更新。于是評(píng)論家出現(xiàn)了。評(píng)論家網(wǎng)絡(luò)負(fù)責(zé)估計(jì)價(jià)值函數(shù)例如 (V(s)) 或 (Q(s,a))。Actor 網(wǎng)絡(luò)負(fù)責(zé)生成策略。訓(xùn)練時(shí)Actor 根據(jù)評(píng)論家提供的優(yōu)勢(shì)估計(jì)更新策略評(píng)論家則根據(jù)實(shí)際觀察到的獎(jiǎng)勵(lì)和下一狀態(tài)的價(jià)值來(lái)更新自己。兩者交替訓(xùn)練這就是 Actor-Critic 框架。從 REINFORCE 到 Actor-Critic核心變化是把“采樣完整軌跡再計(jì)算回報(bào)”改成“用價(jià)值函數(shù)估計(jì)作為回報(bào)近似”。這種做法引入了偏差因?yàn)閮r(jià)值函數(shù)本身估計(jì)不準(zhǔn)但換來(lái)的是方差大幅下降。在深度強(qiáng)化學(xué)習(xí)實(shí)踐中方差問(wèn)題往往比偏差問(wèn)題更致命因此 Actor-Critic 方法成為主流。2.3 為什么需要 CriticCritic 網(wǎng)絡(luò)承擔(dān)了“評(píng)估當(dāng)前策略好壞”的任務(wù)。如果沒(méi)有 CriticActor 就只能依賴真實(shí)獎(jiǎng)勵(lì)信號(hào)而真實(shí)獎(jiǎng)勵(lì)通常是稀疏的。例如機(jī)械臂抓取任務(wù)只有抓到物體才給 1 獎(jiǎng)勵(lì)其他時(shí)候都是 0這種稀疏獎(jiǎng)勵(lì)讓策略梯度很難學(xué)習(xí)。Critic 可以通過(guò)學(xué)習(xí)狀態(tài)價(jià)值為每一步提供一個(gè)稠密的“預(yù)期收益”信號(hào)即使當(dāng)前沒(méi)有真實(shí)獎(jiǎng)勵(lì)也能通過(guò) (r \gamma V(s) - V(s)) 給出一個(gè)更新信號(hào)。這就是時(shí)序差分Temporal DifferenceTD學(xué)習(xí)的價(jià)值。3. TD 誤差概念與公式推導(dǎo)3.1 TD 誤差的定義時(shí)序差分學(xué)習(xí)是強(qiáng)化學(xué)習(xí)中的核心思想之一。它結(jié)合了蒙特卡洛采樣和動(dòng)態(tài)規(guī)劃的思想用一步真實(shí)獎(jiǎng)勵(lì)加上下一狀態(tài)的價(jià)值估計(jì)來(lái)更新當(dāng)前狀態(tài)的價(jià)值估計(jì)。TD 誤差定義為[ \delta_t r_t \gamma V(s_{t1}) - V(s_t) ]其中(r_t) 是時(shí)刻 (t) 執(zhí)行動(dòng)作后獲得的即時(shí)獎(jiǎng)勵(lì)(\gamma) 是折扣因子取值范圍通常為 ([0, 1])(V(s_t)) 是當(dāng)前狀態(tài)價(jià)值的估計(jì)值(V(s_{t1})) 是下一狀態(tài)價(jià)值的估計(jì)值。如果 (V) 是真實(shí)價(jià)值函數(shù)那么根據(jù)貝爾曼方程(r_t \gamma V(s_{t1})) 的期望應(yīng)該等于 (V(s_t))因此 TD 誤差的期望為 0。如果估計(jì)有偏差TD 誤差就反映了這種偏差。在 Actor-Critic 中TD 誤差不僅是評(píng)論家的更新目標(biāo)也可以作為動(dòng)作優(yōu)勢(shì)的近似估計(jì)。3.2 TD 誤差與優(yōu)勢(shì)函數(shù)的關(guān)系優(yōu)勢(shì)函數(shù)定義為[ A^\pi(s_t, a_t) Q^\pi(s_t, a_t) - V^\pi(s_t) ]而動(dòng)作價(jià)值 (Q^\pi(s_t, a_t)) 滿足[ Q^\pi(s_t, a_t) r_t \gamma V^\pi(s_{t1}) ]將上式代入優(yōu)勢(shì)函數(shù)[ A^\pi(s_t, a_t) r_t \gamma V^\pi(s_{t1}) - V^\pi(s_t) \delta_t ]因此 TD 誤差可以被看作優(yōu)勢(shì)函數(shù)的一種單步采樣估計(jì)。當(dāng)然實(shí)際使用中由于價(jià)值函數(shù) (V) 是近似估計(jì)TD 誤差存在偏差但它在每一步都能計(jì)算非常適合在線學(xué)習(xí)。3.3 多步 TD 與 GAE單步 TD 雖然方差低但偏差可能較大尤其是在獎(jiǎng)勵(lì)延遲明顯的任務(wù)中。為了平衡偏差和方差可以使用多步回報(bào)[ A^{(n)}t \sum{k0}^{n-1} \gamma^k r_{tk} \gamma^n V(s_{tn}) - V(s_t) ]更進(jìn)一步GAEGeneralized Advantage Estimation廣義優(yōu)勢(shì)估計(jì)通過(guò)對(duì)不同步數(shù)的 TD 誤差做指數(shù)加權(quán)平均得到更靈活的優(yōu)勢(shì)估計(jì)[ A^{GAE}t \sum{l0}^{\infty} (\gamma \lambda)^l \delta_{tl} ]其中 (\lambda \in [0,1]) 控制偏差和方差的權(quán)衡。(\lambda 0) 時(shí)退化為單步 TD(\lambda 1) 時(shí)接近蒙特卡洛估計(jì)。PPO 等現(xiàn)代算法普遍使用 GAE就是因?yàn)樗谙∈瑾?jiǎng)勵(lì)場(chǎng)景下表現(xiàn)更好。關(guān)于 GAE 的推導(dǎo)本質(zhì)上是把多步優(yōu)勢(shì)估計(jì)按照 (\lambda) 做指數(shù)平滑這里不再展開矩陣形式但理解這個(gè)加權(quán)思路對(duì)調(diào)參很有幫助。4. Actor-Critic 算法數(shù)學(xué)推導(dǎo)4.1 目標(biāo)函數(shù)與梯度Actor 的目標(biāo)是最大化期望累積獎(jiǎng)勵(lì)但為了引入基線我們寫成[ \nabla_\theta J(\theta) \mathbb{E}{\pi\theta} \left[ \sum_t \nabla_\theta \log \pi_\theta(a_t|s_t) A(s_t, a_t) \right] ]其中 (A(s_t, a_t)) 代替了原來(lái)的回報(bào) (R_t)。這就是帶基線策略梯度的一般形式。在實(shí)際實(shí)現(xiàn)中期望用采樣近似因此 Actor 的損失函數(shù)一般取負(fù)的代理目標(biāo)[ L_{actor} -\frac{1}{N} \sum_{i1}^{N} \log \pi_\theta(a_i|s_i) \cdot A_i ]如果使用 TD 誤差作為優(yōu)勢(shì)估計(jì)則 (A_i) 用 (\delta_i r_i \gamma V_{\phi}(s_{i1}) - V_{\phi}(s_i)) 代替。但單步 TD 偏差較大所以實(shí)際項(xiàng)目中更常用 GAE 或使用評(píng)論家輸出 (V(s)) 計(jì)算多步優(yōu)勢(shì)。4.2 評(píng)論家的目標(biāo)函數(shù)評(píng)論家的目標(biāo)是讓價(jià)值函數(shù)估計(jì)更準(zhǔn)通常使用均方誤差MSE損失[ L_{critic} \frac{1}{N} \sum_{i1}^{N} \left( V_\phi(s_i) - \hat{R}_i \right)^2 ]其中 (\hat{R}_i) 是目標(biāo)回報(bào)例如[ \hat{R}i r_i \gamma V{\phi_{target}}(s_{i1}) ]需要注意評(píng)論家網(wǎng)絡(luò) (V_\phi) 如果和目標(biāo)回報(bào)使用同一組參數(shù)會(huì)造成自舉偏差的累積。因此很多實(shí)現(xiàn)會(huì)使用一個(gè)目標(biāo)網(wǎng)絡(luò)Target Network或延遲更新機(jī)制。在 PPO 中由于策略更新幅度被限制評(píng)論家網(wǎng)絡(luò)通常直接和 Actor 共享部分底層特征或完全獨(dú)立具體取決于狀態(tài)空間和動(dòng)作空間的復(fù)雜度。4.3 Actor-Critic 更新算法流程一個(gè)標(biāo)準(zhǔn)的 Actor-Critic 循環(huán)可以寫成下面的偽代碼初始化 Actor 網(wǎng)絡(luò) π_θ 和 Critic 網(wǎng)絡(luò) V_φ for 每個(gè)回合: 初始化狀態(tài) s for 每個(gè)時(shí)間步 t: 根據(jù) π_θ(·|s) 采樣動(dòng)作 a 執(zhí)行動(dòng)作 a觀察獎(jiǎng)勵(lì) r 和下一狀態(tài) s 計(jì)算 TD 誤差: δ r γ V_φ(s) - V_φ(s) 存儲(chǔ) (s, a, r, s, δ) 更新 Critic: φ ← φ - α_c * ?_φ (δ)^2 更新 Actor: θ ← θ α_a * ?_θ log π_θ(a|s) * δ s ← s實(shí)際深度強(qiáng)化學(xué)習(xí)中通常不是單步更新而是先收集一批數(shù)據(jù)再用小批量梯度更新類似于經(jīng)驗(yàn)回放。為什么需要批量因?yàn)閱蝹€(gè)樣本的 TD 誤差噪聲太大直接在線更新會(huì)讓網(wǎng)絡(luò)參數(shù)震蕩。4.4 從 Actor-Critic 到 PPOActor-Critic 框架雖然有效但直接使用策略梯度更新 Actor 時(shí)如果學(xué)習(xí)率設(shè)置不當(dāng)一次更新過(guò)大策略會(huì)發(fā)生突變導(dǎo)致訓(xùn)練崩潰。PPO 的解決方案是裁剪代理目標(biāo)[ L^{CLIP}(\theta) \mathbb{E} \left[ \min\left( r_t(\theta) A_t, ; \text{clip}(r_t(\theta), 1-\epsilon, 1\epsilon) A_t \right) \right] ]其中 (r_t(\theta) \frac{\pi_\theta(a_t|s_t)}{\pi_{\theta_{old}}(a_t|s_t)}) 是新舊策略的比率。通過(guò)裁剪PPO 限制每次更新的幅度從而保持訓(xùn)練穩(wěn)定。PPO 仍然使用 Actor-Critic 結(jié)構(gòu)Critic 估計(jì)狀態(tài)價(jià)值A(chǔ)ctor 輸出策略分布。這也是 RLHF 中最常用的強(qiáng)化學(xué)習(xí)算法。5. RLHF 中的 Actor-Critic 應(yīng)用5.1 RLHF 訓(xùn)練流程拆解RLHF 的完整流程可以分成三個(gè)階段監(jiān)督微調(diào)SFT先讓語(yǔ)言模型具備基礎(chǔ)對(duì)話能力。獎(jiǎng)勵(lì)模型訓(xùn)練收集人類對(duì)多個(gè)回答的排序或打分訓(xùn)練一個(gè)獎(jiǎng)勵(lì)模型用來(lái)代替人類的實(shí)時(shí)反饋。強(qiáng)化學(xué)習(xí)優(yōu)化用 PPO 等算法以獎(jiǎng)勵(lì)模型給出的分?jǐn)?shù)作為獎(jiǎng)勵(lì)信號(hào)更新語(yǔ)言模型策略。在第三個(gè)階段Actor 就是語(yǔ)言模型本身它的輸入是提示Prompt輸出是生成的整段文本。Critic 則是一個(gè)價(jià)值網(wǎng)絡(luò)輸入狀態(tài)通常是提示 已生成文本的某種嵌入到當(dāng)前步為止的上下文輸出一個(gè)標(biāo)量?jī)r(jià)值。因?yàn)樯呻A段被建模為馬爾可夫決策過(guò)程每一步生成一個(gè) token 相當(dāng)于一個(gè)動(dòng)作。5.2 為什么 RLHF 要用 PPO 而不是直接策略梯度直接使用原始策略梯度在語(yǔ)言模型場(chǎng)景下有幾個(gè)問(wèn)題語(yǔ)言模型參數(shù)規(guī)模龐大一次采樣一條完整回答成本很高逐 token 的獎(jiǎng)勵(lì)非常稀疏只有整個(gè)回答生成完畢才能得到獎(jiǎng)勵(lì)模型的分?jǐn)?shù)如果單步更新太大模型會(huì)產(chǎn)生語(yǔ)法崩壞、重復(fù)冗余的輸出。PPO 通過(guò)重要性采樣和裁剪解決了更新幅度問(wèn)題同時(shí)利用 Critic 對(duì)每個(gè) token 的狀態(tài)價(jià)值進(jìn)行估計(jì)能夠把“整段獎(jiǎng)勵(lì)”逐 token 分解成優(yōu)勢(shì)信號(hào)從而更新每一步的 token 生成策略。此外PPO 還加入 KL 散度懲罰項(xiàng)防止模型為了獎(jiǎng)勵(lì)模型的高分而偏離原始 SFT 模型太遠(yuǎn)。KL 懲罰的實(shí)際作用可以理解為“不要為了分?jǐn)?shù)犧牲可讀性”。5.3 PPO 在語(yǔ)言模型中的損失函數(shù)完整 PPO 損失通常包含三個(gè)部分Actor 的裁剪策略目標(biāo)Critic 的價(jià)值函數(shù)損失熵正則Entropy Bonus和 KL 懲罰項(xiàng)??梢詫懗蒣 L^{PPO} - L^{CLIP}(\theta) c_1 L^{VF}(\phi) - c_2 \mathcal{H}[\pi_\theta] \beta \cdot \text{KL} ]其中 (L^{VF}) 是評(píng)論家價(jià)值損失(\mathcal{H}) 是策略熵KL 項(xiàng)衡量當(dāng)前策略與參考策略一般是 SFT 模型的分布距離。實(shí)際工程中各項(xiàng)系數(shù) (c_1, c_2, \beta) 都需要針對(duì)具體任務(wù)調(diào)整。一個(gè)常見問(wèn)題是KL 懲罰加在獎(jiǎng)勵(lì)上還是加在損失函數(shù)上兩種方式都存在。把 KL 懲罰加到實(shí)時(shí)獎(jiǎng)勵(lì)上更直觀PPO 采樣時(shí)每個(gè) token 獎(jiǎng)勵(lì)可以設(shè)置為[ r_t^{total} r_t^{reward_model}(samples) \cdot \mathbb{I}(t T) \beta \cdot \log \frac{\pi_{\theta}(a_t|s_t)}{\pi_{ref}(a_t|s_t)} ]這里只有最后一個(gè) token 收到獎(jiǎng)勵(lì)模型的標(biāo)量獎(jiǎng)勵(lì)其余 token 只收到 KL 懲罰信號(hào)。但實(shí)際實(shí)現(xiàn)中強(qiáng)化學(xué)習(xí)訓(xùn)練時(shí)整個(gè)序列的每個(gè) token 位置都會(huì)計(jì)算 Critic 的價(jià)值因此需要把序列級(jí)別的獎(jiǎng)勵(lì)映射到每一個(gè) token 位置。這也是 RLHF 訓(xùn)練代碼中最容易踩坑的地方。5.4 一個(gè)簡(jiǎn)化的 RLHF 訓(xùn)練偽代碼# 偽代碼僅用于理解流程不直接可運(yùn)行 for prompt in dataset: # 1. Actor 生成回答 response actor.generate(prompt) # 2. 計(jì)算每個(gè) token 的 logprob 和 KL log_probs actor.get_logprobs(prompt, response) ref_log_probs ref_model.get_logprobs(prompt, response) kl log_probs - ref_log_probs # 3. 獎(jiǎng)勵(lì)模型打分整段分?jǐn)?shù) reward_score reward_model(prompt, response) # 4. 將整段獎(jiǎng)勵(lì)分配到每個(gè) token常見做法最后一個(gè) token 得到獎(jiǎng)勵(lì) token_rewards torch.zeros_like(log_probs) token_rewards[-1] reward_score - beta * kl.mean() token_rewards[:-1] - beta * kl[:-1] # 5. 用 GAE 計(jì)算優(yōu)勢(shì) advantages gae(values, token_rewards, masks) # 6. 更新 Actor 和 Critic actor_loss clip_actor_loss(log_probs, old_log_probs, advantages) critic_loss mse_loss(values, returns) loss actor_loss critic_weight * critic_loss - entropy_weight * entropy loss.backward() optimizer.step()注意真實(shí) RLHF 代碼會(huì)比這段復(fù)雜得多包括共享內(nèi)存采樣、微批量更新、動(dòng)態(tài) KL 系數(shù)、長(zhǎng)度歸一化獎(jiǎng)勵(lì)等。理解流程后再去看開源實(shí)現(xiàn)會(huì)輕松很多。6. 最小可運(yùn)行示例PyTorch 實(shí)現(xiàn) Actor-Critic接下來(lái)給出一份可以直接運(yùn)行的 Actor-Critic 示例代碼環(huán)境使用 OpenAI Gym 的 CartPole-v1。這個(gè)任務(wù)相對(duì)簡(jiǎn)單不需要 GPU適合驗(yàn)證算法流程。代碼核心思路是用一個(gè)共享兩層全連接網(wǎng)絡(luò)分別輸出策略分布參數(shù)和價(jià)值標(biāo)量通過(guò) TD 誤差更新。6.1 環(huán)境準(zhǔn)備本示例建議使用以下環(huán)境Python 3.8 及以上PyTorch 1.13 或 2.xgymnasium 0.28 或以上注意新版已從 gym 改名為 gymnasium安裝命令pip install torch gymnasium如果你的環(huán)境已經(jīng)安裝了老版本gym也可以跳過(guò)安裝但需要將代碼導(dǎo)入部分改為import gym。版本差異不影響算法邏輯。6.2 完整代碼# 文件路徑actor_critic_cartpole.py import torch import torch.nn as nn import torch.optim as optim import gymnasium as gym import math class ActorCritic(nn.Module): 共享底層特征的 Actor-Critic 網(wǎng)絡(luò)。 Actor 輸出動(dòng)作概率的 logitsCritic 輸出狀態(tài)價(jià)值 V(s)。 def __init__(self, state_dim, action_dim, hidden_dim128): super(ActorCritic, self).__init__() self.fc1 nn.Linear(state_dim, hidden_dim) self.fc2 nn.Linear(hidden_dim, hidden_dim) self.actor_head nn.Linear(hidden_dim, action_dim) self.critic_head nn.Linear(hidden_dim, 1) def forward(self, state): x torch.relu(self.fc1(state)) x torch.relu(self.fc2(x)) policy_logits self.actor_head(x) value self.critic_head(x) return policy_logits, value def get_action(self, state): policy_logits, value self.forward(state) dist torch.distributions.Categorical(logitspolicy_logits) action dist.sample() log_prob dist.log_prob(action) return action.item(), log_prob, value def train(env, agent, optimizer, gamma0.99, max_steps1000): 單回合訓(xùn)練采集軌跡計(jì)算 TD 誤差并更新網(wǎng)絡(luò)。 log_probs [] rewards [] values [] dones [] state, _ env.reset() state torch.tensor(state, dtypetorch.float32) total_reward 0 for step in range(max_steps): action, log_prob, value agent.get_action(state) next_state, reward, terminated, truncated, _ env.step(action) done terminated or truncated log_probs.append(log_prob) values.append(value) rewards.append(reward) dones.append(done) state torch.tensor(next_state, dtypetorch.float32) total_reward reward if done: break # 計(jì)算 TD 誤差和 Actor/Critic 損失 returns [] G 0.0 for i in reversed(range(len(rewards))): G rewards[i] gamma * G * (1 - dones[i]) returns.insert(0, G) returns torch.tensor(returns, dtypetorch.float32) values_tensor torch.cat(values).squeeze() log_probs_tensor torch.stack(log_probs) # Critic 損失價(jià)值估計(jì)與累計(jì)回報(bào)之間的 MSE critic_loss nn.functional.mse_loss(values_tensor, returns) # Actor 損失策略梯度的負(fù)對(duì)數(shù)似然 * 優(yōu)勢(shì)用 TD 誤差近似 advantages returns - values_tensor.detach() actor_loss -(log_probs_tensor * advantages).mean() loss actor_loss critic_loss optimizer.zero_grad() loss.backward() optimizer.step() return total_reward if __name__ __main__: env gym.make(CartPole-v1) state_dim env.observation_space.shape[0] action_dim env.action_space.n agent ActorCritic(state_dim, action_dim) optimizer optim.Adam(agent.parameters(), lr1e-3) episodes 500 for episode in range(episodes): reward train(env, agent, optimizer) if (episode 1) % 20 0: print(fEpisode {episode 1}, total reward: {reward})6.3 代碼說(shuō)明這段代碼雖然簡(jiǎn)單但完整展示了 Actor-Critic 的核心流程。ActorCritic類中actor_head輸出動(dòng)作分布的 logitscritic_head輸出狀態(tài)價(jià)值。get_action通過(guò) Categorical 分布采樣動(dòng)作返回動(dòng)作、動(dòng)作對(duì)數(shù)概率和當(dāng)前狀態(tài)價(jià)值估計(jì)。訓(xùn)練函數(shù)中先與環(huán)境交互收集一整條軌跡然后在軌跡結(jié)束時(shí)計(jì)算累積回報(bào)G并把累積回報(bào)作為 Critic 的回歸目標(biāo)。優(yōu)勢(shì)函數(shù)使用returns - values.detach()這里并沒(méi)有直接用 TD 誤差而是用蒙特卡洛回報(bào)近似優(yōu)勢(shì)因?yàn)閱尾?TD 在 CartPole 上也可以運(yùn)行但方差更大。如果你希望觀察 TD 誤差的作用可以把優(yōu)勢(shì)換成rewards gamma * next_value - value注意需要額外計(jì)算下一狀態(tài)價(jià)值。運(yùn)行后如果網(wǎng)絡(luò)正常收斂你會(huì)在 200 到 400 個(gè)回合之間看到回報(bào)穩(wěn)定在 200 左右CartPole 的最大步數(shù)限制通常為 200。如果你的代碼在 100 回合內(nèi)回報(bào)不升反降一般是因?yàn)閷W(xué)習(xí)率過(guò)大或優(yōu)勢(shì)計(jì)算錯(cuò)誤。6.4 擴(kuò)展到 PPO 需要考慮什么上面的示例是單步更新的“原始 Actor-Critic”與 PPO 還有差距。要把它改成 PPO需要額外做幾件事保存每步的old_log_prob使用 GAE 計(jì)算優(yōu)勢(shì)對(duì) Actor 損失進(jìn)行裁剪多輪小批量更新而不是每回合只更新一次增加熵正則項(xiàng)鼓勵(lì)探索。如果這篇文章發(fā)布后大家感興趣我可以再單獨(dú)寫一篇“從零實(shí)現(xiàn) PPO”的教程把這三處改造逐一拆開?,F(xiàn)在先把 Actor-Critic 的基礎(chǔ)打好。7. 常見問(wèn)題與排查思路問(wèn)題現(xiàn)象常見原因解決思路訓(xùn)練一開始回報(bào)就在下降然后陷入震蕩學(xué)習(xí)率過(guò)大Actor 更新步長(zhǎng)過(guò)大調(diào)小學(xué)習(xí)率或使用 PPO 裁剪機(jī)制回報(bào)一直很低但 Critic 損失很小Critic 已經(jīng)收斂但 Actor 策略陷入局部最優(yōu)增大熵正則系數(shù)或增加動(dòng)作探索優(yōu)勢(shì)值波動(dòng)非常大梯度爆炸獎(jiǎng)勵(lì)尺度差異過(guò)大或 GAE 中的 lambda 設(shè)置不當(dāng)對(duì)獎(jiǎng)勵(lì)做歸一化例如除以獎(jiǎng)勵(lì)均值調(diào)整 gamma 和 lambdaRLHF 訓(xùn)練中模型輸出變得重復(fù)、死板KL 懲罰過(guò)小模型過(guò)度優(yōu)化獎(jiǎng)勵(lì)模型增大 KL 懲罰系數(shù)或使用動(dòng)態(tài) KL 系數(shù)語(yǔ)言模型生成退化輸出無(wú)意義符號(hào)PPO 更新時(shí)熵正則系數(shù)為 0策略過(guò)早確定添加熵正則并監(jiān)控 token 級(jí)別的熵多個(gè)進(jìn)程采樣時(shí)動(dòng)作分布不一致隨機(jī)種子未固定或模型權(quán)重不同步對(duì)齊隨機(jī)種子統(tǒng)一初始化權(quán)重Actor 和 Critic 共享網(wǎng)絡(luò)導(dǎo)致兩者梯度沖突兩個(gè)任務(wù)的梯度方向不一致使用雙頭網(wǎng)絡(luò)但底層分離或使用兩個(gè)獨(dú)立網(wǎng)絡(luò)訓(xùn)練不穩(wěn)定損失出現(xiàn) NaN數(shù)值溢出通常是 log 概率為 0 或梯度爆炸給 log_prob 加 epsilon使用梯度裁剪這些坑在學(xué)術(shù)示例和實(shí)際項(xiàng)目中都很常見。特別是 RLHF 場(chǎng)景問(wèn)題往往不是算法本身而是獎(jiǎng)勵(lì)設(shè)計(jì)和 KL 約束沒(méi)有調(diào)好。建議每訓(xùn)練一段時(shí)間就手動(dòng)查看模型生成文本不要只盯著獎(jiǎng)勵(lì)曲線。8. 最佳實(shí)踐與工程建議8.1 優(yōu)勢(shì)函數(shù)與價(jià)值網(wǎng)絡(luò)的設(shè)計(jì)在 Actor-Critic 框架中Critic 的作用是為 Actor 提供低方差的學(xué)習(xí)信號(hào)。因此價(jià)值網(wǎng)絡(luò)的預(yù)測(cè)準(zhǔn)確性直接影響訓(xùn)練效果。建議在同一個(gè) batch 中Critic 可以多更新幾次而 Actor 每次更新幅度不要太大。在 PPO 中Critic 通常使用與 Actor 相同的 batch 數(shù)據(jù)但損失函數(shù)權(quán)重可以獨(dú)立調(diào)節(jié)。如果 Critic 和 Actor 使用共享底層特征需要小心梯度競(jìng)爭(zhēng)。很多成熟實(shí)現(xiàn)例如 Stable-Baselines3默認(rèn)使用兩個(gè)獨(dú)立的 MLP或共享一個(gè) Encoder但分開 Head。8.2 獎(jiǎng)勵(lì)工程設(shè)計(jì)強(qiáng)化學(xué)習(xí)對(duì)獎(jiǎng)勵(lì)尺度極其敏感。RLHF 中獎(jiǎng)勵(lì)模型輸出的分?jǐn)?shù)范圍可能很大直接在多個(gè)任務(wù)上使用會(huì)不穩(wěn)定。一種常見做法是對(duì)獎(jiǎng)勵(lì)做標(biāo)準(zhǔn)化z-score或者除以獎(jiǎng)勵(lì)標(biāo)準(zhǔn)差。但也不要過(guò)度歸一化否則會(huì)損失區(qū)分度。對(duì)于語(yǔ)言模型還有一種有效做法是按回答長(zhǎng)度歸一化獎(jiǎng)勵(lì)避免模型通過(guò)生成超長(zhǎng)文本來(lái)刷分。這是工業(yè)界總結(jié)出的寶貴經(jīng)驗(yàn)在學(xué)術(shù)論文中很容易被忽略。8.3 探索與利用的平衡Actor-Critic 的本質(zhì)是“邊探索邊利用”策略熵正則項(xiàng)是控制探索能力的關(guān)鍵。熵太大會(huì)導(dǎo)致策略過(guò)于隨機(jī)無(wú)法收斂熵太大會(huì)導(dǎo)致過(guò)早收斂到局部最優(yōu)。實(shí)踐中一般將熵系數(shù)設(shè)置為 0.01 到 0.001并在訓(xùn)練后期線性衰減。監(jiān)控每批次策略熵的平均值如果熵突然跌到 0說(shuō)明策略幾乎變成了確定性策略這在許多任務(wù)中是危險(xiǎn)的。8.4 RLHF 工程中的安全與合規(guī)RLHF 的目的是讓模型行為對(duì)齊人類偏好但“人類偏好”本身帶有主觀性必須遵守法律法規(guī)和倫理邊界。在訓(xùn)練獎(jiǎng)勵(lì)模型時(shí)要使用合法合規(guī)的數(shù)據(jù)集避免通過(guò)對(duì)抗樣本或惡意提示來(lái)“攻擊”獎(jiǎng)勵(lì)模型。不要試圖讓模型繞過(guò)安全限制也不要讓模型在敏感領(lǐng)域產(chǎn)生虛假信息。工程上RLHF 訓(xùn)練需要在受控環(huán)境中進(jìn)行設(shè)置人工審核環(huán)節(jié)對(duì)于人工反饋數(shù)據(jù)要做匿名化處理并確保數(shù)據(jù)采集獲得用戶授權(quán)。8.5 代碼可持續(xù)性強(qiáng)化學(xué)習(xí)實(shí)驗(yàn)代碼比普通訓(xùn)練代碼更容易腐化。建議從一開始就把“環(huán)境配置”“采樣循環(huán)”“模型更新”拆成獨(dú)立模塊。采樣環(huán)境使用向量化環(huán)境例如gymnasium.vector可以提升訓(xùn)練吞吐量。模型定義和損失函數(shù)用獨(dú)立函數(shù)封裝方便切換算法。日志系統(tǒng)記錄每個(gè) step 的獎(jiǎng)勵(lì)、價(jià)值損失、策略熵、KL 散度這能在排錯(cuò)時(shí)省下大量時(shí)間。保存模型時(shí)除了權(quán)重還要保存 optimizer 狀態(tài)、隨機(jī)種子和超參數(shù)否則無(wú)法復(fù)現(xiàn)實(shí)驗(yàn)結(jié)果。8.6 性能優(yōu)化CartPole 這類小環(huán)境用單進(jìn)程訓(xùn)練沒(méi)問(wèn)題但真實(shí) RLHF 任務(wù)通常要并行采樣。語(yǔ)言模型生成文本很慢一般使用 vLLM 等推理框架加速采樣Critic 的價(jià)值網(wǎng)絡(luò)可以用單一的 GPU 作為獨(dú)立服務(wù)。數(shù)據(jù)傳輸建議使用共享內(nèi)存隊(duì)列避免序列化開銷。在更新階段Actor 和 Critic 可以輪流更新也可以同時(shí)更新。PPO 通常采用“先收集大量樣本再多次更新”的方式因此采樣進(jìn)程和訓(xùn)練進(jìn)程分離是必要的。如果你需要在多機(jī)環(huán)境訓(xùn)練還涉及參數(shù)同步和通信開銷建議先單機(jī)多卡跑通再擴(kuò)展。9. 總結(jié)與學(xué)習(xí)建議Actor-Critic 算法的價(jià)值在于它為深度強(qiáng)化學(xué)習(xí)和 RLHF 提供了一套穩(wěn)定的訓(xùn)練框架。理解了 Actor 輸出策略、Critic 輸出價(jià)值、TD 誤差充當(dāng)學(xué)習(xí)信號(hào)這三者之間的關(guān)系就相當(dāng)于打通了強(qiáng)化學(xué)習(xí)的主流脈絡(luò)。在此基礎(chǔ)上繼續(xù)學(xué)習(xí) GAE、PPO、TRPO、SAC 會(huì)更快。RLHF 本質(zhì)上是 Actor-Critic 在語(yǔ)言模型對(duì)齊中的應(yīng)用核心難點(diǎn)并不在策略梯度本身而在于獎(jiǎng)勵(lì)模型的質(zhì)量、KL 約束的調(diào)節(jié)以及大規(guī)模分布式訓(xùn)練工程。如果你想繼續(xù)深入建議按以下路線實(shí)踐先手動(dòng)推導(dǎo)一遍策略梯度定理和 TD 誤差公式運(yùn)行本文的 CartPole 示例修改優(yōu)勢(shì)估計(jì)方式觀察方差變化閱讀 Stable-Baselines3 的 PPO 源碼逐行對(duì)照公式用開源 RLHF 框架如 TRL、DeepSpeed-Chat跑一個(gè)小模型查看訓(xùn)練日志和生成效果。強(qiáng)化學(xué)習(xí)是一門“看公式覺(jué)得懂了寫代碼立刻懵”的學(xué)問(wèn)但多寫幾次代碼多調(diào)幾次參數(shù)后直覺(jué)會(huì)逐漸建立起來(lái)。希望這篇教程能成為你理解 Actor-Critic 和 RLHF 的第一塊墊腳石遇到問(wèn)題也歡迎在評(píng)論區(qū)討論。
返回列表
PREV
查看更多資訊
NEXT
返回資訊列表
亚洲永久永久永久永久一级一级一级精品| 亚洲精品 欧美精品| 免费看黄片现成| 蜜桃午夜视频一区二区| 国产欧美精品日韩区二区麻豆天美| 精品一区二区三区18| 国模限制级电影| 久久久久久久久久va| 九区国产| 天天色踪合| 色婷婷视频| 亚洲色图欧美激情| 干美女人妻| h色99999| 久久精9| 婷婷五月天影院| 国产强奸超碰AV| 九月激情婷婷| 小视频国产| 污色区网站| 搡老女人老91二区| 亚洲图片91| 亚洲激情深爱文学小说网站| 999 久久久| 九九九九日本| 久久大陆| 精品美女人人干| 麻豆精品A片免费观看| 日韩乱码Av| 色99视频| 天堂九九九九九九九九九| 婷婷亚洲综合| 亚洲欲色9532548967一区| 国产精品无码AV网站| 超碰久久性爱| 国产成人网| 色五月激情综合网| 99色综合| 欧美五十路熟| 狠狠爱综合网| 97精品综合久久网| 国内毛片欧美香蕉精品| 日韩一级片在线看| 国产免费久久精品99re韩国| 另类图片综合| 91小视频| 精品91摸| 久久久亚洲熟妇资源| www.亚洲成人一区| 午夜福利久久久噜久噜久久综合| 狠狠热这里都是精品| 国产多人在线观看视频| 久久久久女教师免费一区| 国产婷婷综合在线观看| 91狠狠综合久久| 日欧美色| 亚洲欧美另类激情小说| 激情五月综合网| 久久骚| 日韩精品资源专区二区| 大香蕉免费中文| 精品二区三四区五电影 | 久久久久人妻二区精品叶可怜| 香蕉热人人精品| 欧美亚洲日韩人妻在线观看| 精品大全99999| 欧美黑人精品在线播放| 青青草在线视频美女| 欧美操逼录像国产黄色国产| 日本一级性爱| 精品九九九| 国产大陆天天艹| 91欧美大片| 日本 欧美 亚中文字幕| 欧美精品一区二区少妇免费A片| 亚洲综合 欧美| 老熟妇一区二区三区…| 色爱天堂| 欧美精品91| 国产精品久久久久久片| 婷婷六月色| 影视综合无码少妇| 妇女视频网站| 超碰日本97美女人妻人人玩人人爱| 国产男人又猛又粗又爽| 亚洲欧美日韩精品久| 精国久久一区二区三区98| 精品久久久久黄少妇| 婷婷久久久| 密臀国产在线| 大香蕉免费乱伦视频| 91人妻做a观看视频| 久久久久国产亚洲一区欧美色图日韩| 日本色日夜干| 国产久久久9999| 97天天摸天天爽| 蜜桃视频精品一区二区| 97干色| 嗯嗯嗯啊啊啊在线免费观看| 精品无码久久久久久久久果冻糖心| 麻豆国产尤物AV| 亚洲在线综合| 亚洲一区二区麻豆影院| 精品人妻一区二区三区日产乱码| 欧美性猛交美女自慰91| 久久精品午夜国产亚洲AV无码| 夜夜爽妓女| 少妇熟女一区二区三区| 99色视频| 日韩福利电影网| 超碰激情808| 欧美偷拍区| 老女人老91妇女老热女| 国产1024在线播放| 色汉综合| 天天日天天舔东京热| 黄久在线| 大香蕉五月天| 四虎国产精品永久在线囯在线| 国产精品小视频一区二区三区| 国产精品ww久久| 国产13区| 午夜福利免费福利视频| 亚洲日韩美女丝袜美腿人妻视频| 116美女午夜| 欧美在线天堂| 97日视频| 熟女被操视频网址| 99re黄 | 韩三级a视频在线观看| 午夜情侣自拍网站| 大香蕉宅男伊人| 五月婷婷丁香| 国产毛片片精品天天看视频| 欧美 传媒 麻豆 日韩 偷拍| 国产精品盗摄 偷窥盗摄| 黄色人人| 日韩亚洲精品一区二区| 97超级久久强资源| 青青久久手机线视频| 97精品免费| 久久精品久久九九精品| 中文字幕乱码在线观看| 日韩99神马视频片| 91丨九色丨熟女高潮| 欧美一二三级精品在线| 美女天天干| 后入 亚洲 美女 射| 亚洲国产成人福利在线观看| 久久久蜜桃臀无码视频| 超碰到97情色| 久久一区无码| 欧美东京热精品A∨| 欧美日韩传媒| 久久6热精品99视频| 麻豆一区二区AV天美| 中文字幕啊啊啊在线观看视频| 一二三四免费视频| 草草影院最新网址| 欧美高潮| 欧美综合加勒比在线| 蜜臀操逼黄色视频操的好爽| 欧美传媒| 草草草草视频| 国产精品毛片| 国产精品在线网站| 99.色网| 377p欧洲日本亚洲大胆| 久久精品国产精品一区| 91热热色| 91高潮喷水美女| 日韩欧美亚洲国产日韩| 日本99久久| 亚欧成人综合影院| 日韩肏逼视频| 欧美激情视频一区二区| 玖玖爱伊人玖玖爱| 极品久久久久久久久久久久久久| 天无日色综合| 国产成人bd在线观看| 亲子敌伦对白在线播放| 国产精品久久泡妞网站| 超碰社区97| 成人久久精品| 中文字幕一区二区视频在线观看| 日欧操屄视频| 天天天肏屄欧美| 国产精品久久久久久久久久久久久久久久 | 无码一区免费在线不卡| 天天综合站| 中文字幕人妻色偷偷久久皮| 美女人妻色网站| 色婷婷小说| 91小视频| 亚洲第一无码播放立川理惠| 北约熟女超碰| 日本色色色色色视频| 欧美片第一页| 欧美国产精品久久九九| 国产深喉视频一区二区| 亚洲资源一区| 天天拍夜夜| 伊人九九| 人妻丝袜日本| 久草午夜| 国产精品96| 老熟女91视频| 神马久久久久久久久| 香蕉av一区二区三区| 国产二区三区粉嫩在线| 十八禁黄色成人网站观看| 久久一二三级一一一| 麻豆久久久久久久久丝袜 | AAAA级日本片免费视频| av网站免费看| 无码直播久久久| 亚洲麻豆av一区二区| 三久久久四久久久久| 一起草视频在线| 啊啊啊草死我| 欧美日本成人一区二区| 国产亚洲深夜激情| 日韩精品在线观看观看| jizzjizz欧美| 95人妻爽爽人人做人人澡| 人妻熟女一区在| 人妻熟女一区在| 一级免费啪啪片| 欧美精品自慰系列寂寞少妇| 久久婷婷精品| 老女人爆菊| 艾草av| 久久久久久久78| 日本一天色道久久久精品视频| 人妻少妇精品久久久| 夜夜操夜夜高潮夜夜爽国产精品区| 久久久性少妇| 九七毛片九九毛片| 91人人| 日本成人免费一区二区三区| 国产日韩区| 欧美性爱视频免费一区一A| 日本 欧美 国产一区| 色五月婷婷网| 国产亚洲色婷婷99精品91| 天天日天天屌天天操| 日本精品九九九| 婷婷九月丁香| 天天澡天天爽日日AV| 中英熟女操女| 国产精品大屁股999| 亚洲中字幕日本一区二区三区| 传媒免费一区二区三区| 97超级久久| 中文字幕丰满人妻日本| 国产精品黄色三级av| 久久久com| 一区二区三区男女操逼黄色小电影| 69久久久久久久久久久久久| 中国农村熟妇毛片视频| 欧美综合网A| 两女互慰AV高潮喷水在线观看| 在线综合 亚洲 欧美中文字幕| 久久极品一区二区| AV丝袜东京热| 日韩一级特黄av毛片| 超碰99在线观看| 男人的天堂一区三区| 五月天色图影视| 欧美色图欧美| 天美精品av| 成人性爱高清视频免费看| 免费a级毛片av无码久久精品中文字幕| 91精品少妇搡搡搡| 日韩精品中文字幕人妻| 超碰免费在线| 国产免费一区| 无遮挡一级毛片视频免费的| 天美传媒av 在线| 羞答答AV中文字| 亚洲国产成人精品久久久国产成人一区二区| 欧美国产伊人久久久久| 少妇诱惑视频| 日韩有码专区| 久久久久久AⅤ无码免费肉站| 色呦呦、国产精品| 天天日夜干| 91精品国产高清久久久久久,亚洲成人 | 国产精品宅男免费| 九九九久久久久| 9Ⅰ超碰| 91精品啪在线观看国产城中村| 久久夜色一区二区| 亚洲精品九九九| 婷婷伊人网| 校园春色亚洲无码| 无码精品久久久天天影视| 综合网,亚洲,欧美| 老鸭窝成人免费毛片视频| 国产 亚洲 丝袜 制服| 欧美超碰96| 免费国产视频| 好吊色在线观看| 日本三级精品| 国产又爽又黄| 蜜桃久久一区| 色小视频蜜乳| 女人天堂网| AA特级绝黄| 日韩精品第3页| 综合亚洲欧美精品日韩?v| 亚洲麻豆精品二区三区| 日本男人天堂| 98色网| 999国产精品999久久久久久| 色小视频蜜乳| 91女色| 91色久| 999热日韩精品| 国产在线视视频有精品| 精品无人区麻豆乱码1区2区图片| 国产一区二区在线电影| 亚洲九九视频| 天天综合站| 黄色AAAAAAAAAAA大片| 青青草色插素人| 国产亚洲欧美每日在线| 国产欧美成人精品| 8050午夜少妇无码| 日韩射图| 日韩草久视频| 欧美高清无码免费视频高清版| 蜜臀AV一区二区三区激情综合| 国产精品午夜AV完会免费 | 亚洲精品97中文字幕| 日韩卡一卡二卡三在线| 午夜九九| 丁香激情五月| 欧美组图日韩亚洲中文字幕| 熟妇熟女一区二三区| 另类图片欧美激情综合| 久久中日麻豆| 亚洲AV无码国产成人| 精品人妻久久久久一区二区三区| 天天摸,夜夜摸| 免费试看60秒| 熟女中出视频| 国产精品一区二区三区,亚洲综合| 中文字幕在线高清男人的天堂| 五月丁香综合| 日本人妻最新在线中| 日韩超碰精品综合| 亚洲黄色a级片| 蜜臀Av一区二区三区| 六月激情网| 欧美色999| 亚洲精品天天影视综合网 | 天天日天天干天天操| 色综合潮| a天堂视频| 欧美性爱一区二区三区| 97香蕉人人乳| 国产品精品自在在线午夜免费| 久久久久久久亚洲Av无码| AV在线播放网址| 在线另类| 日本黄色大片一级视频免费麻豆| 亚洲交换| 艾草av| 嫩草影院性色| 猛猛干| 96免费视频在线| 黄色高清无码无码破解免费暗网| 亚洲欧美人妻| 九九九热精品| 91在线色综合| 爽 好舒服 无码刺激久久| 综合欧美亚洲| 综合91网| 99色悠悠| www网站黄| 日本成a人v网站在线观看| 97操在线| 区日韩亚洲乱码av电影| 人妻日日干| 偷拍亚洲| 亚洲欧美激情小说| 日韩在线97| 超碰av在线| A一区片| 亚洲另类色综合网站| 欧洲中文字幕| 一区二区娱乐网站| 涩涩涩综合| 亚洲人妻五月丁香婷婷| 吊色| 啊啊好多水| 99热9| 天天摸夜夜添无码小视频| 狠狠爱大香蕉| 暴力av在线| 青青草字幕AV| 伊人大香蕉在线| 国产欧美亚洲精品a第2页| 99亚洲国产精品色一区二区三区| 好爽视频在线观看| 亚洲精品熟妇1区2区3区。| 日日橹狠狠爱欧美超碰| 国产精品一区人妻精品阁在线| 国产白嫩精品久久| 五月婷婷激情综合| 91丝袜在线观看| 亚洲国男人的天堂| 日本性爱少妇| 亚洲第一狼人丝袜美女另类| 中文?日韩?免费?精品| 校园春色美腿丝袜 | 99热精品在线| 熟女色综合久久| 极品综合| av在线人气| 久久婷婷色| 日韩欧美俄罗斯A片| 黑人美精品 A片| 中文字幕日韩专区精品系列 | 五月天婷婷影院| 人人干人人搞人人摸| 久久久久久日韩| 青青免费在线视频一区 | 亚洲91射| 无卡一区=区| 亚州色图欧美| 日本A级视频| 夜夜狼人妻| 神马视频久久久久久| 嗯啊不要在线| 伊人久久88国产女| a久久| 天天做天天爽| 婷婷五月成人| 天天色综合图片| 婷婷五月色| 婷婷五月天av| 婷婷五月天AV| 五月婷婷激情综合| 亚州情色j区| 志村玲子视频一区二区| 精品熟女呻吟久久91| 九九九九热只有精品| 久久97| 免费av在线播放二区| 手机在线观看不卡无码av| 韩国手机不卡无码三级视频| 久久这里只| Aa东京男人的天堂| 日韩/97| 欧洲色综合| 欧美色色色| 亚洲 自拍偷拍 欧美| 中文字幕国产| 婷色五月天| 自拍盗摄一区| 无码人妻一区二区一牛影视| 欧美精品1区2区3区| av天堂手机版追回 | 多乙久久久久久| 亚洲美女自拍偷拍视频| 综合自拍| 五月丁香影院| 久久国色天香香蕉| 欧美色天堂网在线视频| 后入式五六区| 男女啊啊啊啊啊| 丁香九月婷婷| 啪啪啪东京| 亚洲系列第一页| 少妇滛荡视频| 亚洲日本韩国极品一区二区| 偷拍超碰| 天天综合网亚洲综合网| 国产成人精品网站| 亚洲日韩av专区无码| 国产隔壁老王影院在线| 欧美性爱一级操| 五月色丁香| 亚洲精品色| 香蕉免费一区二区三区不读| 后入精品| 一级毛片电影免费看| 在线A日本| 欧美在线干| 91在线免费观看处女| 欧美性生活内射| 91无码人妻精品一区二区三区蜜桃 | 日韩人妻无码精品系列| 亚洲在线观看| 秋霞一级鲁丝片A片| 中日韩熟女| 正在播放:深夜激情大战,自带黑丝袜全力输出骚穴 | 天美传媒国产原创中文字幕亚洲欧美另类 | 青青草久草AV| 97av在线观看| 亚洲国产成人精品久久久国产成人一区二区三. | 欧美同性恋 的搜索结果 - 91n| 神马久久久久久| 天天干人人干天天日97| 亚洲天堂电影精品一区| 欧美97日韩精品| 久久在肏| 国内毛片婷婷六月色| 可以看的av| 麻豆一区二区三区精品| 欧美综合91| 奇米狠999| 少妇无码太爽| 青青草AV色| 国产多人在线观看视频| 97在线精品| 亚洲国产精品久久久男人的天堂| 日韩综合色图| 日韩精品中文字幕二区| 五月天色电影| 欧美精品97| 国产精品久久久久久久黄无码 | 土豪酒店各种姿势玩弄极品幼稚| www.人人摸在线视频| 大香蕉乱伦视频网| 欧美一级国产一级| 国产日本顶级一区二区三区| 九9精品| 黑人娇小av在线播放| 91动漫操逼视频| 日韩二级| 麻豆精品.欧美精品.日韩精品.| 高清一区AV无码| 日韩无码嘿咻黑热久| 色婷婷日韩精品一区二区三区| 国产精品分类在线观看| 日韩中文字幕二区| 综合网欧美在线| 中文字幕精品三级久久久| 色色九区| 日本性爱视频一级| 欧美日韩高潮喷水91| 人妻精品视频一区二区| 少妇天堂网络| 九七超碰人人乐| 无码精品一区二区三区潘金莲| 亚洲综合在线高清| 亚洲图片另类| 日韩人妻少妇 一区二区三区| 青操影院| 国产性爱乱伦AV| 抽插爽| 欧美高清18A片| 久久这里都是精品| 97色综合中文网| 大香蕉五月天| 亚洲AV永久无码精品成人调教| 亚洲国产成人精品无码专区| 人妻免费观看| 美女尤物人人操| 国产乱码精品久久久久久| 天堂69亚洲精品中文字| 啊嗯好大视频在线观看| 欧美v日韩v亚洲v最新在线| 2011国产精品| 亚州综合色| 天天影视网综合少妇| 激情欧美97| 日本有码久久| 久久久97| 日本熟人妻中文字幕在线|...久久国产精品-国产精品_日本一区二区三区中文字幕 | 国产中文字幕曰本毛片| 91青青在线视频| 手机在线观看不卡无码av| 男女香蕉一区二区| 久久男女激情视频网站| 婷婷九月丁香| 色优久久| 性色亚洲| 久久一留热品黄| AA级电影三区| 亚洲熟久久| 奇米狠999| 精品欧美日韩在线观看| 国产福利影视| 东北女人性交| 在线观看一卡二卡| 久久永久无码人妻视频| 91美女在线视频| 亚洲精品人妻在线| 日日日日做夜夜夜夜做无码97| 欧美顶级黄片AAAAA在线免费看| 日本免费二区三区| 久久日韩毛| 麻豆国产97在线| 欧美成人综合| 国产精品老师| 欧美日韩在线小说 | 欧美图片色五月天| 欧美日不卡| 黄色片A级一区二区三区| 无码人妻精品一区二区三区九九| 久久精品国产72国产精品福利 | 黄色性爱网网| 精人妻一区二区三区| 夜夜爽77777| 精品久久久久久AV无码| 日本视频一区二区三区| 男人的天堂久久| http://qxhbdz.com| 欧美性爱无码一区二区三区| 人妻色情天天操| 亚洲成人碰碰| 操www| 91精品婷婷国产综合久久| 淫妻综合网| 91成人高清在线观看| 熟妇高潮二区三区| 亚洲情色五月天| 黄骗免费| 凹凸精品熟女在线观看| 欧美91精彩| 久久久久久久人妻| 韩三级a视频在线观看| 男人天堂最新手机版在线青青草| 四虎永久在线精品免费网址| 欧美久久人人网| 久久东京热久久| 亚洲欧美精品一区天堂久久 | 国产h片在线观看视频| 亚洲另类春色| 97色涩| 久9视频| 国产白丝精品在线观看| 98超碰日本| 99热综合在线| 大香网站| 性无码专区2020| 亚洲日韩97| 久久蜜桃综合网| 欧美亚洲日本激情在线| 国产精品爆乳懂色蜜乳| 欧美日韩亚洲少妇寂寞影院正在播放 | 你操综合| 精品久久人妻成人网| 人人么人人操| 亚州欧美另类| 亚洲欧美一区二区不卡视频播放| 色优久久| 国产福利小视频高清在线观看| 天美传媒精品一区二区| 神马九九九| 久久国产精品,久久国产| 色五月首页| a片自拍直播视频| 四虎免费在线播放| 91高跟美女在线播放| www.狠狠干.coom| 亚洲97成人在线观看| 在线播放欧洲免费av| 60秒试看最爽10分钟网站| 国产毛片精品一区二区色欲黄A片| 午夜一区二区三区国产| 色欲av国内精品久久久久久| 亚洲九九视频| 丝袜色综合| 狠狠夜色午夜久久综合在线| 亚洲有薄码区日本系列中文字幕| 欧美很很操视频| 中文日本免费高清| 粉嫩av在线| 午夜九九九九九九| 欧美,日韩,中文,另类| 四虎免费看黄| 国产性刺激| 青青网三级视频| 啪啪AV导航| 蜜乳AV.COM| 亚洲欧美色图小说| 中文字幕欧美日韩三级| 9久久久久久| 久久九九热| 欧美在线综合| 欧美色图下一页| 亚洲宗合电影| 99999精品成人| 亚洲男人bt天堂| 九九成人| 1024香蕉视频| 五月天激情网图片| 99操逼| 亚洲欧洲综合视频在线| 伦理片秋霞免费影院| 青娱乐亚洲自拍| 强奸乱伦大香蕉| 成人七区| yw尤物av无码点击进入麻豆| 91亚洲欧美| 嗯嗯嗯啊啊在线观看| 97国产伦理| 国产精品在线网站| 精品999日本| 江都AV在线| 97WW精品| 国产久久一区二区午夜| 可以免费观看的AV| 国产精品自拍欧美在线| 欧美不卡二区| 欧美日韩国产高清在线一二三区 | 婷婷久久综合久| 日本片日本片祼观看网站在线看中文版网页在线看| 乱伦av.com| 蜜臀AV网站| 婷婷五月天色色| 大香蕉宗合网在线| 超碰久久性爱| 成人A片男人的天堂| 欧美国产成人在线| 亚洲精品 欧美精品| 熟女久久久| 久久久涩| 亚洲天堂精品日韩电影| 欧美成人免费在线观看| 秋霞一级A片黄色视频| 国产啊v在线免费播放| 在线国产福利网址导航| 青青伊人这里只有精品| 91人人臊| 精品伊人久久久大香线蕉小说| 久久久成人国产精品无码| 国产99热| 中文字幕国产精品1区| 在线人妻熟女一区二区三区四区五区| 黄色十八禁网站| 人妻素股| 国内毛片四区| 午夜国产综合视频在线观看| 成人性爱av.com| 中文字幕亚洲在线一区| 爽爽淫人网| 欧美性,色九九| 屁股久久久久久久久| 人妻美腿丝袜日韩| 欧美78P| 在线观看不卡一区二区三区| 温婉少妇玩3p| 操碰91| 久久精品一区| 青青草中日韩在线| 亚州男人天堂| 极品欧美一区二区三区| 在线v中文字幕一区二区三区| 丰满人妻一区二区三区免费,| 啊啊啊好湿国产一二| 少妇人妻激情四射| 爱逼综合| 福利伊人玖玖国产| 婷婷五月天在线观看| 97超碰天天爱天天爱| 丰满欧美放荡少妇在线| 骚鸭AV| 91国产操逼视频| 操婷婷逼| 诱惑人妻欧美一区在线播放| 蜜桃臀一区二区三区久久| 秋霞色色影院| 久久精品国产免费观看99| 男人天堂婷婷五月天校园春色| 欧美亚洲涩涩| 亚洲开心网| 美女极品一区二区三区| 人妻激情另类| 麻豆一区在线| 亚洲图片欧美| 人妻无一区二区三区| 97色婷| 男人的天堂在线| 久久78| 五月天黄色激情视频| 色 婷97| JuliaAnnXXX888| 乳欲人妻办公室奶水| 欧美男人一区| 国产日韩中文字幕欧美| .精品人妻一区二区三| 五月丁香啪| 超碰97久久国| 中文字幕高清精品一区| 精品久久一区二区三区四区五区| 天天舔天天日天天射| 亚洲精品久久久久毛片A片拉屎| 国产精品免费视频人成| 欧美伦乱爱| 久久午夜色播影院免费高清| 自拍鲍鱼一区在线高清观看免费| 美女主播色欲91抠b在线播放| 女色综合| 91粉嫩萝控精品福利网站_精品影音先锋国| 夜夜騷av、一區二區| 91骚熟女| 欧美人妻精品一区二区| 96免费视频在线| 91精品人| 97资源制服丝袜| www久久精品| 乱伦av国产| 人妻精品一区二区全免费| 亚洲久久久久| 成人片在线播放| 操91| 国产精品无套内谢| 91国产美女丝袜足交精品视频 | 日韩精品三级片长长久久| 超碰在线欧美性爱激情| 最新国产精品久久精品| 日韩天天本| 亚洲成人性爱网站在线播放| 欧美日韩国产中文精品字幕自在自线,| 91插B网站| 日本在线不卡v二区| 国产1727欧美| 影音先锋视频在线| 丰满少妇高潮无码| 亚洲一区操| 青苹果影院男人的天堂| 精品综合久久久久久五月天| 五月丁香网站| 60秒不遮不挡| 在线 制服丝袜中出 人妻| 亚洲中文字幕av | 曰韩成人免费视频| 色香91| 国产欧美岛国精品一区| 污电影在线观看| 丰满少妇乱子伦精品无| 国产精品在线一区二区| 黄色在线网站| 屁股久久久久久久久| 影音先锋乱| 亚洲少妇免费视频\| 18禁的网站在线| 91欧美巨乳| 久久久国产成人一区二区三区在线 | 老外又粗又长一晚做五次| 少妇与黑人高潮在线| 少妇高潮流水av免费| 五月天色电影| 免费少妇一区二区| 9999九九九久久久| 综合免费无码中文| 热热色国产一二区AV| 亚洲精品啪视频| 久久久久久99999国产精品| 久久久97| 欧亚日韩中文在线| 天天综合亚在线| 曰韩人妻中文字幕在线 | 91小视频| 97国产|免费| 91亚洲黑人| 91视频伊人| 久久精品免视看国产成人﹣蜜臀av一区. 久久精品免视看国产成人,蜜臀av一区 | 久久久久国产精品人妻aⅴ天堂| 国产成人精品日本视频| 97伊人超碰| 久久思思热| 欧美高清18A片| 熟妇人妻一区二区三在线| 性爱乱伦网址| 日产精品久久久一区二区| 久热色情精品| 26UUU欧美激情一区二区| 97jingpin| 色综合色色| 免费AV中文网在线观看| 久久99精品国产| 91站街按摩店老熟女熟女| 78m成人视线| 欧中日成人免费影视| 国产精品69人妻无码久久久| 天天性射网| 夜夜爽77777| 中文日本免费高清| 色97欧美| 91网亚洲| aaaa少妇高潮大片| 亚洲天堂男人天堂网| 97国产天堂岛| 九色视频91| 国产精品人妻无码久久久老鸭窝| 福利在线视频一区二区| 久热9| 欧美日韩午夜精品一区二区三区| 热久久无毒不卡| 蜜臀少妇一区二区| 思思热久久成人| 91欧美经典| 99国产精品久久久在线播放| 黄色小视频日本txt| 欧美日韩中文视频播放| 美中日韩无码| 二三四区精品| 欧美精品久久久久久久久88| 熟女熟妇一区二区三区视频| 色噜噜综合网| 超碰在线综合97| 色一情一乱一乱一区91Av| 这里只有精品97| 欧苏综合色综合| 中文久久久| 嗯~啊~快点 死我视频| 国产精品午夜福利亚洲综合网| 2000亚洲男人天堂| 久草国产在线视频| 东京热伊久| 精品国产一区二区三区av在线资源| 亚洲欧美日韩激情不卡| 久久超碰爱| 丰满人妻aA一区二区三区| 精品一区96| 亚洲色欲天天天堂色欲网女| 伊人国产视频| 91人妻尻屄视频| 78精品| 九一亚洲国产免费| 黑人美精品 A片| 婷婷丁香一区二区三区| 26UUU欧美激情一区二区| 韩国嫰模上门援交视频| 久久五月婷| 17c嫩草51久久91嫩草| 啊啊啊不要好爽日韩无码一区| 久操网址| 亚洲色婷婷综合久久久久中文| 蜜臀久久久久久999| 亚洲无无码αⅴ每日更新| 精品国产国产AV| 99精品久久久久久久婷婷蜜桃| 女性91网站| 97精品97| 激情啪啪拍91| 国产熟女精品一区二区| 欧美少妇色综合| 亚洲欧美成人在线| 成·人免费午夜在线观看| 日韩欧美偷拍美女视频| 亚洲高清在线| 性饥渴少妇av无码毛片| 欧美一品道| 国产后入精品| 三级网色| 97国产人人| 欧美日韩国产男人| 久久久18| 乱伦一区二区三区‘| 日夜精品| 色哟哟1区2区| 这里只有精品视频在线| 国产午夜福利电影免费在线观看 | 狠狠久久手机视频精品| 日本亚欧爱爱| 国产男女无套97| 丁香五月天堂| 摸奶性爱视频网站在线免费播放| 伊人欧美大香蕉视频| 欧美性爱一区| 青青草日韩无码| 高潮的A片激情扒开一区| 四虎影视精品| 蜜桃狠狠色伊人亚洲综合| 九九玖玖精品| 日本三级R| 99久久精品无码一区二区毛片免费| 有码专区最新中文字幕有码| 国产午夜视频| 久久99人妖视频国产| a片 xxxx受爽视频| 日天天九九天堂666| 好舒服视频| 久久精品视-一级做a爰片性色毛片16美国-中国女与老外在线精品 | 精品视频免费在线一区| 资源新线在线天堂| 九九九九九九九九九九九蜜桃| 亚洲色欲一区二区三区| 一区二区三区精品视频| 日韩欧美操逼xxx| 亚洲Av诱惑| 操逼无毒无码免费视频| 99操| 亚洲不卡AV在线| 激情久久久| 一区二区三| 国产日韩美女小穴视频网站不卡| 99爱久久视频频| 热久久这里只有精品| 久久无码电影| 91一区二区三区蜜桃| 日韩超碰97| 久久久久久中文| 亚精品无码毛片一区二区三区| 超碰在线974| www.色婷婷| 久久的免费性爱视频| 草草草视频| 一卡二卡在线播放| 久久↗↗| 欧洲亚洲人妻无码中字久久三区四区| 色婷婷狠狠| 岛国精品视频在线观看| 久久久久久国产无码精品| 欧美日产国产在线成人第一区| 嗯嗯啊啊操我| 男人的天堂VA| 久9爱精品| 91久久久久| 亚洲高清在线se| 91偷拍欧美亚洲| 伊人大香蕉在线| 少妇蜜汁| 毛片视频白嫩| 日韩成人色图| 日本欧美成人片AAAA| 91超级碰| 99久久网站| 成人午夜视频免费播放| 九九无码视频| 超碰在线观看av不卡| 婷婷干黄色| 日韩有码 一区二区三区| 天天干人人看综合| 国产在线综合福利网站| 91这里只有精品| 97免费视频在线| 精品999一区二区| 搡老女人老91二区| 亚洲国产97| 久久99国产精品| 欧美激情在线观看视频| 天堂性色| 亚洲综合999| 18禁看网站一区| 国产美女在线精品免费看| 极品销魂美女一区二区| 国产日韩精品suv| 国产91av在线播放| 亚州免费啪啪视频| 国产精品麻豆视频网站| 狠日操| 亚洲色图亚洲无码强奸乱伦| 欧美精品1区2区3区| 亚洲精品日韩国产欧美| 日韩去日本高清在| 色色操| 美女黄色一级A视频| 加勒比在线视频| 少妇天堂网络| 欧美白嫩在线放| 亚洲熟女乱综合一区二区三区 | 九九热精品| 亚洲久久久久| 男人女人18禁片免费看网站| 国产欧美日本亚洲精品| 亚洲AV秘 精品久久老牛影视| 久久精品毛片免费不卡| 欧美性爱视频免费一区一A| 激情综合久久| 思思99热| 麻豆性爱视频在线播放| 九九九综合精品| 久久久久网站-538在线视频-欧美永久乱码| 青木玲在线不卡| 91操熟妇| 中文字幕三四五区| 免费观看一区| 韩美日操逼| 日韩免费看黄片| 久久黄黄| yazhousetuoumei| 欧美色图在线视频少妇| 黑人性暴力毛片| 精品无码欧美三级| 国产精品无码av| 婷婷五月天伊人| 国产原创精品| 亚洲欧洲日产国产综合网| 中文字幕色AV| 一起草高清无码| 十八禁的黄污污免费网站| 久久亚洲婷婷| 亚洲人精品久久久喷水| 啊啊啊要高潮了| 日韩无码人妻中字久久三区四区| 亚洲高清视频在线免费观看| 精品成人动漫一区二区| 亚洲欧美日韩精品久| 97天天爽| 日本高清熟女久久一区| 老妇女91| 少妇xx精品| ′ !γ}丶。。久久精品欧美一区二区三区| 91伊人影视综合| 欧美综合网站999| 精品久久久av无码免费| 91天堂色男人的天堂| 天天操女人| 狠狠躁天天躁日日躁97| 久久精品无码专区| 91九色蝌蚪在线观看| 亚洲男人的天堂亚洲| 伊人 俄罗斯 a v| 91天堂网| 亚欧成人综合影院| 丁香五月天视频| 欧美影音在线| 97超碰超碰| 欧美黄色大香蕉一区二区| 亚洲日韩AV视色| 91国精产品| 97爱综合| 国产高清无码一区二区三区四区皇冠| 亚洲日韩av一区二区三区百合| 国产AV线| 日韩免费中文字幕视频| 综合久久中文字幕综合日韩精品| 天天综合网91入口| 高清视频一区| 亚洲人妻中文高清| 欧美狠狠弄| 久久黄黄黄| 国产精品嫩草影院免费| 内射老妇BBWX0C0CK| 操国产高清| 日本三级日本三级99| 北条麻妃性愛视频| 国产久久久久久| 午夜黄色免费在线观看| 大吊色| 国产精品久久蜜乳av| 欧美性爱伊人| 天堂伊人久久| 狠狠爱夜夜| 自拍偷拍2025在线观看 | 美女97超碰| 亚洲欧美综合网站| 日韩AV无码网站| 激情深爱五月天| 欧美成人国产精品| 国产精品久久妻无码网站| 久久午夜伦| 日本熟妇精品九九| 亚洲一区中文精品| 欧美一级色| 污污污8888| 亚洲情色欧美| 婷婷五月天AV| 死我十八禁| 日韩亚洲中文字幕在线| 偷拍网站久久男女男|