久久亚洲成a人片熟女精品色一区二区三区|国产精品视频第一精品视频|av天堂热无码手机版|亚洲?v无码久久无遮挡|国产精品偷伦视频免费观看国产|麻豆国产自产精品丰满熟妇|av无码av不卡一区二区|久久亚洲精品中文字

ARTICLE DETAIL

資訊詳情

深耕商務(wù)建站與企業(yè)官網(wǎng)運(yùn)營(yíng)的一線實(shí)戰(zhàn)洞察。

PyTorch編譯優(yōu)化實(shí)戰(zhàn):torch.compile、Triton與XLA性能調(diào)優(yōu)指南

PyTorch編譯優(yōu)化實(shí)戰(zhàn):torch.compile、Triton與XLA性能調(diào)優(yōu)指南 1. 性能瓶頸到底在哪先從一份“看起來(lái)很忙”的Profiling說(shuō)起前陣子幫朋友排查一個(gè)訓(xùn)練任務(wù)A100上GPU利用率看著有八成Loss也在降但總感覺(jué)哪里不對(duì)勁。跑了一輪Profile之后發(fā)現(xiàn)實(shí)際計(jì)算核心Kernel的吞吐遠(yuǎn)沒(méi)有跑滿(mǎn)大量時(shí)間花在了小算子的啟動(dòng)和內(nèi)存拷貝上。這種“表面熱鬧、實(shí)際虛高”的利用率其實(shí)很多搞PyTorch訓(xùn)練的人都遇到過(guò)——模型代碼不是瓶頸PyTorch本身的執(zhí)行機(jī)制才是瓶頸。這也正是我當(dāng)時(shí)決定系統(tǒng)整理這套《AI系統(tǒng)性能工程學(xué)習(xí)筆記》的原因所在而第十四篇的內(nèi)容就是圍繞PyTorch的編譯優(yōu)化這條主線拆開(kāi)講講我在實(shí)際項(xiàng)目中反復(fù)驗(yàn)證過(guò)的三個(gè)關(guān)鍵方向。要理解torch.compile的價(jià)值首先要理解PyTorch默認(rèn)的“逐算子執(zhí)行”模式Eager Mode是怎么回事。簡(jiǎn)單來(lái)說(shuō)你用模型定義寫(xiě)出一層卷積、一層歸一化、一個(gè)ReLUEager模式下PyTorch就會(huì)按順序把每個(gè)算子逐個(gè)交給GPU執(zhí)行。每次執(zhí)行都涉及一次Python層的調(diào)用、一次GPU Kernel的Launch、一次數(shù)據(jù)的搬運(yùn)。小算子和短Kernel特別多的時(shí)候啟動(dòng)開(kāi)銷(xiāo)占比就會(huì)直線上升。哪怕每秒鐘能提交幾萬(wàn)個(gè)KernelGPU真正的計(jì)算單元卻經(jīng)常處于“等任務(wù)”的狀態(tài)。那為什么不把所有算子一次性做完因?yàn)樗阕又g存在數(shù)據(jù)依賴(lài)。卷積的輸出要喂給歸一化歸一化的輸出要喂給ReLU每一步都不能跳過(guò)??扇绻茉诒WC依賴(lài)關(guān)系不被打亂的前提下把多個(gè)連續(xù)算子融合成一個(gè)大的Kernel那啟動(dòng)開(kāi)銷(xiāo)就能被壓到很低內(nèi)存讀寫(xiě)也能少幾個(gè)來(lái)回。這個(gè)思路聽(tīng)著不難但落地起來(lái)步驟非?,嵥椤纫治鲇?jì)算圖又要生成高性能Kernel還要在不同硬件上做適配。PyTorch社區(qū)的答案是torch.compile它把這條鏈路做成了一行代碼就能用起來(lái)的方案。坦白說(shuō)torch.compile剛出來(lái)的時(shí)候我是持觀望態(tài)度的。畢竟PyTorch一直以靈活和動(dòng)態(tài)圖著稱(chēng)硬上編譯優(yōu)化很容易破壞調(diào)試體驗(yàn)。但實(shí)測(cè)了幾批CV和NLP模型之后我的態(tài)度發(fā)生了明顯轉(zhuǎn)變?cè)诓恍枰l繁改圖、動(dòng)態(tài)Shape不嚴(yán)重的訓(xùn)練場(chǎng)景下torch.compile帶來(lái)的提升相當(dāng)直觀尤其是在A100、H100這類(lèi)新架構(gòu)上收益常常能到20%到50%。更關(guān)鍵的是它解決的是“全局優(yōu)化”的問(wèn)題而不是零敲碎打地優(yōu)化某個(gè)算子。從這一篇開(kāi)始我會(huì)把torch.compile的機(jī)制、Triton在其中的作用、以及XLA作為另一條編譯器路線的取舍完整地串起來(lái)講。一個(gè)必須明確的點(diǎn)是torch.compile不是銀彈。它適合那些結(jié)構(gòu)穩(wěn)定、算子類(lèi)型清楚的模型如果模型里到處都是Python控制流、動(dòng)態(tài)Shape、自定義算子編譯優(yōu)化能覆蓋的區(qū)間就會(huì)被壓縮得很厲害。所以這篇文章不只是教你怎么用也會(huì)告訴你什么情況下“不要用它”以及在XLA和torch.compile之間到底該怎么選。2. 拆開(kāi)torch.compile的引擎蓋Dynamo、Graph Break 與 Inductortorch.compile能一行代碼接管優(yōu)化本質(zhì)上是因?yàn)樗鼉?nèi)部有一條流水線式的處理路徑。理解這條路徑比死記API參數(shù)有用得多。我會(huì)從自己調(diào)試過(guò)的實(shí)際案例出發(fā)把它的工作過(guò)程拆成三個(gè)階段講。2.1 Dynamo如何在Python的動(dòng)態(tài)世界里“抓到”計(jì)算圖PyTorch模型是用Python寫(xiě)的Python太靈活了一個(gè)if條件、一個(gè)for循環(huán)、一次字典索引都有可能在運(yùn)行時(shí)改變計(jì)算圖的結(jié)構(gòu)。真要等模型跑完再拿到完整靜態(tài)圖那延遲就太大了。torch.compile在0.x到1.x的迭代中逐步用Dynamo作為前端核心思路是在“保證動(dòng)態(tài)行為正確”的前提下捕獲盡可能大的計(jì)算子圖。Dynamo的做法是追蹤字節(jié)碼。它會(huì)攔截Python函數(shù)的執(zhí)行過(guò)程記錄哪些操作是Tensor計(jì)算哪些操作是純Python邏輯。對(duì)于Tensor計(jì)算Dynamo會(huì)把它轉(zhuǎn)換為計(jì)算圖節(jié)點(diǎn)對(duì)于Python邏輯如果無(wú)法翻譯成圖節(jié)點(diǎn)就標(biāo)志為“Graph Break”。Graph Break之后模型執(zhí)行會(huì)退回Eager模式等跑到下一個(gè)可編譯區(qū)域再重新進(jìn)入優(yōu)化路徑。Graph Break不是報(bào)錯(cuò)但它的多少直接決定了優(yōu)化效果。如果一個(gè)模型里有幾十個(gè)Graph Break那torch.compile幾乎等于沒(méi)優(yōu)化因?yàn)榇蟛糠謺r(shí)間都留在了解釋執(zhí)行狀態(tài)。我在實(shí)戰(zhàn)中遇到過(guò)一個(gè)比較典型的例子模型里對(duì)某個(gè)Tensor做了.item()操作然后根據(jù)這個(gè)標(biāo)量去決定是否執(zhí)行某個(gè)分支。這種寫(xiě)法在調(diào)試時(shí)很自然但Dynamo會(huì)在這里斷掉后面一大段分支都變成Eager路徑。解決辦法也很直接——把.item()移到模型外部或者在損失函數(shù)中避免使用同步操作。你可以在每次編譯后查看torch._dynamo.explain的輸出它能夠列出Graph Break的位置和原因這一招在排查性能問(wèn)題時(shí)極其有效。2.2 Inductor從計(jì)算圖到GPU Kernel的“翻譯官”Dynamo抓到計(jì)算子圖后接下來(lái)的工作就交給后端編譯器。PyTorch默認(rèn)的生成后端是Inductor。它的職責(zé)是把計(jì)算圖翻譯成高性能的GPU Kernel代碼——在NVIDIA GPU上Inductor會(huì)把算子融合和代碼生成的任務(wù)進(jìn)一步交給Triton去搞定。Inductor采用的是基于IR的重寫(xiě)方式。它會(huì)先讀入計(jì)算圖嘗試做元素級(jí)融合、Reduce融合、點(diǎn)乘融合等操作。比如說(shuō)對(duì)一個(gè)Tensor先做x 1再乘2再用tanh激活這三步在Eager模式下至少三四個(gè)Kernel但在Inductor里會(huì)被融合成一個(gè)Triton Kernel一次讀寫(xiě)就完成全部計(jì)算。GPU的內(nèi)存帶寬往往是最大約束少一次全量讀寫(xiě)收益就非常明顯。在torch.compile的配置中backend參數(shù)控制使用哪個(gè)編譯器后端。默認(rèn)是inductor但也可以切換為cudagraphs、tvm等。我實(shí)際用下來(lái)Inductor在NVIDIA卡上的兼容性和性能綜合表現(xiàn)最好。cudagraphs的思路是把一系列Kernel的啟動(dòng)信息錄制下來(lái)然后重復(fù)回放減少CPU端的啟動(dòng)開(kāi)銷(xiāo)但對(duì)算子融合無(wú)能為力。如果你的模型本身就是大算子為主瓶頸不明顯那cudagraphs可能就夠了如果模型是小算子密集型的老老實(shí)實(shí)用Inductor。還有一點(diǎn)容易踩坑torch.compile默認(rèn)會(huì)嘗試動(dòng)態(tài)Shape的支持但開(kāi)啟動(dòng)態(tài)Shape等于放棄了一部分融合優(yōu)化。如果你的輸入尺寸在訓(xùn)練中基本固定可以考慮用dynamicFalse或者把輸入Tensor的尺寸約束住讓Inductor生成更激進(jìn)的專(zhuān)用代碼。我們做離線推理優(yōu)化時(shí)就是這么干的一個(gè)固定尺寸的模型編譯后通常能再壓掉10%左右的延遲。2.3 mode參數(shù)該怎么選default、reduce-overhead還是max-autotunetorch.compile的mode參數(shù)是一個(gè)很容易被忽略但影響很大的選項(xiàng)。官方提供了default、reduce-overhead和max-autotune三檔。default模式下Inductor會(huì)做一些低成本的優(yōu)化編譯時(shí)間短但也意味著放棄了部分更激進(jìn)的改動(dòng)reduce-overhead會(huì)在編譯后引入CUDA Graph錄制對(duì)很多小模型有額外收益max-autotune則會(huì)對(duì)生成的Triton Kernel做大量自動(dòng)調(diào)參性能上限最高但編譯時(shí)間可能長(zhǎng)達(dá)幾分鐘到幾十分鐘。我自己的建議是先用default跑通確認(rèn)無(wú)功能問(wèn)題、無(wú)Graph Break導(dǎo)致的性能回退再?lài)L試reduce-overhead。如果你的模型在多個(gè)批量尺寸上都要用不要貿(mào)然開(kāi)max-autotune因?yàn)閍utotune是針對(duì)固定Shape做的。數(shù)據(jù)增強(qiáng)或動(dòng)態(tài)批量導(dǎo)致Shape頻繁變化時(shí)max-autotune的收益會(huì)被命中率稀釋反而浪費(fèi)了編譯時(shí)間。還有一個(gè)重要技巧在A100或者H100上reduce-overhead通常會(huì)讓小批量訓(xùn)練的速度提升非常明顯因?yàn)樗鼫p少了CPU到GPU之間的同步等待。但在V100這些老卡上CUDA Graph帶來(lái)的收益相對(duì)有限因?yàn)橛布旧淼膯?dòng)延遲沒(méi)那么敏感。環(huán)境不同同樣參數(shù)跑出來(lái)的效果可能完全不一樣這也是為什么我建議任何優(yōu)化都要結(jié)合自己的硬件和模型實(shí)測(cè)而不是照搬網(wǎng)上報(bào)告的數(shù)字。3. Triton 在 torch.compile 里的角色寫(xiě)一次、到處亂跑的高性能內(nèi)核聊到Torch編譯優(yōu)化Triton是一個(gè)繞不開(kāi)的名字。很多剛接觸的人會(huì)把Triton誤解為某種第三方算子庫(kù)其實(shí)它在torch.compile中的作用更底層Inductor生成的代碼很大一部分是Triton語(yǔ)言的Kernel??梢园阉譁\地理解為“GPU上的Python”——用一套類(lèi)Python的語(yǔ)法寫(xiě)出能夠直接在CUDA設(shè)備上高效運(yùn)行的GPU Kernel而不需要手動(dòng)管理線程塊、共享內(nèi)存、同步指令那些復(fù)雜細(xì)節(jié)。3.1 Triton Kernel 到底解決了什么問(wèn)題傳統(tǒng)CUDA編程最難的不是“讓程序跑對(duì)”而是“讓程序跑快”。你要手動(dòng)決定每個(gè)線程負(fù)責(zé)哪個(gè)元素要處理內(nèi)存合并訪問(wèn)要在不同層級(jí)的內(nèi)存之間做搬運(yùn)還要處理Bank Conflict這類(lèi)隱藏很深的性能殺手。寫(xiě)出來(lái)的代碼一旦換了GPU架構(gòu)往往又要重新調(diào)整。Triton的思路是把這些底層細(xì)節(jié)抽象成塊級(jí)操作你只需要描述“每個(gè)塊負(fù)責(zé)計(jì)算什么”而塊內(nèi)部怎么劃分線程、怎么分配寄存器、怎么訪問(wèn)顯存由編譯器自動(dòng)決定。這個(gè)抽象對(duì)自動(dòng)調(diào)優(yōu)特別友好。編譯器可以在一次編譯過(guò)程中生成多個(gè)候選版本然后在真實(shí)硬件上跑一遍選擇最快的那一個(gè)。Inductor在生成Kernel時(shí)就會(huì)調(diào)用Triton做這輪調(diào)優(yōu)。你在日志里看到的“Triton kernel”字樣本質(zhì)上就是Inductor針對(duì)某個(gè)融合子圖生成的GPU代碼。實(shí)際效果上我跑過(guò)一個(gè)典型的ResNet風(fēng)格模型Eager模式下有大概600多個(gè)Kernel執(zhí)行開(kāi)啟torch.compile Inductor Triton后Kernel數(shù)量降到兩百左右端到端訓(xùn)練時(shí)間減少了35%。這個(gè)降幅不是因?yàn)槟骋粋€(gè)算子變快了而是因?yàn)榇罅啃ernel被合并成少量大KernelGPU的執(zhí)行效率因此獲得整體提升。用一句話概括就是Triton不是讓某個(gè)算子從10微秒變成1微秒而是讓幾百次啟動(dòng)從“每次都在浪費(fèi)”變成“每次都真正在計(jì)算”。3.2 Triton 在非編譯場(chǎng)景下的用法手寫(xiě)自定義Kerneltorch.compile之外Triton也可以作為獨(dú)立工具來(lái)寫(xiě)自定義算子。PyTorch里寫(xiě)高性能自定義算子傳統(tǒng)路線是寫(xiě)CUDA C擴(kuò)展然后通過(guò)torch.utils.cpp_extension編譯加載。這條路功能上限高但開(kāi)發(fā)效率低——你得同時(shí)掌握C、CUDA和PyTorch的C接口。Triton提供了一個(gè)折中方案用Python編寫(xiě).triton.kernel裝飾的Kernel函數(shù)運(yùn)行時(shí)自動(dòng)編譯成GPU代碼。調(diào)用的方式跟普通PyTorch函數(shù)一樣傳Tensor進(jìn)去就行。我舉一個(gè)實(shí)際項(xiàng)目里的例子我們要做一個(gè)自定義的注意力掩碼算子標(biāo)準(zhǔn)PyTorch實(shí)現(xiàn)里涉及多次reshape和mask操作顯存開(kāi)銷(xiāo)高。用Triton重寫(xiě)后一個(gè)Kernel內(nèi)完成了mask和softmax的部分融合顯存占用顯著下降速度也快了不少。當(dāng)時(shí)只花了半天時(shí)間就寫(xiě)完了而如果用CUDA C可能要兩三天起步。如果你打算自己動(dòng)手寫(xiě)Triton Kernel建議從簡(jiǎn)單的逐元素算子開(kāi)始練手比如把“ReLU 縮放 偏移”融合成一個(gè)自定義Kernel。把基礎(chǔ)語(yǔ)法、tl.load和tl.store的使用方式搞明白后再?lài)L試更復(fù)雜的Reduce算子。Triton的官方教程里有一個(gè)softmax例子是非常好的入門(mén)材料——同樣一個(gè)功能分別用PyTorch原生實(shí)現(xiàn)和Triton Kernel實(shí)現(xiàn)對(duì)比兩者的時(shí)間消耗你會(huì)很快理解編譯優(yōu)化的核心價(jià)值在哪里。3.3 Triton 版本兼容與安裝坑位Triton目前最常見(jiàn)的安裝方式是隨torch一同安裝。torch.compile在NVIDIA后端會(huì)依賴(lài)Triton所以你在用conda或pip安裝較新版本的PyTorch時(shí)Triton通常已經(jīng)是配套的。但如果你之前手動(dòng)裝過(guò)舊版Triton或者環(huán)境里有多個(gè)PyTorch版本很容易出現(xiàn)“torch版本和Triton版本不匹配”的警告。我在排查環(huán)境時(shí)發(fā)現(xiàn)一個(gè)規(guī)律每當(dāng)PyTorch發(fā)布新版本社區(qū)里就會(huì)出現(xiàn)一批“安裝完torch.compile報(bào)錯(cuò)找不到Triton”或“編譯Kernel報(bào)錯(cuò)版本太舊”的帖子。這時(shí)候首先要做的不是重裝Triton而是確認(rèn)當(dāng)前PyTorch要求的Triton版本范圍。最穩(wěn)妥的方案是直接使用官方推薦的安裝指令pip或conda重新裝一遍PyTorch讓依賴(lài)自動(dòng)拉齊。Google Colab和Kaggle Notebook這類(lèi)云端環(huán)境偶爾也會(huì)出現(xiàn)預(yù)裝Triton版本和torch不匹配的情況重置運(yùn)行時(shí)或升級(jí)torch就可以解決。如果你在CPU-only的機(jī)器上跑torch.compile會(huì)發(fā)現(xiàn)很多Triton相關(guān)功能不可用或者編譯速度極慢。這不是你的代碼有問(wèn)題而是Triton的GPU后端需要CUDA編譯器工具鏈。CPU環(huán)境下Inductor會(huì)嘗試生成C Kernel功能上能跑通但優(yōu)化幅度和GPU場(chǎng)景沒(méi)有可比性。所以建議在動(dòng)手實(shí)踐之前先確認(rèn)自己的環(huán)境有可用的NVIDIA GPU并且PyTorch的CUDA版本和驅(qū)動(dòng)是匹配的。4. XLA 后端另一條編譯器路線的優(yōu)勢(shì)與代價(jià)PyTorch的編譯優(yōu)化不止torch.compile一條路徑。XLAAccelerated Linear Algebra是一個(gè)從TensorFlow生態(tài)里沉淀下來(lái)的編譯器框架也可以作為PyTorch的后端使用。你只需要把模型轉(zhuǎn)換為torch_xla下的執(zhí)行設(shè)備就可以讓計(jì)算圖經(jīng)過(guò)XLA的優(yōu)化后再編譯為對(duì)應(yīng)的硬件指令。這個(gè)方案的好處是跨硬件能力很強(qiáng)——從NVIDIA GPU到Google TPUXLA都有對(duì)應(yīng)的編譯目標(biāo)。4.1 XLA 的工作原理和典型場(chǎng)景XLA的核心思路是“拿到完整的計(jì)算圖再做全局優(yōu)化”。它會(huì)把輸入的計(jì)算圖做算子融合、內(nèi)存規(guī)劃、布局優(yōu)化等處理然后為特定硬件生成可執(zhí)行文件。跟Inductor偏向于“為單個(gè)GPU卡上的小規(guī)模融合”相比XLA的優(yōu)化更傾向于整圖級(jí)別的改寫(xiě)。我最早接觸XLA是在原生TensorFlow時(shí)代那時(shí)候用XLA跑Transformer類(lèi)模型速度提升經(jīng)常是成倍的。后來(lái)PyTorch生態(tài)繁榮起來(lái)torch_xla項(xiàng)目把這種能力搬到了PyTorch里。如果你有TPU資源PyTorch模型可以直接通過(guò)XLA后端在TPU上運(yùn)行這一點(diǎn)是torch.compile目前完全覆蓋不到的。但XLA也有一些明顯的代價(jià)。最大的問(wèn)題是編譯時(shí)間。之前用XLA跑一個(gè)較大規(guī)模的BERT模型編譯階段可能就要幾分鐘到十幾分鐘。如果是訓(xùn)練任務(wù)每個(gè)Step都生成同樣的計(jì)算圖編譯一次就夠了這個(gè)成本可以接受如果是推理任務(wù)每次請(qǐng)求都要處理動(dòng)態(tài)Shape或者新的模型結(jié)構(gòu)編譯開(kāi)銷(xiāo)就會(huì)成為很大的負(fù)擔(dān)。這也是為什么XLA更適用于“固定圖、長(zhǎng)時(shí)間反復(fù)執(zhí)行”的場(chǎng)景。4.2 torch.compile 和 XLA 怎么選很多剛接觸這兩個(gè)概念的人會(huì)糾結(jié)“到底用哪一個(gè)”。我的判斷標(biāo)準(zhǔn)非常簡(jiǎn)單你的目標(biāo)硬件是什么如果你的執(zhí)行環(huán)境是NVIDIA GPU并且模型在PyTorch生態(tài)內(nèi)能跑通默認(rèn)選擇torch.compile。它和PyTorch的接口耦合更緊密調(diào)試信息和工具鏈也更成熟。如果你的目標(biāo)是TPU或者你的模型是從TensorFlow/JAX遷移過(guò)來(lái)的那XLA就是理所當(dāng)然的選擇。另外有些場(chǎng)景會(huì)同時(shí)用到兩者。比如在NVIDIA GPU上做模型開(kāi)發(fā)驗(yàn)證然后跑到TPU上做大規(guī)模訓(xùn)練。我的經(jīng)驗(yàn)是先各自跑通最小實(shí)驗(yàn)再統(tǒng)一對(duì)比指標(biāo)。快速看一張我整理的對(duì)比表對(duì)比維度torch.compile InductorXLA 后端目標(biāo)硬件主要面向NVIDIA GPUNVIDIA GPU / TPU / CPU接入成本一行代碼需要切換設(shè)備為XLA并處理數(shù)據(jù)搬運(yùn)編譯時(shí)間通常幾十秒到幾分鐘大模型可能較長(zhǎng)動(dòng)態(tài)Shape支持較好但允許一定回退一般盡量避免調(diào)試體驗(yàn)較好支持回退Eager模式相對(duì)繁瑣報(bào)錯(cuò)和符號(hào)化程度較高生態(tài)現(xiàn)狀PyTorch官方主推在TensorFlow/JAX場(chǎng)景下更普遍這張表不是絕對(duì)的但它能幫你快速判斷自己該往哪個(gè)方向投入。實(shí)際上我見(jiàn)過(guò)不少團(tuán)隊(duì)為了“追趕熱點(diǎn)”硬上XLA結(jié)果模型在GPU上反而更慢了。因?yàn)閄LA在GPU上的優(yōu)化效果很多時(shí)候并不比Inductor更優(yōu)反而因?yàn)檎麍D編譯的調(diào)度開(kāi)銷(xiāo)在小模型和短任務(wù)上半點(diǎn)便宜都占不到。4.3 XLA 使用中的常見(jiàn)坑位使用torch_xla的時(shí)候最容易踩的坑是數(shù)據(jù)類(lèi)型和Shape不一致帶來(lái)的額外編譯。XLA不喜歡動(dòng)態(tài)Shape。同一個(gè)模型如果每次傳入的sequence長(zhǎng)度都不同XLA就會(huì)反復(fù)做編譯或選擇“動(dòng)態(tài)Shape路徑”性能大打折扣。解決辦法是在數(shù)據(jù)加載階段做好padding把序列長(zhǎng)度統(tǒng)一到同一個(gè)batch內(nèi)的最大值。另一個(gè)坑是分布式訓(xùn)練時(shí)的數(shù)據(jù)同步。torch_xla有自己的分布式接口直接從原生PyTorch的DistributedDataParallel遷移過(guò)來(lái)可能會(huì)碰到collective通信實(shí)現(xiàn)不一致的問(wèn)題。如果只是小規(guī)模實(shí)驗(yàn)單卡訓(xùn)練問(wèn)題不大一旦上多卡建議按照torch_xla官方文檔里的分布式示例調(diào)整代碼而不是硬套原來(lái)的DDP邏輯。最后提一句torch_xla的版本更新頻率通常滯后于PyTorch主版本。如果你正在用很新的PyTorch nightly版裝torch_xla時(shí)最好看一下官方兼容矩陣避免出現(xiàn)API對(duì)不上的問(wèn)題。我自己就遇到過(guò)“小版本不兼容模型A能跑B不能跑”的怪問(wèn)題最終排查出來(lái)是編譯版本不一致導(dǎo)致的。5. 實(shí)操記錄從Eager到torch.compile的一次完整調(diào)優(yōu)這里我會(huì)用一個(gè)簡(jiǎn)化但完整的例子展示我實(shí)際調(diào)優(yōu)一個(gè)CV識(shí)別模型的步驟。這個(gè)模型不復(fù)雜但足以說(shuō)明編譯優(yōu)化的整體流程和注意點(diǎn)。你完全可以把這套流程套用到自己的模型上。5.1 第一步先跑通Baseline拿到可量化指標(biāo)任何優(yōu)化工作第一步永遠(yuǎn)是拿到準(zhǔn)確、可復(fù)現(xiàn)的Benchmark基線。不要上來(lái)就改代碼加編譯否則優(yōu)化前后對(duì)比會(huì)出現(xiàn)很大的噪音。我通常固定隨機(jī)種子、固定輸入Tensor的Shape、固定優(yōu)化器參數(shù)并且把Warmup步數(shù)留足再統(tǒng)計(jì)穩(wěn)定的Step時(shí)間。下面是簡(jiǎn)化示例import torch import torch.nn as nn import time class SimpleModel(nn.Module): def __init__(self): super().__init__() self.conv1 nn.Conv2d(3, 64, kernel_size3, padding1) self.bn1 nn.BatchNorm2d(64) self.conv2 nn.Conv2d(64, 128, kernel_size3, padding1) self.bn2 nn.BatchNorm2d(128) self.pool nn.AdaptiveAvgPool2d((1, 1)) self.fc nn.Linear(128, 10) def forward(self, x): x torch.relu(self.bn1(self.conv1(x))) x torch.relu(self.bn2(self.conv2(x))) x self.pool(x).flatten(1) x self.fc(x) return x model SimpleModel().cuda().train() optimizer torch.optim.SGD(model.parameters(), lr0.01) x torch.randn(32, 3, 224, 224).cuda() target torch.randint(0, 10, (32,)).cuda() criterion nn.CrossEntropyLoss() # warmup for _ in range(10): optimizer.zero_grad() loss criterion(model(x), target) loss.backward() optimizer.step() # benchmark: 50 iters torch.cuda.synchronize() start time.time() for _ in range(50): optimizer.zero_grad() loss criterion(model(x), target) loss.backward() optimizer.step() torch.cuda.synchronize() avg_step (time.time() - start) / 50 print(fEager avg step: {avg_step * 1000:.2f} ms)跑這類(lèi)腳本時(shí)注意每次循環(huán)都執(zhí)行torch.cuda.synchronize()否則計(jì)時(shí)結(jié)果會(huì)不準(zhǔn)確。GPU執(zhí)行是異步的CPU端的time.time()只能記錄到“提交任務(wù)”的時(shí)間而不是真實(shí)執(zhí)行結(jié)束的時(shí)間。5.2 第二步開(kāi)啟torch.compile并觀察Graph Break在Baseline跑通以后第二步就是一行接入compile并觀察Dynamo的捕獲情況。代碼改動(dòng)很簡(jiǎn)單model torch.compile(SimpleModel().cuda().train(), modereduce-overhead)跑同樣的Benchmark流程。如果代碼沒(méi)有特殊控制流torch.compile一般能直接接管大部分計(jì)算路徑。為了確認(rèn)優(yōu)化覆蓋到了多少比例我強(qiáng)烈建議先跑一次帶有解釋信息的診斷from torch._dynamo import explain compiled_model torch.compile(model, modereduce-overhead) explanation explain(compiled_model, x) print(explanation)你會(huì)看到Graph Break的具體位置、覆蓋算子的比例、以及被優(yōu)化掉的節(jié)點(diǎn)數(shù)。如果Graph Break數(shù)量特別多先不要慌逐條分析原因。常見(jiàn)的原因就那幾類(lèi)調(diào)用了.item()、print到Tensor、使用了不支持的第三方庫(kù)函數(shù)、或者對(duì)Tensor做了Python層面的條件判斷。我當(dāng)時(shí)調(diào)這個(gè)簡(jiǎn)化模型時(shí)最典型的問(wèn)題是在forward里加了幾個(gè)用于調(diào)試的assertDynamo遇到這些Python斷言就Graph Break了。把這些調(diào)試邏輯拿到模型外部之后Graph Break數(shù)量從好幾個(gè)降到零整體性能立刻上了一個(gè)臺(tái)階。5.3 第三步對(duì)照組交叉驗(yàn)證區(qū)分“真實(shí)提升”和“測(cè)量噪音”三步跑完通常得到一張類(lèi)似這樣的表模式平均Step時(shí)間相對(duì)Eager提升Eager18.6 ms基線torch.compile(default)13.8 ms~26%torch.compile(reduce-overhead)12.9 ms~31%torch.compile(max-autotune)12.7 ms~32%這個(gè)例子里reduce-overhead和max-autotune的差距已經(jīng)很小max-autotune的編譯時(shí)間卻可能是后者的幾倍。所以在實(shí)際業(yè)務(wù)里我會(huì)優(yōu)先選擇reduce-overhead因?yàn)樗骖櫫司幾g速度和性能收益。需要提醒的是這類(lèi)數(shù)字受很多因素影響GPU型號(hào)、PyTorch版本、CUDA版本、輸入Shape、Batch Size、是否開(kāi)啟AMP等。同一份代碼在不同機(jī)器上可能跑出完全不同的對(duì)比結(jié)果。我自己有過(guò)一次經(jīng)歷在V100上torch.compile只帶來(lái)5%的提升換到A100上同樣的模型直接提升40%。原因很簡(jiǎn)單——新架構(gòu)對(duì)融合Kernel的執(zhí)行效率更高舊架構(gòu)受限于寄存器、調(diào)度能力收益自然不明顯。5.4 實(shí)戰(zhàn)補(bǔ)遺混合精度和編譯的配合如果你在訓(xùn)練中還開(kāi)啟了AMP自動(dòng)混合精度建議把優(yōu)化順序排成“先AMP再compile”。因?yàn)锳MP本身就能把部分計(jì)算切到FP16/FP16帶來(lái)顯著的顯存和速度收益。此時(shí)再疊加torch.compile還能在融合Kernel里自動(dòng)處理FP16/FP32之間的轉(zhuǎn)換細(xì)節(jié)進(jìn)一步減少讀寫(xiě)開(kāi)銷(xiāo)。有一個(gè)細(xì)節(jié)值得單獨(dú)說(shuō)在Eager模式下AMP會(huì)和torch.cuda.amp.GradScaler配合使用避免梯度下溢。在torch.compile下這個(gè)邏輯本質(zhì)不變但Dynamo會(huì)拿到包含AMP包裝層的計(jì)算圖。正常情況下沒(méi)有問(wèn)題但如果你的模型或損失函數(shù)里有自定義的autograd.Function可能需要額外檢查一下是否兼容編譯路徑。出現(xiàn)問(wèn)題的時(shí)候日志里會(huì)明確提示某個(gè)算子不支持編譯這時(shí)候可以把那個(gè)算子所在的子模塊排除出編譯范圍比如用torch.compile(model, disable...)或者把模塊內(nèi)部改成torch._dynamo.mark_dynamic之類(lèi)的注解去處理。6. 踩坑筆記Graph Break、CUDA Graph 與編譯時(shí)間失控理論聊得再多實(shí)踐中該踩的坑一個(gè)都不會(huì)少。這一節(jié)我把自己在torch.compile、Triton和XLA身上踩過(guò)的高頻坑集中列出來(lái)。每一類(lèi)坑背后都是我曾花掉的幾個(gè)小時(shí)能讓你避開(kāi)的話這篇文章就值回票價(jià)了。6.1 Graph Break導(dǎo)致的“越優(yōu)化越慢”最迷惑人的問(wèn)題就是“編譯之后反而比Eager更慢”。這種情況九成以上都能追溯到Graph Break過(guò)多或編譯覆蓋范圍過(guò)小。一旦模型在關(guān)鍵循環(huán)里頻繁回退到Eager那么每次切換到編譯區(qū)又要額外付出圖捕獲和編譯檢查的代價(jià)結(jié)果就是“反復(fù)橫跳”性能自然惡化。排查的方法特別簡(jiǎn)單用torch._dynamo.explain把優(yōu)化報(bào)告打印出來(lái)里面會(huì)清晰地列出每個(gè)Graph Break的文件名、行號(hào)和原因。我遇到過(guò)一個(gè)項(xiàng)目模型里用了一個(gè)外部庫(kù)的某個(gè)函數(shù)對(duì)Tensor做掩碼處理這個(gè)函數(shù)內(nèi)部包含Python層面的循環(huán)和條件分支Dynamo拿它沒(méi)辦法整段都變成了Graph Break。后來(lái)我用原生PyTorch算子重寫(xiě)了那段邏輯Graph Break立刻消失整體訓(xùn)練時(shí)間縮短了接近一半。實(shí)際操作中還有一個(gè)比較隱蔽的trigger是torch.no_grad()和model.eval()的組合使用。推理階段在關(guān)閉梯度后Dynamo的捕獲反而可能因?yàn)榘b關(guān)系變得更復(fù)雜。如果遇到推理階段Graph Break異??梢栽囋嚢裯o_grad移到調(diào)用compile的模型之前或者將推理函數(shù)整體包進(jìn)一個(gè)torch.no_grad()裝飾的函數(shù)里。6.2 CUDA Graph和動(dòng)態(tài)Shape的沖突reduce-overhead模式會(huì)啟用CUDA Graph技術(shù)。CUDA Graph的精髓是“先錄制后回放”第一步執(zhí)行時(shí)把所有Kernel的調(diào)用信息記錄下來(lái)之后就用極低的CPU開(kāi)銷(xiāo)反復(fù)提交。但錄制意味著Kernel的Shape和輸入Tensor的指針信息基本固定。如果之后某一步傳入的輸入Shape變了CUDA Graph回放了錯(cuò)誤配置就會(huì)導(dǎo)致崩潰、顯存錯(cuò)誤或嚴(yán)重性能下降。我的經(jīng)驗(yàn)是訓(xùn)練中若Batch Size固定、圖像分辨率固定GPU Graph幾乎無(wú)副作用。但你一旦在訓(xùn)練過(guò)程中改變了輸入分辨率比如圖像縮放、動(dòng)態(tài)裁剪或者模型中依賴(lài)數(shù)據(jù)的Shape計(jì)算比如序列長(zhǎng)度變化就必須謹(jǐn)慎。更穩(wěn)妥的方案是把變長(zhǎng)輸入先整理成固定Shape的Batch盡量把動(dòng)態(tài)變化控制在模型外部。如果實(shí)在無(wú)法避免動(dòng)態(tài)Shape那reduce-overhead模式建議先不要用改用default模式跑通驗(yàn)證再考慮進(jìn)一步調(diào)優(yōu)。還有一個(gè)細(xì)節(jié)在使用CUDA Graph時(shí)如果模型內(nèi)部有隨機(jī)性操作比如Dropout錄制后的回放階段會(huì)把隨機(jī)數(shù)生成路徑也一并固定導(dǎo)致結(jié)果不可復(fù)現(xiàn)或者統(tǒng)計(jì)分布偏移。PyTorch的編譯器會(huì)對(duì)這類(lèi)隨機(jī)操作做特殊標(biāo)注但手動(dòng)寫(xiě)的一些自定義Triton Kernel如果內(nèi)部調(diào)用了隨機(jī)API需要格外小心。最好在自定義Kernel里顯式傳入隨機(jī)狀態(tài)或者在模型外部控制隨機(jī)性。6.3 編譯時(shí)間太長(zhǎng)是硬件問(wèn)題還是模型問(wèn)題編譯時(shí)間很多時(shí)候讓人抓狂。max-autotune模式在大模型上動(dòng)輒十幾分鐘、幾十分鐘這在開(kāi)發(fā)迭代階段會(huì)非常影響效率。我的做法是“開(kāi)發(fā)用default上線用max-autotune”開(kāi)發(fā)階段頻繁改代碼沒(méi)必要花大量時(shí)間等待編譯模型定型、進(jìn)入長(zhǎng)期固定訓(xùn)練或反復(fù)推理時(shí)再逐步升級(jí)到更激進(jìn)的編譯選項(xiàng)。另外還有一個(gè)容易忽視的原因Inductor為每個(gè)編譯的圖生成多個(gè)候選Triton Kernel并逐一套用不同參數(shù)運(yùn)行驗(yàn)證這個(gè)“autotune”過(guò)程需要在GPU上真實(shí)跑一遍。如果你同時(shí)開(kāi)了多個(gè)進(jìn)程做編譯GPU資源會(huì)被爭(zhēng)搶autotune的時(shí)間也會(huì)被明顯放大。建議在關(guān)鍵編譯任務(wù)執(zhí)行時(shí)保持同一張卡上只有一個(gè)編譯進(jìn)程。如果你發(fā)現(xiàn)編譯總是卡在某個(gè)特定階段還可以開(kāi)啟TORCH_LOGSinductor環(huán)境變量查看詳細(xì)的編譯日志定位到底是圖優(yōu)化階段耗時(shí)還是Triton Kernel自動(dòng)調(diào)優(yōu)階段耗時(shí)。拿到日志后再?zèng)Q定是換mode還是調(diào)整Shape設(shè)定會(huì)高效得多。6.4 自定義算子無(wú)法編譯三個(gè)層面的應(yīng)對(duì)順序PyTorch生態(tài)里難免有第三方或自制算子。遇到Dynamo不認(rèn)識(shí)的函數(shù)時(shí)第一選擇是改成原生算子組合第二選擇是給這個(gè)算子注冊(cè)一個(gè)“偽量化”的圖捕獲規(guī)則讓編譯期可以忽略其內(nèi)部細(xì)節(jié)只把它當(dāng)作一個(gè)不可拆分的節(jié)點(diǎn)第三選擇才是回到Eager模式把整個(gè)模型或某個(gè)子模塊排除在編譯范圍外。在實(shí)際項(xiàng)目中我見(jiàn)到最多的是很多人一遇到自定義算子不支持就慌張地把torch.compile全局關(guān)閉。如果因?yàn)閹讉€(gè)點(diǎn)損失整張圖的優(yōu)化潛力非??上?。更好的做法是把自定義算子封裝在獨(dú)立的子模塊里用torch.compile只編譯模型中其余穩(wěn)定的部分。PyTorch本身是支持部分模塊編譯的善用這個(gè)能力很多兼容性問(wèn)題都可以繞過(guò)去。7. 更進(jìn)一步在真實(shí)業(yè)務(wù)里如何把編譯優(yōu)化推向生產(chǎn)環(huán)境如果你試過(guò)了torch.compile指標(biāo)也漂亮接下來(lái)要思考的是“怎么讓它在生產(chǎn)環(huán)境穩(wěn)定跑起來(lái)”。這涉及的環(huán)境問(wèn)題比模型代碼本身更多比如服務(wù)化部署時(shí)的請(qǐng)求Shape變化、多卡并行時(shí)的組網(wǎng)方式、以及Cluster里多個(gè)任務(wù)對(duì)GPU的爭(zhēng)搶。7.1 訓(xùn)練場(chǎng)景怎么穩(wěn)定落地訓(xùn)練場(chǎng)景相對(duì)簡(jiǎn)單一些。因?yàn)橛?xùn)練數(shù)據(jù)的Shape通常固定模型結(jié)構(gòu)也穩(wěn)定torch.compile的收益可以平滑落地。需要額外關(guān)注的是多機(jī)多卡的通信開(kāi)銷(xiāo)。當(dāng)你把編譯后的模型接入DDP或FSDP時(shí)通信模式和Kernel執(zhí)行順序可能會(huì)和普通Eager模型略有差異如果出現(xiàn)卡頓或利用率波動(dòng)可以先關(guān)掉編譯模式做一下對(duì)照實(shí)驗(yàn)判斷問(wèn)題是出在編譯優(yōu)化還是通信調(diào)度。FSDP的數(shù)據(jù)流比較復(fù)雜Dynamo在捕獲時(shí)會(huì)看到很多與通信相關(guān)的集合操作。新版本PyTorch已經(jīng)對(duì)這類(lèi)帶通信操作的計(jì)算圖做了更好的適配但如果你用的是較老版本遇到FSDP torch.compile性能不升反降的情況可以嘗試把模型內(nèi)部的通信包裝層移動(dòng)到編譯區(qū)之外或者用官方文檔推薦的版本組合。7.2 推理場(chǎng)景怎么處理動(dòng)態(tài)負(fù)載推理任務(wù)要面對(duì)的最大變量是請(qǐng)求Shape不固定。線上服務(wù)經(jīng)常一個(gè)請(qǐng)求是短文本下一個(gè)就是長(zhǎng)文本還有各種不同Batch Size的準(zhǔn)備策略。如果每個(gè)Shape都觸發(fā)一次torch.compile編譯開(kāi)銷(xiāo)會(huì)完全吃掉性能收益。所以生產(chǎn)落地時(shí)一般會(huì)做“按Shape緩存編譯結(jié)果”的設(shè)計(jì)只對(duì)常見(jiàn)的幾個(gè)Shape組合做預(yù)編譯其他Shape走Eager路徑。我在一個(gè)B端推理服務(wù)里用的策略是在服務(wù)啟動(dòng)階段用幾個(gè)典型Shape預(yù)熱編譯結(jié)果然后用一個(gè)哈希表記錄“Shape簽名 - 編譯后模型”。請(qǐng)求進(jìn)入時(shí)先查表命中就使用編譯版本未命中則走Eager。這樣既保證了服務(wù)質(zhì)量又把編譯成本限制在可接受的范圍內(nèi)。論文里有一個(gè)詞叫“Shape Bucketing”說(shuō)的基本就是這個(gè)思路——把連續(xù)的Shape空間離散化成若干桶以兼容性能和靈活性。7.3 對(duì)“性能工程”這件事本身的思考在我寫(xiě)這套學(xué)習(xí)筆記的整個(gè)過(guò)程中一個(gè)反復(fù)出現(xiàn)的主題是性能優(yōu)化沒(méi)有銀彈。torch.compile很好用但它只是把計(jì)算圖表示、算子調(diào)度和硬件指令生成之間的一層又一層的復(fù)雜性封裝了起來(lái)。真正的性能工程能力不是在某個(gè)模型上跑通一個(gè)API而是能快速定位瓶頸、判斷優(yōu)化手段的適用邊界以及在效率和穩(wěn)定性之間做出合適的權(quán)衡。這需要一種“分層診斷”的思維先看數(shù)據(jù)加載和CPU側(cè)是否飽和再看GPU Util是否真實(shí)有效再看計(jì)算圖里是否存在大量小Kernel最后才輪到是否引入編譯器。整個(gè)順序反了你很可能花了一整天時(shí)間調(diào)編譯參數(shù)最后發(fā)現(xiàn)瓶頸在DataLoader根本沒(méi)喂飽GPU。8. 番外幾個(gè)你一定會(huì)用到的環(huán)境與版本問(wèn)題因?yàn)檫@套筆記發(fā)布后經(jīng)常有讀者私信問(wèn)我環(huán)境配置的問(wèn)題這里把跟torch.compile、Triton、XLA相關(guān)的環(huán)境適配問(wèn)題單獨(dú)拿出來(lái)說(shuō)一遍免得大家在前面代碼沒(méi)跑起來(lái)的時(shí)候就被環(huán)境卡住。8.1 PyTorch與CUDA的版本匹配不同版本的PyTorch對(duì)CUDA的支持版本不同。我個(gè)人的習(xí)慣是直接去PyTorch官網(wǎng)的Get Started頁(yè)面選擇合適的操作系統(tǒng)、包管理工具和CUDA版本然后復(fù)制對(duì)應(yīng)的安裝命令。不要自己手動(dòng)從一堆索引里拼輪子那樣很容易引入版本沖突。如果你是離線環(huán)境需要先在一臺(tái)聯(lián)網(wǎng)的機(jī)器上把對(duì)應(yīng)的wheel包下載好然后再搬到目標(biāo)機(jī)器安裝。下載時(shí)注意選擇cu118、cu121這類(lèi)后綴確保和機(jī)器上實(shí)際安裝的驅(qū)動(dòng)兼容。驅(qū)動(dòng)本身要符合CUDA運(yùn)行時(shí)的最低版本要求否則即使torch裝好了torch.cuda.is_available()也可能返回False。8.2 如何確認(rèn)Triton已經(jīng)正確安裝和可用最簡(jiǎn)單的方式是在Python環(huán)境里執(zhí)行以下代碼import triton print(triton.__version__)如果打印出版本號(hào)基本就說(shuō)明裝好了。接下來(lái)再跑一個(gè)小Kernel驗(yàn)證確保運(yùn)行路徑也正確。比如官方文檔里的向量加法示例或者一個(gè)最簡(jiǎn)單的torch.compile測(cè)試。只import成功不一定代表能正常編譯Kernel因?yàn)門(mén)riton還依賴(lài)本機(jī)的編譯器工具鏈。在容器化環(huán)境中經(jīng)常出現(xiàn)“宿主機(jī)能跑但容器里不能跑”的情況絕大多數(shù)是因?yàn)槿萜麋R像里缺少libgomp等動(dòng)態(tài)庫(kù)或者LD_LIBRARY_PATH沒(méi)有正確包含CUDA的庫(kù)路徑。遇到這類(lèi)問(wèn)題時(shí)先檢查基礎(chǔ)鏡像是否包含完整的CUDA runtime再檢查nvcc是否可用。8.3 我常用的一個(gè)快速驗(yàn)證腳本最后分享一個(gè)我?guī)缀趺看芜w移環(huán)境后都會(huì)跑的快速驗(yàn)證腳本內(nèi)容很簡(jiǎn)單但它能在十分鐘內(nèi)暴露80%的常見(jiàn)環(huán)境問(wèn)題import torch print(PyTorch version:, torch.__version__) print(CUDA available:, torch.cuda.is_available()) if torch.cuda.is_available(): print(CUDA version:, torch.version.cuda) print(GPU name:, torch.cuda.get_device_name(0)) x torch.randn(1000, 1000, devicecuda) y torch.matmul(x, x) print(matmul ok:, y.shape) try: import triton print(Triton version:, triton.__version__) except ImportError as e: print(Triton import error:, e) def simple_add(a, b): return a b compiled_add torch.compile(simple_add) out compiled_add(x, x) print(torch.compile ok:, out.shape)如果這個(gè)腳本全綠那說(shuō)明環(huán)境基本可用如果哪一步紅了就跟著堆棧信息去查對(duì)應(yīng)依賴(lài)。每次跑到全綠我才會(huì)開(kāi)始正式的模型優(yōu)化工作。這套流程幫我省去了無(wú)數(shù)次“改了模型卻不知道是環(huán)境問(wèn)題還是代碼問(wèn)題”的無(wú)謂排查。這篇筆記從torch.compile的內(nèi)部機(jī)制講到Triton如何生成GPU Kernel再對(duì)比了XLA這條跨硬件編譯器路線最后落到工程環(huán)境里的落地實(shí)踐。這些內(nèi)容都是我實(shí)際跑模型、調(diào)GPU、被各種版本和Graph Break折騰完之后沉淀出來(lái)的。按我自己的經(jīng)驗(yàn)真正理解這三條主線之后你再去看PyTorch相關(guān)的性能優(yōu)化問(wèn)題視角會(huì)和以前明顯不一樣——不再只是調(diào)幾個(gè)參數(shù)看數(shù)字而是能判斷瓶頸在哪一層、哪條優(yōu)化路徑最適合當(dāng)前場(chǎng)景、換了硬件后又會(huì)發(fā)生什么變化。這一篇先寫(xiě)到這第十五篇打算展開(kāi)聊聊分布式訓(xùn)練里通信和計(jì)算的流水線重疊那個(gè)方向也是我們生產(chǎn)環(huán)境里吃了不少苦頭才摸清門(mén)道的話題。
返回列表
PREV
查看更多資訊
NEXT
返回資訊列表
少妇天堂| 亚洲丝袜诱惑| 2020视频1区2区3区| 日本3级一区二区免费| 麻豆这里只有精品| 亚洲春色激情小说| 国产天天骚| 国产二区三区粉嫩在线| 亚洲骚男同com| 久久99干一本高清| 99色网| 99久久精品无码一区二区毛片免费| 亲子敌伦对白在线播放| 激情熟女12P| av天堂5| 大香蕉AV在线| 老熟妇综合| 女人18精品一区二区三区| 九九人妻| 欧美极品| 精品国产综合久久福利,热99这里有精品综合久久,99热这里只有免费国产精品,精 | 青青伊人加勒比海| 精品国产一区二区三区久久久蜜臀 | 夜夜操夜夜爽夜夜高潮| 97超碰色屌| 激情五月婷| 亚洲色图国产另类| 欧美日韩制服| 亚洲欧美国产va在线| 天天看,天天做| 国产精品视频麻豆入口| 插穴性爱视频在线观看| 日韩乱伦影音先锋| 久久极品伊人| 97超碰逼| 熟女熟妇伦久久影院毛片一区二区 | 淫淫综合网| 国产av色网| 蜜臀久久99精品久久久久久酒店 | 成人精品久久| 欧美综合91| 精品久久无码午夜福利| 伊人国产成人av网站| 美女黄页网站| 搡老熟女免费视频| 五月天社区| 亚洲少妇色| 精品中文日韩字幕视频| 好爽视频在线观看视频| 美国人人操人人操| 日本午夜久久电影| 天天综合网入口~91| 色综合超碰超| 亚欧毛片基地国产毛片基地| 人妻精品一区二区在线| 天天内射| 91P0RNY大屁股人妻| 成人乱人伦一区二区| 日本福利二区视频| 亚洲一二三| 青青草好吊色| 夜夜一区二区| 人妻久久| 操操碰| 乱理日韩中文| 国产高清自拍视频| 久操婷婷| 国产精品96久久久久久| 激情久久av一区av二区av| 超碰97男人| 欧美精品久久96人妻无码| 亚洲另类在线观看| 最新AV在线| 99热在线播放| 在线天堂资源亚洲| 2018色综合天天操| 欧美日韩婷婷中文| 欧亚性爱视频免费看| 99热这里都是精品| 97色欧州| 五月天丁香| 久久女人视频| 性色国产东北露脸精品视频| 大乔未久88一区| 欧美偷拍区| 嗯啊啊啊轻点视频 | 国产一级作爱毛片| 青青草一区二区高清无码视频 | 国产精品69久久久久久久| 8050午夜少妇无码| 少妇熟女一区二区三区| 亚洲少妇色图自慰直播| 久久久久久中文字幕中文字幕最新| 国产91影院| baiduhicn.com。| 五月婷久久| 欧美亚洲情色| 亚洲人妻色图| 欧美综合制服在线| 伊人色综合超碰| 亚洲第一在线视频| 99无码狠狠久久| 中文字幕精品专区搜索结果91| 天美麻花大全视频| 亚洲中文一区二区三区| 少妇综合| 69一区二区三区| 国产第二页| 人夜夜精品网站香蕉嫩草| 国产福利电影| 2019午夜福利视频| 人妻在线中出视频| 91女网站| 欧美成人色| 亚洲国产成人高清在线| 久久‘黄片视频| 四虎884a| 玖玖人人爱| 亚州宗合另类| av一区二区三区 中文| 尤物网站91| 伦理第一页| 五十路熟女工口 | 久久久久骚| 色色综合网站| 丁香九月激情| 日韩欧美亚洲一区二区三区影院| 日本日逼高清| 亚洲第一男人天堂| 九热超碰| 四虎在线视频| 日本女人久久久| 少妇三p| 风间由美日韩欧美久久| 日本不卡一区二区| 少妇色欲综合网2| 天天摸天天舔天天操| 老熟女熟妇| 亚洲国产一级中文综合久久天堂在线免费观看 | 超碰97首页| 国产情色第一第二页在线观看| 欧美大码在线视频| 亚洲欧美另类少妇精品| 国产青青美女玩逼视频| 亚洲自拍欧美色综合| 国产99999久久精品| 天天热精品| 日韩精品人妻中文字幕久久久| 亚洲综合码| 欧美猛交黑寡妇中文字幕| 97精品久久久久中文字幕| 粉嫩久久久久| 97免费在线视频| 国产亚洲精品A在线观看下载| 2019精品国产无码成人| 超碰在线成人| 亚洲欧洲视频小说在线观看| 婷婷性爱| 日日不卡av| 亚洲一区二区三区AV无码| 日韩 欧美 校园一区| 超碰2017| 欧美性特| 亚洲欧美高清| 日本精品人妻少妇一区二区| 欧美 亚洲 第一页 | 国产成人精品亚洲日本| 欧美最大综合网| 亚洲精美粉嫩嫩泬在线观看 | 精品人妻一区二区免费蜜桃| 久久精品熟妇丰满人妻99| 五月天婷婷欧美三区| 97欧美超碰| 二区熟妇韩日| 国产一区二区三区导航| 亚洲无码偷拍| 2020中文字幕在线| 高潮内射在线| 久久黄黄| 久久精品国产精品一区| 日本狂喷奶水在线播放212| 操逼视频免费日韩无码| 夜夜爽爽夜夜精品视频| 乱伦一二三区| 果冻传媒一区二区三区| 欧美视频边做饭边橾| 无码99| 插插综合网天天影视网| 95自拍视频在线观看| 天天插天天操| 欧洲自拍第一页| 人妻性爱一区二区| 大香蕉欧美伊| 国产精品视频电影| 日躁天天爽爽| 91大胆欧美| 欧美少妇色图| 综合网欧美在线| 少妇激情AV| 亚洲成人美女无吗| 深夜激情 | 69视频福利导航| 午夜爽爽爽| 亚洲一二三精品久久网 | 日韩99精品视频综合区| 天天摸夜夜操视频| www老逼91| 无码78| 色九九综合| 久久精品99| 思思热影视| 欧美综合制服在线| 偷拍三区| 9 9无尺码天堂网| 亚洲天堂资源网| 欧美熟女妇同| 伊人AAA| 99热免费精品| 久草国产在线视频| 国产精品九9| 岛国福利在线精品播放| 国产传媒1234区| 伊人影院中文字幕| 色吧五月| 蜜桃av综合网发布| 亚洲九月丁香| 人人贴人人摸| 国产精品com| 夜夜嗨一区二区三区三州加勒比 | 91九九九小逼| 亚洲国产一级中文综合久久天堂在线免费观看 | 97国产超碰| 欧美另类天堂| 久久爽爽精品| 天天干夜夜肏| 韩国嫰模上门援交视频| 欧美综合色综合| 97这里都是精品| 不卡码视频| 超碰99在线观看| 国产超碰| AV一二区| 蜜臀久久久国产| 东北女人| 亚洲第一男人天堂| 友优传媒精品在线一区二区| 91色婷婷综合久久中文字幕二区| 九九久久久| 997色在线| 大香蕉伊人75| 做爱A级亚欧| 99精品在线观看| 丁香六月啪| 中文字幕老熟妇黄色视频| 国产日韩精品一区二区三区| 国产精品久久妻无码网站| 欧美gv在线观看| 伊人网青青| 黑人嘿嘿嘿超爽免费视频| 妺妺跟我一起洗澡没忍住| 日韩无码成人电影| 97日视频| 亚洲图片欧美| 国产福利精品最新在线| 美日韩一卡二卡三卡免费人妻精品| 品亲网欧美品亲网| 亚洲全色网| 青娱乐国产盛宴视频| 蜜臀久久一区二区| 蜜桃臀av一区二区| av无码精品久久久久| www.久久最新地址| 麻豆九九九| 偷拍盗拍亚洲色图图片| 超碰久热| 欧美日本不卡| 国产精品无套内谢| 欧美狠狠弄| 天天噜| 色噜噜精品一区二区三| 日韩少妇丰满亚洲| 男人女人18禁片免费看网站| 久久久久13| 91精品久久久久久77777| 婷婷在线视频| 97人人爱人人乐| 日韩精品大香蕉伊人在线| www久久99| 无码九九| 欧洲欧美视频一区二区| 最新国产亚洲精品精品国产亚洲综合| 日韩欧美视频青青| 白嫩白嫩的午夜九久久久久久久久久久久成人剧场| 亚洲视频精选| 97人人干| 欧美日韩另类激情图片| 激情五月天网| 国产精品丝袜在线| 91黑丝在线播放| 亚洲男人天堂2013| 日本狂喷奶水在线播放212| 日韩啪啪啪啪啪| 综合大香蕉美。| 四虎国产精品永久地址入口| 中文字暮97| 久久αⅴ| 啪啪啪精品视频| 欧美色日本| 日韩熟女乱伦中出| 天堂蜜桃无码视频一区二区| 精品一区二区三区国产| 青青草视频久久久久| 国产精品原创巨作?v网站| 97这里都是精品| 国产97视频免费观看| 成人国产视频在线观看| 九九九九九精品十六| AV网站高清无码在线观看| 欧日韩一二三f区| 女人的久久久| 久久久精品中文字幕麻豆| 韩日自拍| sewuyueav| 国产精品一级毛片不卡视| 精品十八在线观看| 久久大香蕉手机高清视频| 丝袜视频网国产90| 美国aaaaa一级黄片| 国产伦精品一区二区三区在线观| 欧美综合 站| 91亚洲丝袜| 国产Av超碰| 综合网色| 九久久九九久视频| 热久久国产| 高清不卡视频| 日韩青久久| 伊人国产成人av网站| 黄aaaaaaaaaaaaaaaaaa色网站| 91丨九色丨东北熟女| julia ann久久| 久久大黄片| 尤物av网站| 欧美性爱无码一区二区三区| 日韩99精品视频综合区| 99av| 操逼网站网站| 黄色操人| 凸凹视频在线观看| 一级二级三级黑人无码| 黄色免费网| 日本性爱少妇| 久久国产在线一区二区| 天天澡天天爽日日av| 成人一级二级| 久久久久久午夜男人的天堂| 91九久| 狠狠躁伊人中文字幕| a在线视频免费观看| 色香欲天天天天综合色| 性生活性生大爱77AV国产 | 超碰天天操你比| 丰满少妇一区二区三区专区| 国产毛片久久久久久久| 久久精品日韩| 91老熟女91老女人| 加勒比综合88| 激情四射婷婷四五月天| 欧美 亚洲精品首页| 黄片免费日韩| 97视频620| 日韩中文字幕宗合在线| 快播久久人人aV| 欧美日韩在线视频网站| 国产亚州精品美女久久久免费| 人妻熟女av国产网站| 久久激情综合| jiujiujiujingpin| 色欲av国内精品久久久久久| 日本三级一区二区 在线| 97人肏| 另类图片五月天| 色欲无码人妻日韩欧美精品| 999狠狠综合| 亚洲诱惑天堂 | 99亚洲国产精品色一区二区三区| 99精品欧美一区二区三区桃色| 天综合网| 亚洲AV永久无码精品成人调教| 国产黄色影片在线观看| 夂久色| 少妇熟女视频一区二区三区| 乱性AV| 岛国在线一区二区三区| 无码伊人久久大杳蕉中文无码| 中文字幕精品资源在线| 人人贴人人摸| 天天操妹子| 亚热日本熟女| 中文操嬖片。| 超碰在线人人射| 婷婷九月| 日本一二区免费| 人妻爽爽啪视频| 思思久热在线精品66| 日本三级网页| 青青草乱入乱欲视频在线观看| 精品人妻一区二区免费蜜桃视频| 香蕉欧美| 美女黄页| 91性色| 久久久久久久9| 色婷婷色99国产综合精品| 综合av影片| 国产日韩精品无码去免费专区国产| av九九| 麻豆天美AV传媒第一页| 日韩国产在线观看av| 操死我了嗯嗯嗯| 人人干人人操人人爱| 黄页大片在线观看| 色激情综合网站| 麻豆天美电影一区二区| 美女啊啊啊啊啊| 亚殴在线| 久久久久亚洲av综合波多野制衣| 久久草在线综合视频| 精品久久久久成人码免| 人妻精品视频一区二区| 欧美性91| 男人网站婷婷| 精品久久人妻成人网| 天天操妹子| 加勒比无码一区二区三区| 国产日韩久久| 美性中文综合网| 夜间福利片1000无码| 久久精品六区| 高潮内射在线| 日韩欧美亚洲一区二区三区影院| 91少妇香蕉久久精品| 亚洲欧美在线观看免费| 超碰97久| 超碰天天操| 内射老妇BBWX0C0CK| 九九免费影片| 污污污8888| 人妻天堂综合网| 精品无码一区二区三区| 情趣丝袜无码操逼视频| 97伊人超碰| 亚洲天堂综合AV| 综合色图区| 亚洲影院无码在线| 亚洲国产精品无石码久久| 偷拍在线观看视频| 九九毛片这里只有精品| 操逼日韩无码| 污污汅18禁网站在线永久免费观看| 舔人妻中文免费视频| 欧美 青青草| 欧美婷婷五月天| 国产精品人妻无码久久久老鸭窝| 免费观看日本操逼视频| 精品无码人妻一区二区免费蜜桃| 加勒比AV网| 亚洲日韩美女中文字幕乱| 强被迫伦姧在线观看无码网站| 精品人妻一区二区三区夜夜| 日本99一区二区| 久久熟妇五十路一区| 久久手机视直播| 欧美综合骚| 久久久久密| 精品久久在线区一区| 啊啊啊啊啊好舒服视频| 欧美极品女人的天堂| 国产精品91一样| 怡红院成人av| 精品无码久久| 中文字幕日韩专区精品系列 | av在线一区二区三区| 午夜精品久久久久久久99蜜桃一| 99这里只有精品| 狠综合网| 97啪啪| 黄色欧美性爱视频| 天美传媒国产原创中文字幕亚洲欧美另类 | 亚洲综合大片| 98人妻精品一区二区色欲| av在线免费一区二区| 在线观看一卡二卡| 曰本道人妻久久久在线不卡色视频| 少妇熟女一区二区三区| 少妇一区二区三区高速| 精品一区二区三区蜜桃臀赵总 | 亚洲国产一区二区三区四区国产| 日韩精彩免费| 在线a亚洲视频播放在线| 四虎精品亚洲| 色欧美色交综合| 欧美天天在线| 激情五月婷| 17c嫩草51久久91嫩草| 2019午夜福利视频| 欧亚日本情色| 性色高清..……| 人人透人人操| 久久精品一区二区三区蜜桃臀| 天天cao在线| 中文字幕诱惑制服人妻丝袜美丝袜美| 免费农村成人少妇人妻Aa一区二区视频 | 97频视在线| 插老姨肥穴| 久久婷婷五月天| 五月天婷婷色| 青青草乱入乱欲视频在线观看| 99精品伊人| 亚洲国产综合图区中文字幕| 国产无码成人无码| 国产sv美女内射| 91精产一区二区三区| 后入福利视频| 亚洲情色 自拍| 日日夜夜草草草| 2011国产精品| 亚洲素人综合| 日韩熟女视频二区| 久久日本熟女精品一区| 五月婷婷综合在线| 91在线无码精品秘 软件| 欧美熟女妇同| 韩国一级婬片A片AAAAA| 91n处女在线观看| 激情99| 玖玖久久久| 高凊专区人人操| 91东京热男人的天堂| 999九九九九国产动| 韩国黄色片精品久久久| 超碰97护士| 欧亚乱色熟一区二区三四区| 国产精品久久久久久久电影渣男| 久久妇| 99成人| 日本操色导航| 亚洲天堂精品日韩电影| 亚洲官网在线| 亚洲成人网站在线观看| 国产搭汕a级片| 丰满翘臀美女影院视频| 国产剧情AV不卡在线观看| 麻豆天美传媒毛片| 天操天操夜操夜月操月年年操操| av网页一区二区三区| 蜜臀99久久精品久久久久| 久久九九99| 91天射| 国产人妻精品久久久一区二区三区 | 麻豆天美国美国产| 亚洲天堂一区| 又摸又舔在线观看网站| www..com操老师| 亚洲极品| 精品人妻一区二区三区-国产精品| 东京热视频网| 福利偷拍视频-中文字幕2019国语完整视频大全-S91AV | 一起草视频在线| 国产综合久久久鬼色| 99色综合| 精品国产乱码久久久久久久久1| 欧美综合综合| 亚洲天堂无码| 国产精品内射婷婷一级二| 无码男人天堂| 操我啊啊啊啊啊| 国产高清在线观看欧美| 九九九免费视频| 中文字幕乱偷人妻久久艾草网| 禁片 高清 在线观看视频网站| av天堂精品久久| 国产三级在线现体验区| 青青免费在线视频一区| 亚洲砖码砖专无区2023| 九九成人视频| 日韩av性爱在线播放| 欧美九九九| 欧美亚洲厕所精品偷拍91| 久久25| 久草久热| 操死我干死我| 久久久穴999| 午夜天堂啪啪| 国产AV激情无码久久无码| 国产一区二区三区高清视频| 国产一级内射高清视频 | 制服丝袜第二页| 99这里只有精品| 99热久| 天天精品| 涩涩五月天| 丰满少妇乱子伦精品无| 欧美精品久久久久久久久88| 无码少妇精品一区二区60岁老人| 五月婷婷激情网| 99色在线| 狠肏骚人妻| 亚洲AV不卡在线观看| 九九九九一区| 国产午夜精品理论片a大结局| 日本国产亚洲一区在线观看| 黄色大片免费在线| 麻豆啪啪啪视频| 国产少妇内射| av草草在线电影| 男人天堂新| 久久在肏| 97人人操人人摸| 俺去俺来也在线www| 中文字幕啊啊啊在线观看视频| 97国产色综合| 中文字幕欧洲有码| 麻豆国产精品午夜视频| 影音先锋国产精品| 欧美色图天堂网m| 国内外激情在线| 老子午夜伦不卡影院| 人人操av| 亚州国产成人精品女人久久| 日本一级真人黄色性爱视频| 亚洲综合中文字幕有码| 色噜噜国产在线| 97超碰9| 久久一区二区高清免费| 国产高清不卡视频| 玖玖综合网| 久久曰曰| 69综合网| 日本乱人伦片中文三区| 东京热男人的天堂网| 老鸭窝成人| 色情乱伦AV| 日韩人妻丝袜美腿中文| 国产多人在线观看视频| 香蕉一区二区三区在线视频| 欧美成人精品欧美一级乱黄一区二…| 亚欧无码在线| 久久伦理视频久久大香蕉视频| 老女人综合网| 裸体女人草逼视频播放一区,二区,三区,四区,五区 | 亚洲熟女乱色| 国产精品亚洲一区二区三区四区| 亚洲图片欧美色| 破苞ⅩXXX性无码动漫无码| 日日黄色三级网站| 高潮毛片无遮挡高清免费| 一区二区三区男女操逼黄色小电影| 成人性交免费视屏| 欧美不卡在线美女| 成年人黄色视频免费| 99这里有精品| 综合九九| 九九热精品| 91精品国产91综合久久蜜臀| 欧美色图偷拍另类| 色情乱伦AV| 亚洲97资源| 日本久久久久久久久| 成人一二三区| 国产婷婷一区| 99精品丰满人妻无| 东京热激情视频一二三区| 91爱欧美| 99999国产精品| 精品视频久久久久九九九九9999| 欧美不卡五十路| 国产无码成人无码| 欧美日韩婷婷中文| 99久视频| 国产成年女黄特黄| 日韩八十路老熟女| 后入 亚洲 美女 射| 亚洲精品人妻在线| av2014 日韩在线中文字幕| 日韩免费簧片| 91色色综合| 厕所偷拍在线| 色五月婷婷在线| 久草网站免费在线观看| 国产呦精品系列在线观看| 综合天天。| 亚州色图欧美| 澳门人妻久久| 人妻久久久久久久久久久久久久久 | 在线五区| 裸体1区| 欧美老妇女内射网址| 亚洲图片偷拍视频区| 国产成年女人免费视频播放a| 天天干人人乐| 91欧美网| 国产女大学生AV| 亚洲av综合伊人久久| 欧美呦呦性爱| 九九综合久久| 成人欧美一区二区三区黑人一| 日韩午夜啪啪视频| **一级毛片国产| 国产精品宅男免费| 亚洲二区精品在线观看| 欧美午夜一区二区三区| 亚洲成a人在线观看久| 翔田千里无码一区| 69人妻人人揉人人躁人人精品| 天天插夜夜操| 六六久久日韩不卡| AV久日| 成人精品久久久午夜福利| 麻豆天美久久91| 亚洲人成网站7777| 久久成人国产| 婷婷五月综合激情| juliaann丝袜大战黑鬼| 91久久精品美女高潮喷水| 欧美日韩资源| 国产92麻豆天美精品色欲5| 另类图片五月天| 国产久久日| 99无码狠狠久久| 亚洲AV无码成人精品久久| 嫩草 人人网精品| 美女91AV| 色色色五月婷婷| 亚洲欧美啪啪| 91成人在线免费视频| 国产中出内射一区二区| 人人妻人人澡人人爽久久av| 中文字幕国产| 性生活无遮挡纯毛片在线看| 亚洲不卡三级手机播放| 超碰亚洲97| 99热在线播放| 日本在线不卡一二区| 国产精品3| 亚洲好看强奸乱伦| 国产AV人人 夜夜人人澡| AAAA欧美日韩| 欧美老妇女内射网址| 人妻一二三区| 天天插天天操天天摸天天射天天看| 韩国一级做a久久久久| 1区2区3区在线视频| 黄色不卡视频| 亚洲AV成人无码久久精品播放| 大鸡巴久久| jiujiujiujingpin| 亚洲综合网图| 色图四区| 殴美性色a级欧美| 国产精品白领在线观看| 九九久久首页| 国产女人和拘做爰视频| 国偷自 一区| 少妇一线天久久久久久| 婷婷伊人五月| 骚妻少妇精品性色无码四色A V| 久草免费在线一区二区| 一二三区精品视频| 色婷婷久久综合超碰| 国产精品秘 福利姬在线观看| 日韩欧美女求操每天更新| 有码免费观看| 9999免费精彩视频| 一二三四视频中文字幕在线看| 国产乱青青草久久| 国产人伦精品一区二区三区| 亚州 综合 色图| 久久精品国产亚洲AV片多多| 麻豆伊人网| 国产精品白领在线观看 | 亚洲精品影视老司机| 国产97av| 久噜噜| 色性综合| 操一区| 看一级特黄a大一片| 欧美不在线| 亚州精人品大香蕉| 91欧美网| 欧美综合中文| 天天射夜夜| 青青操少妇| 欧色综合| 韩国女主播青草福利视频| 99久久久久| 天天干人妇| 一区二区娱乐网站| 亚洲精品中文字幕一区在线视频| 无码一区免费在线不卡| 屁股久久久久久| 男女啊啊啊| 97超碰美女| 友优传媒精品在线一区二区| 欧美肥臀在线| 亚洲丝袜少妇在线| 91香蕉国产尤物视频| 九九九九免费| 熟妇综合一区二区三区| 亚洲啪啪综合?v一区综合精品区| 香蕉视频精品亚洲一区二区三区在线播| 超碰97资源网亚洲| 日韩在线电影| 亚洲 欧美 精品专区 极品| 啊啊啊在线观看| 97色伦97色伦国产欧美| 超碰成人公开| 桃花色涩综合影院| 色九九九九久| 九九自拍伦理| 国产白丝网站| 人人操我人人干| 亚洲乱码尤物193YW| 九九色热| 99re在线观看| 懂色AV网| 尤物网址| www.夜夜| 夜夜嗨绯色| juliaann丝袜| 亚洲欧洲综合成人av一区| 亚洲日韩美女中文字幕乱| 日本污ww视频网站| 中文97国产| 欧美亚洲特P| 国产精品一级特黄aaa大片在线观看| 女人午夜视频777| 97资源超碰| 99少妇| 亚洲 自拍偷拍 欧美| 人妻少妇色综合| 天天热精品| 色欲三区| 顶级少妇BT天堂| 一本大道青青| 熟妇操花| 中文字幕一区二区三四五区日日骚| 麻豆熟妇乱妇熟色A片在线看 | 亚洲国产精品无石码久久| 国产午夜无码片在线观看影视 | 啊啊啊啊啊啊啊啊在线观看| 国产又大又硬又长又粗| 歐美性天天| 欧美性爱第一区| 美女主播色欲91抠b在线播放| 91人妻熟女| 亚洲男人天堂Av| 91亚洲在线| 天天综合网~69| 2020久久免费视频| 理论久久婷婷网 8| 亚洲欧美另类激情小说| 亚洲影视综合网| 精品免费视频国产一区| 怡红院怡春院| 中文字幕精品一区二| 久艹视频在线| 国产有码一区| 亚洲不卡一| 中字乱伦AV| 亚洲资源站| 宅男午夜在线视频| 免费观看国产小粉嫩喷水精品午| 粉嫩粉嫩一区性色AV片| 久久视频少妇美女| 日韩不卡a级视频专区| 午夜亚洲| 少妇一区二区三区在线观看| 熟女这里只有精品6| 夜夜免费视频| 亚洲 欧美都市激情| 久久透逼视频| 超碰偷拍| 人人操天天爽| 日本性爱少妇| 国产 日韩,欧美 自拍| 91精产一区二区三区| 丁香五月天社区| 在线播放一级无码视频| 超碰色图| 1.igao73.com 加入收藏 免费专区 国产精品 中文字幕 日韩精品 欧美精品 精彩 | 国产强奸91| 91N综合网| 久久一本大香蕉| 国产人妻精品久久久一区二区三区 | 操九九九九九九| 欧美三级中文字幕hd| 波多野结衣之双飞调教在线播放 | 成在线人在线观看视频| 热热色91| 狠狠97| 精品美女久久一二三| 色嘟嘟人妻天堂网| 夜夜肏2021| 久久婷婷综合国际产色怕| 操操逼视频| 久久久久久久强迫| 超碰97久久| 亚洲熟女诱惑| 无码78| 熟妇视频一区二区三区在线| 久久蜜桃一区二区| 一区二区三区四区在线不卡| 91爱看| 久草老司机| 碰人碰碰人人开房人肉| 亚洲宗合网| 91美女高潮| 欧亚日本情色| 大色网久久| 日韩78m视频| 欧美玖玖爱免费玖玖| 国产精品久久久九九九| 蜜桃久久久久久久久久久久| 精品然女一区二区| 97 九色| 伊人午夜福利视频| 日韩大香蕉AV影片| 风月影院十八禁| 男人女人18禁片免费看网站| 二男一女成人A片| 中文字幕成人理论在线| 激情啪啪拍91| 伊色综合天堂色97| 91爰爱欧美| 2020中文字幕在线| 精品一久久久| 久久99网站| 三级片大波波| 国内毛片无遮挡国产| 加勒比海人人操超碰在线| 九热大香蕉| 亚洲综合春色| 欧亚综合一卡二卡中文字幕| 国产色精品午夜大片| 精品人妻免费观看| 97碰碰色| 极品出轨视频网站| 怡春院久久| 天天综合,91综合永久| 欧美亚洲激情| 1769一区| 久操 高清| 免费啪啪av| 国产特级毛片AAAAAA高潮流水 | 欧美成不卡网| 青娱乐国产精品| 国产中文字幕在线点播| 精品玖九九久| 亚洲91射| 日本Suv精品一区二区| 九99久久| 久久爱97| 精品熟妇视频一区二区| 中文字幕123| 欧美一二三| 黄久在线| 欧美亚洲第1页| 天天综合,91综合永久| 欧美激情综合| 综合色播| 色五月婷婷中文字幕| 亚洲国产欧美中文永久| 国产色精品午夜大片| 99国产在线 精品 视频| 欧美v亚洲v综合v国产v妖精| 97久久国产精品女不卡| 九九热av| 秋霞蝌科网日本一区| 亚洲男人综合| 国产一级高跟丝袜| 成全动漫视频观看免费下载| 五月天久久综合网| 日本Xx性爱| 九九性爱网| 久久久工口| 熟女天天干| 久久久久久久综合,国产| 91第一页| 成年无码动漫av片无尽在线| 欧美真人抽搐一进一出gif| 性在久久久久久| 中文字幕精品资源在线| 亚洲欲色9532548967一区| 美女诱惑在线一区| 一二三区精品视频| 日本丝袜人妻内射| 色婷视频| 亚洲偷拍欧美激情| 亚洲男人综合| 国内三级自拍小视频在线观看| 亚洲精品97在线| 夜夜嗨一区二区三区三州加勒比| 精品国产乱码久久久久久网站入口| 色官网色综合| 99无码精品| 色亚州人久干视频在线观看免费版| 五月丁香激情四射| 97碰在线视频| 亚洲 欧美 日本 国内 首页| 99e久久国产精品| 婷婷综合久久| 一本大道久| 秋霞成人一级在线观看| 欧美三级一级| 欧美黄色手机在线观看| 久久五月婷| 亚洲AV在线资源| 亚洲美女自拍偷拍视频| 亚洲揄拍网| 欧美日韩国产高清在线一二三区 | 综合欧美日韩在线| 干干干天天| 美骚妇av高清在线| 91人妻最真实刺激绿帽| 1区2区3区中文字幕日韩| 人人性爱视频免费| 大香蕉欧美日韩| 亚洲精品无码久久AV| 亚洲熟女乱综合一区二区三区| a片久久久久久久久久久久| 国产又大又粗又长视频在线| 亚洲精品免费中文字幕| 91爱做| 人人操人人狠狠操| 60秒免费小视频| 五十路三级片| 91老司机视频| 综合色图亚洲欧美| 国产精品4p在线观看| 99re综合伊人| 丁香五月天视频| 国产一区二区免费福利片| 天堂精品| 啪啪91| 翔田千里av一区二区三区| 绯色一区二区三区不卡少妇 | 精品毛片久久久精品毛片| 99少妇| 欧美 日韩 婷婷 五月| 任你草| 久久黄色视频一区二区三区| 国语少妇精| 中文字幕欧美日本乱码一线二线| 丝袜AV一二三区| 亚洲一区中文字幕一区| WWW啪啪的com| 久久永久无码人妻视频| 久久精品国产亚洲av水密被窝| 天堂麻豆天美| 91九久| 色蜜AV| 少妇超碰在线| 蜜乳AV一区二区三区四| 思思热er精品视频| 99精品视频在线观看免费| 男人的天堂2010| 91九色精品熟女内射| 日本123区操B视频| 五月天色综合| 天天日天天爽| 精品久久久久,69国产成人精| 在线看免费无码AV天堂的| 久久社区一区二区三区| 亚洲二区精品在线观看| 色综合久久88色综合久久天天| 国产乱伦亚洲| 爱av免费| 成人性爱全视频观看| 黄色欧美性爱视频| 99色视频| 中文字幕 码 自拍 视频 区| 五月天婷婷色| 婷婷色香| 天天在线91| 91国产丝袜白虎| 秋霞色色影院| 太久视频| 欧美成人午夜免费福利785| 澳门特级毛片免费观看| 欧美色九九九| 91女优在线观看| 殴美综合色88| 尤物视频偷拍免费| 97综合| 国产aⅴ无码片毛片一级网站| 欧美黄片视频在线观看免费| 视频在线观看一二三区| 欧美精品,四区。五区| 成人五月天丁香激情综合| 国产一区二区三区影片| 日本女厕偷拍| 黄色不卡视频| 国产日韩中文字幕欧美| 日日骚中文字幕| 欧美精品久久久久久久久88| 久久久久性熟视频| 激情文学亚洲| 加勒比在线视频一区二区三区 | 伊人久久大香线综合无码| 亚洲高清自拍| 国产精品熟女乱伦| 天堂综合| 岛国视频免费在线观看| www.AV有限公司一区| yiqicaoav| 91在线页| 1769成人国产精品视频| 久久五月天婷婷| 国产丸一视频| 欧美成人性爱视频大全| 久久中文字幕女同性恋一区| 囯产精品一区二区三区线|亚洲人成无码网WWW动漫|国产精品免费一级... | 91亚洲最新在线| 在线色导航| 91国产丝袜美女| 久久直播国产| 国产综合操逼高清| 日韩BBN| 97色婷| 一本色道久久综合亚洲二区三区| 思思热免费视频观看| 久久蜜桃一区二区| 欧美色图天堂在线| 亚州欧美一区| 日韩激情啪啪啪| 欧美综合自拍亚洲综合图| 99视频内射三四| 免费试看60秒| 亚洲永久AV无码精品秋霞| 操逼操网| 免费在线视频97| 欧美精品另类人妖xxxx| 日韩AV噜噜噜一区二区三区四区| 久99久视频| 啊啊啊啊操死我| 自拍亚洲综合| 超91综合网| a天堂视频| 91成人18| 俞拍自拍| 免费网站观看www在线观| 亚州操逼网| 免费观看成人www精品视频| 亚洲自拍小说| 中出在线视频| 久久超碰97中文字幕| 亚洲国男人的天堂| 免费视频无码| 国产亚洲在线| 国产精品极品美女视频|