決策模型)
什么是JEV-27B-VL10分鐘搞懂System 1秒級判斷System 2深度思考的雙系統(tǒng)決策模型【免費下載鏈接】JEV-27B-VL項目地址: https://ai.gitcode.com/hf_mirrors/autotrust/JEV-27B-VLJEV-27B-VL 是一款開源的多模態(tài)雙系統(tǒng)決策模型System 1 單次前向傳播即可完成秒級判斷為每個選項輸出校準(zhǔn)概率System 2 則由同一個 27B 模型逐步深度思考處理難題。它基于 Qwen3.8-27B 底座帶視覺能力一條命令即可用 vLLM 本地部署。一個模型兩套大腦JEV-27B-VL 架構(gòu)速覽傳統(tǒng)大模型只有一種回答方式要么快但糙要么慢但細。JEV-27B-VL 借鑒了人類認知科學(xué)的雙系統(tǒng)理論把兩種能力裝進同一個模型里系統(tǒng)接口你得到什么典型耗時System 1直覺判斷POST /v1/decide是/否、2~256 選 1、0~5 打分每個選項一個校準(zhǔn)概率文本圖片都能判約 0.1 秒System 2深度思考/v1/chat/completions完整的 Qwen3.8-27B 輸出可選逐步推理支持看圖數(shù)秒關(guān)鍵點在于System 1 不是一個小模型而是同一個 27B 模型掛上一個輕量 LoRA 適配器 決策頭見 adapter_vllm/ 目錄。所以它秒級出決策的同時底層知識和視覺理解能力與 System 2 完全一致支持 256K 上下文。System 1 秒級判斷一次前向傳播給出校準(zhǔn)概率System 1 解決的不是聊天而是決策。它只支持三種標(biāo)準(zhǔn)題型kind字段noul是/否返回[false, true]兩個概率例如判斷一張圖是否展示食物choice多選一一次給出 2~256 個選項各返回一個概率150 個選項的意圖分類也能一次問完score打分0~5 分制評分。為什么說它的概率可信因為在公開測試集上它的期望校準(zhǔn)誤差只有 0.0009見 calibration.json 里的逐類溫度與 adapter_vllm/decision_head.json 里的偏置參數(shù)——模型說83% 把握實際就有大約 83% 對。這意味著你可以直接設(shè)定業(yè)務(wù)閾值概率高就自動執(zhí)行概率低就升級給 System 2 或人工而不只是取概率最大的那個選項。System 2 深度思考置信度不夠時自動轉(zhuǎn)人工這是雙系統(tǒng)最實用的地方——按需思考System 1 先答置信度 ≥ 0.70 就直接采納中位耗時 0.1 秒置信度 0.70 的問題升級給 System 2讓它看圖、逐步推理。效果GSM8k、AQUA-RAT 等四個數(shù)學(xué)/常識基準(zhǔn)70% 的問題 0.11 秒答完整體準(zhǔn)確率從純 System 1的 0.792 提升到0.892無限接近每題都深度思考的 0.917但速度快了幾個數(shù)量級。實戰(zhàn)應(yīng)用從機械臂控制到 AI 評委JEV-27B-VL 的看圖出概率能力在多個真實場景里打過硬仗機械臂與電腦操作實時控制循環(huán)每一幀攝像頭畫面或截圖進來System 1 輸出下一步動作的概率分布單次決策約 240ms機械臂抓取放置MuJoCo 仿真20 個隨機場景中完成75%JEV 家族最佳真實瀏覽器操作60 個多步任務(wù)完成95%平均 0.26 秒/次點擊。過程錄屏在 videos/ 目錄機械臂、瀏覽器購物Super Mario、魔方、俄羅斯方塊等游戲控制同樣每一步都只是一次 System 1 決策約 46~300ms。逐回合數(shù)據(jù)見 reports/demos/。零樣本短視頻推薦一張封面解決冷啟動TikTok 類信息流要判斷這個用戶會不會看這條新視頻。JEV-27B-VL 只看用戶最近看過的 5 張封面 1 張候選封面一次前向傳播給出觀看概率——不需要任何點擊日志、不需要訓(xùn)練在 MicroLens 真實平臺上它 AUC0.727與從 59,045 名用戶行為中學(xué)出來的協(xié)同過濾0.728打平Top-5 命中率反而更高59% vs 49%。新視頻上傳的第一秒就能被推薦——這是協(xié)同過濾做不到的。AI 評委多模態(tài)評委與 Agent 評委大模型訓(xùn)練、Agent 評測都需要裁判。System 1 把哪個答案更好變成一次判斷多模態(tài)評委VL-RewardBench1247 組人工校驗對78.3%總體準(zhǔn)確率超過榜單上全部 26 個模型含 GPT-4o 的 65.8%2494 次判斷單卡僅用 163 秒Agent 評委Plan-RewardBenchACL 2026判斷工具型 Agent 兩條軌跡哪條更好73.2%宏平均準(zhǔn)確率位居論文榜單第一GPT-5 為 68.5%Agent 任務(wù)驗收AgentRewardBench1302 條專家標(biāo)注軌跡在同一召回率下精確率高于官方榜單全部 16 個評委。文本決策新聞推薦、幻覺攔截、搜索重排沒有圖片的任務(wù)它同樣能秒判新聞推薦 AUC0.642超過在數(shù)據(jù)上訓(xùn)練過的 LightGBM幻覺攔截把System 2 答題的 71% 準(zhǔn)確率提升到96.4%只答它信任的那一半搜索重排 nDCG10 達 0.858。快速上手兩條命令本地部署vLLM 推理硬件要求單張 80GB 以上顯存的 GPU。hf download autotrust/JEV-27B-VL --local-dir JEV-27B-VL bash JEV-27B-VL/serve.shserve.sh 會啟動標(biāo)準(zhǔn) vLLM OpenAI 服務(wù)并額外掛上POST /v1/decide接口由 serve_decide.py 實現(xiàn)。啟動后System 1curl localhost:8000/v1/decide傳{kind, state, question, options}state 里可混入圖片System 2直接調(diào)/v1/chat/completions模型名autotrust/JEV-27B-VL。?? 一個必知的坑serve.sh 固定了--max-num-seqs 8。超過 8 條并發(fā)序列時該多模態(tài)模型的 LoRA 路徑會返回錯誤的 System 1 概率——這個參數(shù)不能省。倉庫目錄結(jié)構(gòu)速查與配置文件說明路徑說明README.md模型卡片完整基準(zhǔn)、快速開始、提示詞寫作指南serve.sh / serve_decide.py一鍵啟動腳本與推理服務(wù)源碼adapter_vllm/System 1 的 LoRA 權(quán)重與 decision_head.json選項 token、偏置calibration.json各題型校準(zhǔn)溫度保證概率可信config.json底座 Qwen3.8-27B 架構(gòu)64 層、256K 上下文、視覺塔reports/demos/機械臂、電腦操作的逐回合實驗數(shù)據(jù)videos/游戲與機械臂決策演示視頻blog/JEV-27B-VL.md官方發(fā)布博客含全部實驗細節(jié)總結(jié)為什么值得關(guān)注 JEV-27B-VL一句話概括JEV-27B-VL 把決策從聊天里拆了出來。System 1 用約 0.1 秒給出可設(shè)閾值的校準(zhǔn)概率System 2 兜底深度推理兩者共用一個 27B 底座還附帶視覺能力——機械臂 240ms 一步、推薦系統(tǒng)零冷啟動、AI 評委超越 GPT-4o。權(quán)重開放Apache-2.0見 LICENSE兩條命令就能跑起來是目前決策模型 雙系統(tǒng)方向里完成度最高的開源方案之一。【免費下載鏈接】JEV-27B-VL項目地址: https://ai.gitcode.com/hf_mirrors/autotrust/JEV-27B-VL創(chuàng)作聲明:本文部分內(nèi)容由AI輔助生成(AIGC),僅供參考