載入資料中…
總覽
四種情境的每 1,000 則成本
深度對齊的跨模型總表()
情境定義
成本結構
compaction 只影響 input。現況成本裡 output 佔多數,所以拿掉摘要的百分比增幅,取決於該模型的 output 佔比。
現況成本組成(每 1,000 則 USD)
移除 messageSummary
不再對每則 AI 回覆做摘要。歷史視窗仍是 4 輪,最新一則本來就以原文進 prompt,所以只有 3 則會從摘要換回原文。增幅不隨輪數變化。
增幅是否隨深度變化
全文脈絡
歷史視窗取消後,成本隨輪數線性成長,沒有收斂跡象。額外移除記憶區塊幾乎不省錢,因為記憶主要落在走快取的 system block。
每則成本 vs 對話輪數
模型比較
3.8 Flash 與 2.5 Pro 的配對比較用同一批 bench 劇情、同 6 個角色、turn 21–30。注意兩臂的 prompt 不同(Flash 為 NT V5.6,Pro 為 production 預設),差異同時包含模型與 prompt。
同深度下各情境成本(bench 配對語料)
同樣移除摘要,Flash 的百分比增幅比 Pro 大,因為 Pro 有較高比例的成本在 output。絕對金額 Flash 仍然明顯便宜。
分房結果
各聊天室的增幅
機制與證據
以下每一條都對應 floze-node / floze-prompt 的實際程式碼位置。