從 ngrok 的文章重新理解 Prompt Caching

ngrok 這篇在講 prompt caching 的文章很值得看,以前做產品只會在那邊算一萬 token 要多少錢,看完才意識到,真正花錢的是一樣的開頭 prompt 你每天幾百次在重算。 ​ 它把 Transformer 裡面在 cache 的東西解釋的很清楚,不是什麼神祕黑科技,就是把 attention 的 K/V 結果存起來,下次同一段開頭 prompt 就不用重跑一遍 attention。 ​ 對有長系統 prompt、長規則、長說明書的應用來說,其實只要肯花時間重構一次 prompt,把可重用省下來,那你的 token 成本跟延遲就可以顯著下降。 做產品的人應該都有類似的經驗,模型好像可以可是雲端帳單就是很高的無力感,之前我們有用過類似的做法,所以滿推薦大家可以試試,把這種底層機制當成產品設計的一部分,而不是交給雲端廠商自動幫你通靈。 https://ngrok.com/blog/prompt-caching