jev-lab

最近拿 Jev 在 AI memory 上做了一個小實驗。

我們這次沒有要讓它幫 AI 產生更多記憶,主要是想測試它能不能幫忙判斷這筆資訊到底該不該存下來。

例如原文可能只是「我們還在考慮這個方案,沒有決定」,結果準備存下來的記憶卻通靈變成「團隊已經決定採用」😅。如果沒檢查直接存,AI 下次就會把還在討論的事當成已定案。

所以這次我們讓 Jev 去檢查候選記憶有沒有原文支持、未來是否有用,以及有沒有偷改原本的不確定性。為了對照,也找了 Luna 一起跑 100 個合成案例。

在這次設定下,Jev 的判斷中位時間是 250 ms,Luna 則是 1,593 ms(包含網路時間)。50 筆值得保存的記憶中,Jev 留下 39 筆,Luna 留下 41 筆,而且兩邊都沒有觀察到誤收。

不過老實說,我更好奇的是這會怎麼影響下一次的回答。

所以我們又挑了 20 個後續問題,固定讓同一個 Luna 回答,只改變它能讀到的記憶。如果把候選記憶全存下來會造成 10 次錯答,但經過 Jev 或 Luna 篩選後,這 20 題完全沒有錯答。

只是代價也出現了,Jev 組有 8 題、Luna 組有 10 題,本來能從原文找到答案,最後卻變成答不出來 🫠。

這裡帶出一個很值得繼續研究的問題,擋掉錯誤記憶,並不代表正確的資訊就留下來了。一筆候選記憶如果理解錯原文,直接丟掉等於也失去了有用的資訊。我在想或許可以讓它回頭修正再檢查一次,不要只侷限在「存」與「不存」的二選一。

這還只是小規模的探索,案例跟標籤是 AI 寫的,不能拿來當成模型的整體排名。但我自己覺得滿有意思,想先把實驗公開,看看能不能一起把這件事想得更清楚。

細節跟具體案例都整理在 Cairn Jev Lab,網站上也有連到 Repo 的完整數據: https://lab.cairn.ink/

有在做 AI memory,或是被 AI 記錯事情雷過的朋友,大家平常都怎麼處理這類問題?歡迎留言交流取暖一下 🙌