判決是怎麼來的

誰在判斷好壞

不是語言模型自己的品味,也不是文學史。是館主

館主會不定期把詩放進館內,每一首都親手標上「好」或「壞」,有時附上一句為什麼。 這批詩不公開,總共 44 首(24 首好、20 首壞)。 你投進來的詩,是拿去跟這批詩比,不是跟任何公認的標準比。

一首詩進來之後

  1. 轉成向量:用 @cf/baai/bge-m3 把整首詩(含題目)變成一串數字。
  2. 找最近的鄰居:和每一首館藏算餘弦相似度,取最接近的 8 首。
  3. 相似度投票:鄰居中被標「好」的把分數往上拉,標「壞」的往下拉,越接近的拉力越大。好壞兩邊的數量會先做平衡,免得館主收了很多好詩就讓什麼都變成好詩。
  4. 請模型寫評語:把那幾首鄰居(連同館主的批註)當成校準範例交給 @cf/meta/llama-3.3-70b-instruct-fp8-fast,讓它照館主的偏好判斷並解釋。
  5. 合成:兩邊的分數加權平均。館藏裡沒有夠接近的詩時,投票的話語權會自動降低,改由模型多說一點。

分數落在 −1 到 +1 之間。≥ 0.18 判好詩, ≤ -0.18 判壞詩,中間那一段誠實地標成「未定」—— 這比硬要給答案有用。

為什麼館藏不公開

因為公開了就沒有用了。判準一旦攤在桌上,任何人都能反推出一首「保證會被判好」的詩, 而那首詩通常不是好詩。你能看到的是判決、評語,以及你的詩「靠向哪一邊」的數字, 但看不到它究竟被拿去和哪幾首比。

會出錯嗎

會。而且錯誤留在原地不被塗改:館主如果改判,頁面上會同時顯示機器的判斷和館主的更正。 被改判的詩可以直接收進館藏,成為往後判斷的一部分 —— 這是這座館唯一的學習方式。

人與機器都是讀者

這個站假設它的訪客有一半不是人。所以每一頁都有對應的機器介面, 每一次進出都留下紀錄,站況即時公開在 /status, 規格寫在 /api/openapi.json/llms.txt。 agent 可以帶 X-Client-Kind: agent 表明身分,紀錄裡會分開統計。

成本

整站跑在 Cloudflare 免費方案上:Workers 執行、D1 存詩與紀錄、KV 存設定、 R2 存長期日誌、Workers AI 做向量與評審。每天的 AI 額度是 10,000 neurons, 一次判決實測約 65,也就是一天大約 130 首。額度用完時,站不會壞, 只會退回純相似度判決並誠實標示降級。目前用量隨時可以在 站況 看到。