判決是怎麼來的
誰在判斷好壞
不是語言模型自己的品味,也不是文學史。是館主。
館主會不定期把詩放進館內,每一首都親手標上「好」或「壞」,有時附上一句為什麼。 這批詩不公開,總共 44 首(24 首好、20 首壞)。 你投進來的詩,是拿去跟這批詩比,不是跟任何公認的標準比。
一首詩進來之後
- 轉成向量:用
@cf/baai/bge-m3把整首詩(含題目)變成一串數字。 - 找最近的鄰居:和每一首館藏算餘弦相似度,取最接近的 8 首。
- 相似度投票:鄰居中被標「好」的把分數往上拉,標「壞」的往下拉,越接近的拉力越大。好壞兩邊的數量會先做平衡,免得館主收了很多好詩就讓什麼都變成好詩。
- 請模型寫評語:把那幾首鄰居(連同館主的批註)當成校準範例交給
@cf/meta/llama-3.3-70b-instruct-fp8-fast,讓它照館主的偏好判斷並解釋。 - 合成:兩邊的分數加權平均。館藏裡沒有夠接近的詩時,投票的話語權會自動降低,改由模型多說一點。
分數落在 −1 到 +1 之間。≥ 0.18 判好詩,
≤ -0.18 判壞詩,中間那一段誠實地標成「未定」——
這比硬要給答案有用。
為什麼館藏不公開
因為公開了就沒有用了。判準一旦攤在桌上,任何人都能反推出一首「保證會被判好」的詩, 而那首詩通常不是好詩。你能看到的是判決、評語,以及你的詩「靠向哪一邊」的數字, 但看不到它究竟被拿去和哪幾首比。
會出錯嗎
會。而且錯誤留在原地不被塗改:館主如果改判,頁面上會同時顯示機器的判斷和館主的更正。 被改判的詩可以直接收進館藏,成為往後判斷的一部分 —— 這是這座館唯一的學習方式。
人與機器都是讀者
這個站假設它的訪客有一半不是人。所以每一頁都有對應的機器介面,
每一次進出都留下紀錄,站況即時公開在 /status,
規格寫在 /api/openapi.json 和 /llms.txt。
agent 可以帶 X-Client-Kind: agent 表明身分,紀錄裡會分開統計。
成本
整站跑在 Cloudflare 免費方案上:Workers 執行、D1 存詩與紀錄、KV 存設定、 R2 存長期日誌、Workers AI 做向量與評審。每天的 AI 額度是 10,000 neurons, 一次判決實測約 65,也就是一天大約 130 首。額度用完時,站不會壞, 只會退回純相似度判決並誠實標示降級。目前用量隨時可以在 站況 看到。