最近幾週,一些開發者和人工智慧愛好者回報了 DeepSeek V3.1 中的一個奇怪錯誤:該模型偶爾會在輸出中插入中文字符「极」(簡體和繁體形式都有),而沒有任何明顯的原因。雖然這聽起來可能微不足道,但在處理結構化數據、程式碼或學術寫作時,它具有重大的影響。
如何發現這個錯誤
這個問題最初出現在 Volcengine 和 Chutes 等第三方 API 平台上,開發者注意到生成的輸出中出現了隨機的「极」字符。這些意外的插入導致了下游問題:
- 程式碼生成:插入一個多餘的字符會破壞編譯。
- 數據任務:由於額外的 token 導致 JSON 格式錯誤。
- 技術寫作:降低了可讀性和專業性。
最初,許多人認為這個問題與第三方供應商引入的部署差異有關,例如量化、服務配置或硬體不一致。然而,進一步的社群測試表明,同樣的錯誤可以在 DeepSeek 的官方 Playground 上重現,儘管頻率較低。

可能的根本原因
社群內的討論,包括 Reddit、Zhihu、Github 上的詳細討論串,突出了一些合理的解釋:

Token 相鄰問題
- 「…」(省略號)的 token ID 是 2576,而「极」的 token ID 是 2577。
- 詞彙表中的接近性表明模型有時可能會錯誤預測並輸出相鄰的 token。
- 多位 Reddit 用戶獨立地重現了這種行為,並注意到它在各個會話中持續存在,請參閱上面的 Reddit 討論。
數據污染
- 在訓練或數據清理期間,包含「极」的損壞或低質量樣本可能沒有被完全刪除。
- Reddit 貢獻者推測,某些嘈雜的文本來源可能引入了這種異常。
模型捷徑行為
- 一些人推測該模型「學習了一條捷徑」,導致它偶爾在應該產生省略號或其他 token 的上下文中替換為「极」。
- 一些社群成員觀察到,一旦出現這個錯誤,它在後續輸出中會變得更加頻繁,這是一種自我強化的循環。
特別令人擔憂的是,一旦觸發,這個錯誤似乎會在後續生成中持續存在,導致「极」插入的頻率更高,就好像模型「卡住」在這種錯誤行為中一樣。
對開發者的影響
這個錯誤的嚴重程度取決於應用領域:
- 程式碼生成 → 由於多餘的字符導致編譯錯誤。
- API 回應 → JSON 或 XML 解析失敗。
JSON (invalid because of an injected character): {"id": 1, "name": "Alice", "scores": [10, 9, 8] 极} Python (syntax error due to stray character): result = compute(x, y) 极 # SyntaxError - 學術和技術寫作 → 降低清晰度和可信度。
對於需要高精度和結構化輸出的任務,這是一個阻礙性問題。
最後的想法
雖然確切的根本原因尚未得到證實,但證據(包括來自 Reddit 討論 的獨立驗證)表明,「极」錯誤源於模型本身,而不是第三方部署環境。這突顯了在訓練期間嚴格的數據集清理和詞彙對齊的重要性。
對於開發者來說,目前最好的解決方案是添加後處理驗證步驟,以檢測和過濾掉關鍵工作流程中的異常字符。然而,一個永久性的修復將需要來自 DeepSeek 團隊,以重新訓練或修補模型的方式進行。
社群已經提高了意識,許多人希望 DeepSeek 能夠發布官方回應並儘快發布更正更新。
No comment for this article.