Trong những tuần gần đây, một số nhà phát triển và những người đam mê AI đã báo cáo một lỗi kỳ lạ trong DeepSeek V3.1: mô hình đôi khi chèn ký tự tiếng Trung “极” (cả ở dạng giản thể và phồn thể) vào đầu ra của nó mà không có lý do rõ ràng. Mặc dù điều này có vẻ không đáng kể, nhưng nó có ý nghĩa quan trọng khi làm việc với dữ liệu có cấu trúc, mã hoặc văn bản học thuật.
Cách phát hiện ra lỗi
Vấn đề lần đầu tiên xuất hiện trên các nền tảng API của bên thứ ba như Volcengine và Chutes, nơi các nhà phát triển nhận thấy các ký tự “极” ngẫu nhiên xuất hiện trong các đầu ra được tạo. Những chèn không mong muốn này gây ra các vấn đề sau:
- Tạo mã: chèn một ký tự lạc làm hỏng quá trình biên dịch.
- Tác vụ dữ liệu: JSON bị lỗi do token thừa.
- Viết kỹ thuật: giảm khả năng đọc và tính chuyên nghiệp.
Ban đầu, nhiều người cho rằng vấn đề liên quan đến sự khác biệt trong triển khai — chẳng hạn như lượng tử hóa, cấu hình phục vụ hoặc sự không nhất quán về phần cứng — do các nhà cung cấp bên thứ ba đưa ra. Tuy nhiên, thử nghiệm thêm của cộng đồng cho thấy rằng lỗi tương tự có thể được tái tạo trên Playground chính thức của DeepSeek, mặc dù với tần suất thấp hơn.

Nguyên nhân gốc rễ có thể xảy ra
Các cuộc thảo luận trong cộng đồng, bao gồm các chủ đề chi tiết trên Reddit, Zhihu, Github, đã làm nổi bật một số giải thích hợp lý:

Vấn đề lân cận Token
- ID token cho “…” (dấu chấm lửng) là 2576, trong khi ID token cho “极” là 2577.
- Sự gần gũi trong bảng từ vựng cho thấy mô hình đôi khi có thể dự đoán sai và xuất ra token liền kề.
- Một số người dùng Reddit đã độc lập tái tạo hành vi này và lưu ý sự tồn tại của nó trong các phiên, hãy tham khảo thảo luận trên Reddit ở trên.
Ô nhiễm dữ liệu
- Trong quá trình đào tạo hoặc làm sạch dữ liệu, các mẫu bị hỏng hoặc chất lượng thấp có chứa “极” có thể chưa được loại bỏ hoàn toàn.
- Những người đóng góp trên Reddit suy đoán rằng một số nguồn văn bản nhiễu có thể đã gây ra sự bất thường.
Hành vi phím tắt của mô hình
- Một số người suy đoán rằng mô hình đã “học được một phím tắt” khiến nó đôi khi thay thế “极” trong các ngữ cảnh mà nó sẽ tạo ra dấu chấm lửng hoặc các token khác.
- Một vài thành viên cộng đồng nhận thấy rằng khi lỗi xuất hiện, nó trở nên thường xuyên hơn trong các đầu ra tiếp theo — một loại vòng lặp tự củng cố.
Điều đặc biệt đáng lo ngại là khi được kích hoạt, lỗi dường như vẫn tồn tại trong các thế hệ tiếp theo, dẫn đến tần suất chèn “极” cao hơn — như thể mô hình bị “mắc kẹt” trong hành vi sai lầm này.
Tác động đến nhà phát triển
Mức độ nghiêm trọng của lỗi này phụ thuộc vào miền ứng dụng:
- Tạo mã → Lỗi biên dịch do các ký tự lạc.
- Phản hồi API → Lỗi phân tích cú pháp JSON hoặc XML.
JSON (không hợp lệ vì một ký tự được chèn): {"id": 1, "name": "Alice", "scores": [10, 9, 8] 极} Python (lỗi cú pháp do ký tự lạc): result = compute(x, y) 极 # SyntaxError - Viết học thuật và kỹ thuật → Giảm độ rõ ràng và độ tin cậy.
Đối với các tác vụ đòi hỏi độ chính xác cao và đầu ra có cấu trúc, đây là một vấn đề chặn.
Suy nghĩ cuối cùng
Mặc dù nguyên nhân gốc rễ chính xác vẫn chưa được xác nhận, nhưng bằng chứng — bao gồm các xác minh độc lập từ thảo luận trên Reddit — cho thấy rằng lỗi “极” bắt nguồn từ chính mô hình chứ không phải môi trường triển khai của bên thứ ba. Điều này nhấn mạnh tầm quan trọng của việc làm sạch tập dữ liệu và căn chỉnh từ vựng nghiêm ngặt trong quá trình đào tạo.
Đối với các nhà phát triển, giải pháp thay thế tốt nhất hiện tại là thêm các bước xác thực sau xử lý để phát hiện và lọc ra các ký tự bất thường trong các quy trình làm việc quan trọng. Tuy nhiên, một bản sửa lỗi vĩnh viễn sẽ cần đến từ nhóm của DeepSeek dưới hình thức đào tạo lại hoặc vá mô hình.
Cộng đồng đã nâng cao nhận thức và nhiều người hy vọng DeepSeek sẽ đưa ra phản hồi chính thức và sớm phát hành bản cập nhật sửa lỗi.
No comment for this article.