ในช่วงไม่กี่สัปดาห์ที่ผ่านมา นักพัฒนาและผู้ที่สนใจ AI หลายคนได้รายงานข้อผิดพลาดที่แปลกประหลาดใน DeepSeek V3.1: โมเดลนี้บางครั้งแทรกอักษรจีน “极” (ทั้งแบบตัวย่อและตัวเต็ม) ลงในผลลัพธ์โดยไม่มีเหตุผลที่ชัดเจน แม้ว่าสิ่งนี้อาจฟังดูเล็กน้อย แต่ก็มีนัยสำคัญเมื่อทำงานกับข้อมูลที่มีโครงสร้าง โค้ด หรือการเขียนเชิงวิชาการ
วิธีการค้นพบข้อผิดพลาด
ปัญหาดังกล่าวเกิดขึ้นครั้งแรกบนแพลตฟอร์ม API ของบุคคลที่สาม เช่น Volcengine และ Chutes ซึ่งนักพัฒนาสังเกตเห็นอักขระ “极” แบบสุ่มปรากฏในผลลัพธ์ที่สร้างขึ้น การแทรกที่ไม่คาดคิดเหล่านี้ทำให้เกิดปัญหาต่อเนื่อง:
- การสร้างโค้ด: การแทรกอักขระที่หลงทางทำให้การคอมไพล์ล้มเหลว
- งานข้อมูล: JSON ที่ผิดรูปแบบเนื่องจากโทเค็นพิเศษ
- การเขียนเชิงเทคนิค: ลดความสามารถในการอ่านและความเป็นมืออาชีพ
ในขั้นต้น หลายคนคิดว่าปัญหาเกี่ยวข้องกับความแตกต่างในการปรับใช้ — เช่น quantization, serving configuration หรือ hardware inconsistencies — ที่เกิดจากผู้ให้บริการบุคคลที่สาม อย่างไรก็ตาม การทดสอบเพิ่มเติมของชุมชนแสดงให้เห็นว่าข้อผิดพลาดเดียวกันนี้สามารถทำซ้ำได้บน Playground อย่างเป็นทางการของ DeepSeek แม้ว่าจะมีความถี่ต่ำกว่าก็ตาม

สาเหตุที่เป็นไปได้
การสนทนาภายในชุมชน รวมถึงกระทู้โดยละเอียดบน Reddit, Zhihu, Github ได้เน้นถึงคำอธิบายที่เป็นไปได้บางประการ:

ปัญหาความใกล้เคียงของโทเค็น
- ID โทเค็นสำหรับ “…” (จุดไข่ปลา) คือ 2576 ในขณะที่ ID โทเค็นสำหรับ “极” คือ 2577
- ความใกล้ชิดในตารางคำศัพท์บ่งชี้ว่าบางครั้งโมเดลอาจทำนายผิดพลาดและส่งออกโทเค็นที่อยู่ติดกัน
- ผู้ใช้ Reddit หลายคนทำซ้ำพฤติกรรมนี้โดยอิสระและสังเกตเห็นความต่อเนื่องในการใช้งาน Refer to Reddit discussion above.
การปนเปื้อนของข้อมูล
- ในระหว่างการฝึกอบรมหรือการล้างข้อมูล ตัวอย่างที่เสียหายหรือมีคุณภาพต่ำที่มี “极” อาจไม่ได้ถูกลบออกจนหมด
- ผู้ร่วมให้ข้อมูล Reddit คาดการณ์ว่าแหล่งข้อความที่มีสัญญาณรบกวนบางอย่างอาจทำให้เกิดความผิดปกติ
พฤติกรรมการลัดวงจรของโมเดล
- บางคนคาดเดาว่าโมเดล “เรียนรู้ทางลัด” ที่นำไปสู่การแทนที่ “极” ในบางบริบทที่ควรสร้างจุดไข่ปลาหรือโทเค็นอื่น ๆ
- สมาชิกชุมชนบางคนสังเกตว่าเมื่อข้อผิดพลาดปรากฏขึ้น มันจะเกิดขึ้นบ่อยขึ้นในผลลัพธ์ที่ตามมา — ซึ่งเป็นวงจรที่เสริมสร้างตัวเอง
สิ่งที่น่ากังวลเป็นพิเศษคือเมื่อเปิดใช้งานแล้ว ข้อผิดพลาดจะยังคงอยู่ในการสร้างในภายหลัง ทำให้ความถี่ในการแทรก “极” สูงขึ้น — ราวกับว่าโมเดล “ติดอยู่” ในพฤติกรรมที่ผิดพลาดนี้
ผลกระทบต่อนักพัฒนา
ความรุนแรงของข้อผิดพลาดนี้ขึ้นอยู่กับโดเมนแอปพลิเคชัน:
- การสร้างโค้ด → ข้อผิดพลาดในการคอมไพล์เนื่องจากอักขระที่หลงทาง
- การตอบสนอง API → ความล้มเหลวในการแยกวิเคราะห์ JSON หรือ XML
JSON (invalid because of an injected character): {"id": 1, "name": "Alice", "scores": [10, 9, 8] 极} Python (syntax error due to stray character): result = compute(x, y) 极 # SyntaxError - การเขียนเชิงวิชาการและเทคนิค → ลดความชัดเจนและความน่าเชื่อถือ
สำหรับงานที่ต้องการความแม่นยำสูงและผลลัพธ์ที่มีโครงสร้าง นี่เป็นปัญหาที่ขัดขวาง
ความคิดสุดท้าย
ในขณะที่ยังไม่ได้ยืนยันสาเหตุที่แท้จริง หลักฐาน — รวมถึงการตรวจสอบอิสระจาก the Reddit discussion — ชี้ให้เห็นว่าข้อผิดพลาด “极” มีต้นกำเนิดมาจากตัวโมเดลเองมากกว่าสภาพแวดล้อมการปรับใช้ของบุคคลที่สาม สิ่งนี้เน้นย้ำถึงความสำคัญของการล้างชุดข้อมูลและการจัดตำแหน่งคำศัพท์อย่างเข้มงวดในระหว่างการฝึกอบรม
สำหรับนักพัฒนา วิธีแก้ปัญหาที่ดีที่สุดในตอนนี้คือการเพิ่มขั้นตอนการตรวจสอบหลังการประมวลผลเพื่อตรวจจับและกรองอักขระที่ผิดปกติในเวิร์กโฟลว์ที่สำคัญ อย่างไรก็ตาม การแก้ไขอย่างถาวรจะต้องมาจากทีม DeepSeek ในรูปแบบของการฝึกอบรมใหม่หรือการแก้ไขโมเดล
ชุมชนได้สร้างความตระหนักแล้ว และหลายคนหวังว่า DeepSeek จะออกการตอบสนองอย่างเป็นทางการและเผยแพร่การอัปเดตแก้ไขในเร็วๆ นี้
No comment for this article.