LLMs Have Different Taste on Coding

English 简体中文 繁体中文 ภาษาไทย Tiếng Việt
Summary

Large Language Models demonstrate distinct "tastes" or specializations when assisting with coding tasks, making model selection crucial for different development phases. Claude Sonnet 4 excels at scaffolding new projects and generating initial structures, but often over-engineers debugging efforts and struggles with refinement. Gemini 2.5 Pro proves effective for pinpointing and fixing specific bugs, though its tendency to aggressively refactor existing code can be counterproductive. In contrast, GPT-4.1 is ideal for incremental improvements and precise, small-scale changes, offering concise and reliable fixes without verbose explanations. Developers should ultimately choose an LLM whose style aligns with the specific task, potentially combining models for different project stages.

Sau khi thử nghiệm với Cursor, WindSurf Pro, Gemini Cli, Claude Code và những công cụ khác, có một điều thú vị xuất hiện trong đầu tôi rằng mỗi LLM có một "gu" riêng khi đưa ra câu trả lời/gợi ý cho câu hỏi về code.

Dưới đây là một vài phát hiện dựa trên việc sử dụng các model hàng đầu từ mỗi nhà cung cấp.

Claude Sonnet 4 – Người Tiên Phong

Đây là model phổ biến nhất cho việc viết code cho đến nay. Nó thường làm những gì bạn yêu cầu và cuối cùng sẽ hoàn thành công việc như mong đợi ít nhiều so với các model khác.

Tốt nhất cho: Thiết lập các dự án mới và tạo khung (scaffolding).

  • Xây dựng cấu trúc chức năng ngay lập tức theo yêu cầu của bạn.
  • Xuất sắc trong việc xác định các route, boilerplate và các tính năng cấp cao.
  • Nó thường sẽ giúp tạo ra một dự án hoặc ví dụ hoạt động và đáp ứng yêu cầu của bạn với các giải pháp cập nhật nhất hiện có.

Điểm yếu:

  • Khi gỡ lỗi, nó thường bỏ lỡ các vấn đề chính. Ví dụ: nó đã từng xác định sai một CSS class selector, không kiểm tra các phần tử DOM thực tế mà đoán dựa trên kinh nghiệm.
  • Khi yêu cầu nó tinh chỉnh, nó xoắn ốc: thêm logic so khớp phức tạp, các trình xử lý click lồng nhau, thậm chí cố gắng click vào mọi phần tử lồng nhau—thực sự là overengineered.
  • Nó có xu hướng làm cho những thứ đơn giản trở nên phức tạp nếu bạn tiếp tục yêu cầu nó tinh chỉnh một vài thứ nhỏ hoặc làm lại một cái gì đó không như mong đợi.
  • Nó sẽ tạo ra rất nhiều biểu tượng cảm xúc hoặc icon khi cung cấp phản hồi và code được tạo ra cũng sẽ chứa biểu tượng cảm xúc (nếu thêm thông báo gỡ lỗi trong code), bạn có thể yêu cầu nó tạo ít biểu tượng cảm xúc hơn và nó sẽ tuân theo. Nhưng nó sẽ làm lại điều tương tự sau một thời gian.

Khi bị mắc kẹt trong một vòng lặp, tôi đã chuyển sang model khác. Tuyệt vời khi bắt đầu mọi thứ—nhưng không phải để gỡ lỗi chúng.

 Gemini 2.5 Pro – Người Tái Cấu Trúc Quá Mức

Model này từ Google dường như phản hồi rất nhanh và có thể đưa ra các gợi ý chi tiết nhưng dường như thiếu bức tranh lớn hơn. Nó giống như một model bắt và sửa lỗi hơn.

Tốt nhất cho: Sửa lỗi.

Nếu có một số lỗi trong một khu vực cụ thể của dự án, nó sẽ thực hiện tốt việc xác định vị trí sự cố và đưa ra giải pháp. Nó đã từng giải quyết chính xác một vấn đề xử lý click với một giải pháp rõ ràng và nó hoạt động ngay lập tức sau khi sửa.

Nhưng:

  • Đối với tính năng tiếp theo, nó đã viết những lời giải thích dài dòng và viết lại code trước đó, về cơ bản là quay trở lại công việc trước đó.
  • Nó thích tái cấu trúc giữa dòng chảy, đôi khi hoàn tác tiến trình trước đó.
  • Thật kỳ lạ, sau khi tôi khiển trách nó, nó đã xin lỗi và sửa chữa mọi thứ—nhưng gánh nặng tinh thần cảm thấy mệt mỏi.

Nó chính xác nhưng gây hao tổn cảm xúc khi sử dụng.

GPT-4.1 – Người Sửa Chữa Tinh Tế

Đây cũng là một model ít nhiều có thể giúp hoàn thành công việc nhưng cần nhiều hướng dẫn và xem xét hơn. Nó có xu hướng rất cẩn thận nhưng không tự tin ngay từ cái nhìn đầu tiên.

Tốt nhất cho: Cải tiến gia tăng và độ chính xác.

  • Phản hồi ngắn gọn và đi vào trọng tâm.
  • Xử lý các thay đổi nhỏ một cách hoàn hảo—tinh chỉnh từng chút một một hàm.
  • Khoảng 70% thành công ngay lần thử đầu tiên; đối với phần còn lại, phản hồi bình tĩnh và lặp lại một cách lặng lẽ.

Tại sao tôi gắn bó với nó:

  • Không có những lời giải thích dài dòng, phức tạp làm lộn xộn cửa sổ agent.
  • Tôi thấy Gemini 2.5 giải thích sự vĩ đại của nó bằng các thuật ngữ code không hữu ích:
    1. Tôi không hiểu sự khoe khoang công nghệ cao.
    2. Nếu tôi hiểu, tôi sẽ tự viết nó.

Tôi không cần model thuyết giảng—tôi chỉ cần mọi thứ hoạt động trơn tru.

So Sánh Các "Gu"

Model

Tốt Nhất Cho

Tính Cách

Nhược Điểm

Claude Sonnet 4

Tạo khung & bootstrapping

Nhanh, tự tin

Over-engineer các tác vụ phức tạp

Gemini 2.5 Pro

Sửa lỗi

Dài dòng, tập trung vào tái cấu trúc

Viết lại code trước đó một cách quyết liệt

GPT‑4.1

Chỉnh sửa nhỏ, sửa lỗi đáng tin cậy

Chính xác, yên tĩnh

Có thể cần nhắc nhở để rõ ràng

Lời Kết: Chọn "Hương Vị" Của Bạn

Cuối cùng, LLM có những "gu" viết code khác nhau. Không phải là tìm kiếm model thông minh nhất—điều đó được đánh giá quá cao. Đó là việc tìm kiếm model có phong cách phù hợp với quy trình làm việc của bạn. "Gu" cá nhân đó tạo ra tất cả sự khác biệt. Đôi khi, một số model có thể được kết hợp và sử dụng ở các giai đoạn khác nhau của cùng một dự án. 

COMPARISON GUIDE OPENAI LLM GEMINI CLAUDE CODE TASTE GPT

  RELATED

  COMMENTS

0

No comment for this article.