LLMs Have Different Taste on Coding

English 简体中文 繁体中文 ภาษาไทย Tiếng Việt
Summary

Large Language Models demonstrate distinct "tastes" or specializations when assisting with coding tasks, making model selection crucial for different development phases. Claude Sonnet 4 excels at scaffolding new projects and generating initial structures, but often over-engineers debugging efforts and struggles with refinement. Gemini 2.5 Pro proves effective for pinpointing and fixing specific bugs, though its tendency to aggressively refactor existing code can be counterproductive. In contrast, GPT-4.1 is ideal for incremental improvements and precise, small-scale changes, offering concise and reliable fixes without verbose explanations. Developers should ultimately choose an LLM whose style aligns with the specific task, potentially combining models for different project stages.

在使用过 Cursor、WindSurf Pro、Gemini Cli、Claude Code 等工具后,我发现一个有趣的现象,即每个 LLM 在回答/建议编程问题时都有其独特的“品味”。

以下是一些基于使用各家旗舰模型的发现。

Claude Sonnet 4 – 开拓者

这是目前最受欢迎的编程模型。与其他模型相比,它通常会按照你的要求执行,并且或多或少地完成你期望的工作。

最适合:搭建新项目和脚手架。

  • 根据你的要求立即构建功能结构。
  • 擅长定义路由、样板代码和高级功能。
  • 它通常会帮助生成一个可用的项目或示例,并以最新的解决方案满足你的需求。

弱点:

  • 在调试时,它经常忽略关键问题。例如,它曾经错误地识别了一个 CSS 类选择器,没有检查实际的 DOM 元素,而是根据经验猜测。
  • 在要求它改进时,它会螺旋式上升:添加复杂的匹配逻辑,嵌套点击处理程序,甚至尝试点击每个嵌套元素——真的过度设计了。
  • 如果一直要求它改进一些小事情或修改一些不符合预期的地方,它往往会把简单的事情复杂化。
  • 它会在提供响应时产生大量的表情符号或图标,并且生成的代码也会包含表情符号(如果在代码中添加调试消息)。你可以要求它减少生成表情符号,它会听从。但过一段时间后,它又会这样做。

一旦陷入循环,我就切换到其他模型。它擅长启动项目,但不擅长调试。

 Gemini 2.5 Pro – 过度重构者

这款来自 Google 的模型似乎响应速度非常快,并且可以提供细节方面的建议,但似乎缺乏对全局的把握。它更像是一个捕捉和修复问题的模型。

最适合:修复错误。

如果项目的某个特定区域存在一些错误,它会在定位问题和提供修复方案方面表现出色。它曾经准确地解决了点击处理问题,并提供了一个清晰的解决方案,修复后立即生效。

但是:

  • 对于下一个功能,它编写了冗长的解释,并重写了前面的代码,实际上是回滚了之前的工作。
  • 它喜欢在流程中进行重构,有时会撤销之前的进展。
  • 奇怪的是,在我责骂它之后,它道歉并修复了问题——但精神负担让人感到疲惫。

它很精确,但使用起来让人情绪耗竭。

GPT-4.1 – 外科手术式修复者

它也是一个或多或少可以帮助完成工作的模型,但需要更多的指导和审查。它往往非常谨慎,但乍一看并不那么自信。

最适合:渐进式改进和精确性。

  • 回复简洁明了。
  • 完美地处理小的更改——一点一点地改进一个函数。
  • 大约 70% 的情况下第一次尝试就成功;对于剩下的情况,它会冷静而安静地迭代。

我坚持使用它的原因:

  • 没有冗长、复杂的解释来干扰代理窗口。
  • 我发现 Gemini 2.5 用代码术语解释它的伟大之处并没有帮助:
    1. 我不理解高科技的吹嘘。
    2. 如果我理解,我自己会写。

我不需要模型来夸夸其谈——我只需要事情干净利落地完成。

比较各种“品味”

模型

最适合

个性

缺点

Claude Sonnet 4

脚手架 & 引导

快速,自信

过度设计复杂任务

Gemini 2.5 Pro

错误修复

冗长,专注于重构

积极地重写之前的代码

GPT‑4.1

小幅编辑,可靠的修复

精确,安静

可能需要提示才能清晰

最后的想法:选择你的“口味”

归根结底,LLM 具有不同的编码“品味”。这与找到最聪明的模型无关——这被高估了。而是要找到一种风格与你的工作流程相匹配的模型。这种个人的“品味”至关重要。有时,可以将一些模型组合起来,并在同一项目的不同阶段使用。 

COMPARISON GUIDE OPENAI LLM GEMINI CLAUDE CODE TASTE GPT

  RELATED

  COMMENTS

0

No comment for this article.