在使用过 Cursor、WindSurf Pro、Gemini Cli、Claude Code 等工具后,我发现一个有趣的现象,即每个 LLM 在回答/建议编程问题时都有其独特的“品味”。
以下是一些基于使用各家旗舰模型的发现。
Claude Sonnet 4 – 开拓者
这是目前最受欢迎的编程模型。与其他模型相比,它通常会按照你的要求执行,并且或多或少地完成你期望的工作。
最适合:搭建新项目和脚手架。
- 根据你的要求立即构建功能结构。
- 擅长定义路由、样板代码和高级功能。
- 它通常会帮助生成一个可用的项目或示例,并以最新的解决方案满足你的需求。
弱点:
- 在调试时,它经常忽略关键问题。例如,它曾经错误地识别了一个 CSS 类选择器,没有检查实际的 DOM 元素,而是根据经验猜测。
- 在要求它改进时,它会螺旋式上升:添加复杂的匹配逻辑,嵌套点击处理程序,甚至尝试点击每个嵌套元素——真的过度设计了。
- 如果一直要求它改进一些小事情或修改一些不符合预期的地方,它往往会把简单的事情复杂化。
- 它会在提供响应时产生大量的表情符号或图标,并且生成的代码也会包含表情符号(如果在代码中添加调试消息)。你可以要求它减少生成表情符号,它会听从。但过一段时间后,它又会这样做。
一旦陷入循环,我就切换到其他模型。它擅长启动项目,但不擅长调试。
Gemini 2.5 Pro – 过度重构者
这款来自 Google 的模型似乎响应速度非常快,并且可以提供细节方面的建议,但似乎缺乏对全局的把握。它更像是一个捕捉和修复问题的模型。
最适合:修复错误。
如果项目的某个特定区域存在一些错误,它会在定位问题和提供修复方案方面表现出色。它曾经准确地解决了点击处理问题,并提供了一个清晰的解决方案,修复后立即生效。
但是:
- 对于下一个功能,它编写了冗长的解释,并重写了前面的代码,实际上是回滚了之前的工作。
- 它喜欢在流程中进行重构,有时会撤销之前的进展。
- 奇怪的是,在我责骂它之后,它道歉并修复了问题——但精神负担让人感到疲惫。
它很精确,但使用起来让人情绪耗竭。
GPT-4.1 – 外科手术式修复者
它也是一个或多或少可以帮助完成工作的模型,但需要更多的指导和审查。它往往非常谨慎,但乍一看并不那么自信。
最适合:渐进式改进和精确性。
- 回复简洁明了。
- 完美地处理小的更改——一点一点地改进一个函数。
- 大约 70% 的情况下第一次尝试就成功;对于剩下的情况,它会冷静而安静地迭代。
我坚持使用它的原因:
- 没有冗长、复杂的解释来干扰代理窗口。
- 我发现 Gemini 2.5 用代码术语解释它的伟大之处并没有帮助:
- 我不理解高科技的吹嘘。
- 如果我理解,我自己会写。
我不需要模型来夸夸其谈——我只需要事情干净利落地完成。
比较各种“品味”
|
模型 |
最适合 |
个性 |
缺点 |
|---|---|---|---|
|
Claude Sonnet 4 |
脚手架 & 引导 |
快速,自信 |
过度设计复杂任务 |
|
Gemini 2.5 Pro |
错误修复 |
冗长,专注于重构 |
积极地重写之前的代码 |
|
GPT‑4.1 |
小幅编辑,可靠的修复 |
精确,安静 |
可能需要提示才能清晰 |
最后的想法:选择你的“口味”
归根结底,LLM 具有不同的编码“品味”。这与找到最聪明的模型无关——这被高估了。而是要找到一种风格与你的工作流程相匹配的模型。这种个人的“品味”至关重要。有时,可以将一些模型组合起来,并在同一项目的不同阶段使用。
No comment for this article.