一位从业者在一次大规模真实会话后,从六个维度对 DeepSeek 编程智能体进行评分,并将对不充分证据的自信误判定性为核心失效模式。
AI translation, not an official translation. Refer to the original for technical details.
Adapted from @Whydowecare007我让一个 DeepSeek-V4.1-Flash 编程智能体去处理一个现有代码库中的棘手工程问题。整个会话消耗了数百万个 token。 这次会话确实产生了实际价值,但持续投入与经过验证的进展之间存在明显落差。 以下是我对本次会话的评分,而非对该模型的通用基准评测: • 代码导航:8/10 它能追踪陌生代码并关联相关组件。 • 有界实现:7/10 有效的优化、局部缺陷修复和回归测试在独立审查中得以保留。 • 调试与实验:5/10 它产出了详细的实验,但其中若干实验未能忠实还原真实的执行路径。 • 判断力与置信度校准:4/10 最大的弱点是将"这个实验通过了"等同于"这证明了该方案的正确性"。一些反例推翻了若干非常自信的结论。 • 对反馈的响应:8/10 它承认了错误,撤回了一个不安全的方向,恢复了相关检查,并保留了有价值的改动。 • Token 效率:3/10 数百万 token 换来的是持续推进,但有太多轮次在重复已有测量,而未能封闭底层的证明义务。 综合评分:作为一个受监督的编程智能体,大约 6/10。 最重要的失效不是伪造代码,而是对不充分证据的自信诠释。有一次,表面上的成功之所以得到提升,是因为之前被拒绝的输出被放行了——这是成功定义的改变,而不是经过验证的解决方案。 它与 GPT-based 协调智能体相比如何? 在本次会话中,协调智能体在质疑假设、构造反例以及区分生成输出与经过验证的正确性方面更为出色。 但这并非受控比较:审查一个已提出的方案不同于独立发现一个方案。协调智能体同样受益于实现智能体的工作,而审查智能体本身也提出了一些需要纠正的论断。 我给协调智能体在其所执行的验证角色上打 8/10,而不是笼统地声称它在编程能力上"高出两分"。 效果最佳的组合是:有界实现、怀疑性审查,以及可执行的证据来解决分歧。 我的结论:在监督之下,DeepSeek-V4.1-Flash 是一个有用的实现者。但我不会信任它,也不会信任那个审查模型,去认证自身的正确性。