All guides
Claude

降低延迟

Checked 09/15/2026View original

AI translation, not an official translation. Refer to the original for technical details.

On this page

延迟是指模型处理提示词并生成输出所需的时间。延迟可能受多种因素影响,例如模型的大小、提示词的复杂程度,以及支撑模型运行和交互节点的底层基础设施。


如何衡量延迟

在讨论延迟时,你可能会遇到以下几个术语和指标:

  • 基准延迟: 这是模型处理提示词并生成响应所需的时间,不考虑每秒输入和输出的 token 数量。它提供了对模型速度的总体概念。
  • 首个 token 生成时间(TTFT): 该指标衡量的是从发送提示词到模型生成响应中第一个 token 所需的时间。当你使用流式传输(稍后详述)并希望为用户提供响应及时的体验时,该指标尤为重要。

如需深入了解这些术语,请查阅术语表


如何降低延迟

1. 选择合适的模型

降低延迟最直接的方法之一是为你的使用场景选择合适的模型。Anthropic 提供了一系列具有不同能力和性能特征的模型。请根据你的具体需求,在速度与输出质量之间做出权衡,选择最适合的模型。

对于对速度要求较高的应用,Claude Haiku 4.5 在保持高智能水平的同时提供最快的响应速度:

# For time-sensitive applications, use Claude Haiku 4.5
ant messages create \
  --model claude-haiku-4-5 \
  --max-tokens 100 \
  --message '{"role": "user", "content": "Summarize this customer feedback in 2 sentences: [feedback text]"}'
client = anthropic.Anthropic()

# For time-sensitive applications, use Claude Haiku 4.5
message = client.messages.create(
    model="claude-haiku-4-5",
    max_tokens=100,
    messages=[
        {
            "role": "user",
            "content": "Summarize this customer feedback in 2 sentences: [feedback text]",
        }
    ],
)
print(message.content[0].text)
const client = new Anthropic();

// For time-sensitive applications, use Claude Haiku 4.5
const message = await client.messages.create({
  model: "claude-haiku-4-5",
  max_tokens: 100,
  messages: [
    {
      role: "user",
      content: "Summarize this customer feedback in 2 sentences: [feedback text]"
    }
  ]
});
const textBlock = message.content.find((block) => block.type === "text");
console.log(textBlock?.text);
AnthropicClient client = new();

// For time-sensitive applications, use Claude Haiku 4.5
var parameters = new MessageCreateParams
{
    Model = Model.ClaudeHaiku4_5,
    MaxTokens = 100,
    Messages = [
        new()
        {
            Role = Role.User,
            Content = "Summarize this customer feedback in 2 sentences: [feedback text]"
        }
    ]
};
var message = await client.Messages.Create(parameters);
message.Content[0].TryPickText(out var textBlock);
Console.WriteLine(textBlock?.Text);
client := anthropic.NewClient()

// For time-sensitive applications, use Claude Haiku 4.5
message, err := client.Messages.New(context.TODO(), anthropic.MessageNewParams{
	Model:     anthropic.ModelClaudeHaiku4_5,
	MaxTokens: 100,
	Messages: []anthropic.MessageParam{
		anthropic.NewUserMessage(anthropic.NewTextBlock("Summarize this customer feedback in 2 sentences: [feedback text]")),
	},
})
if err != nil {
	log.Fatal(err)
}
fmt.Println(message.Content[0].Text)
AnthropicClient client = AnthropicOkHttpClient.fromEnv();

// For time-sensitive applications, use Claude Haiku 4.5
MessageCreateParams params = MessageCreateParams.builder()
    .model(Model.CLAUDE_HAIKU_4_5)
    .maxTokens(100L)
    .addUserMessage("Summarize this customer feedback in 2 sentences: [feedback text]")
    .build();
Message message = client.messages().create(params);
IO.println(message.content().get(0).text().map(TextBlock::text).orElse(""));
$client = new Client();

// For time-sensitive applications, use Claude Haiku 4.5
$message = $client->messages->create(
    maxTokens: 100,
    messages: [['role' => 'user', 'content' => 'Summarize this customer feedback in 2 sentences: [feedback text]']],
    model: 'claude-haiku-4-5',
);
echo $message->content[0]->text;
client = Anthropic::Client.new

# For time-sensitive applications, use Claude Haiku 4.5
message = client.messages.create(
  model: "claude-haiku-4-5",
  max_tokens: 100,
  messages: [{ role: "user", content: "Summarize this customer feedback in 2 sentences: [feedback text]" }]
)
puts message.content.first.text

有关模型指标的更多详情,请参阅模型概览页面。

2. 优化提示词和输出长度

在保持高性能的前提下,尽量减少输入提示词和预期输出中的 token 数量。模型需要处理和生成的 token 越少,响应速度就越快。

以下是一些帮助你优化提示词和输出的建议:

  • 清晰而简洁: 力求在提示词中清晰简洁地表达你的意图。避免不必要的细节或冗余信息,同时请记住 Claude 缺乏对你使用场景的上下文了解,如果指令不清晰,可能无法做出预期的逻辑推断。

  • 要求更短的响应: 直接要求 Claude 保持简洁。如果 Claude 输出了不必要的冗长内容,可以要求 Claude 减少啰嗦 由于大型语言模型以

    token

    而非单词为单位进行计算,因此要求精确字数或限制字数的策略,不如要求限制段落数或句子数有效。

  • 设置合理的输出限制: 使用 max_tokens 参数为生成响应的最大长度设置硬性限制,防止 Claude 生成过长的输出。 当响应达到

    max_tokens

    个 token 时,响应将被截断,可能截断于句子或单词中间,因此这是一种较为粗暴的技术,可能需要后续处理,通常最适合用于答案出现在开头的选择题或简答题场景。

  • 尝试调整 temperature: temperature 参数控制输出的随机性。较低的值(例如 0.2)有时能产生更集中、更简短的响应,而较高的值(例如 0.8)可能产生更多样化但可能更长的输出。

在提示词清晰度、输出质量和 token 数量之间找到合适的平衡点可能需要一些实验。

3. 使用流式传输响应

流式传输是一项允许模型在完整输出生成之前就开始返回响应的功能。这能显著提升应用程序在用户感知上的响应速度,因为用户可以实时看到模型的输出内容。

启用流式传输后,你可以在模型输出到达时即时处理,同时更新用户界面或并行执行其他任务。

请访问流式传输消息,了解如何为你的使用场景实现流式传输。


后续步骤