This commit is contained in:
@@ -90,6 +90,34 @@ llm:
|
||||
# max_concurrency: 1
|
||||
# enabled: true
|
||||
|
||||
# 例: extra_body / reasoning_efforts / reasoning_effort_mode
|
||||
# (vLLM で reasoning effort を渡す)。
|
||||
#
|
||||
# extra_body: OpenAI 互換リクエストボディへそのまま浅くマージされる任意 JSON。
|
||||
# model / messages / stream / stream_options / tools / tool_choice /
|
||||
# temperature は予約キーとしてクライアント側で無視される。
|
||||
# ここに API キー等の秘密情報を書かないこと — /api/config はこの値を
|
||||
# マスクしない (config.yaml に平文で残る)。
|
||||
# reasoning_efforts: このワーカーが対応する effort の宣言リスト (後続フェーズで
|
||||
# ジョブ単位の effort 指定に使われる)。
|
||||
# reasoning_effort_mode: effort をリクエストボディへ注入する形。
|
||||
# body (既定) = トップレベル reasoning_effort。vLLM 向け。
|
||||
# chat_template_kwargs = chat_template_kwargs.reasoning_effort。
|
||||
# llama-server (llama.cpp) 向け — llama-server はトップレベルの
|
||||
# reasoning_effort を黙って無視するため、llama-server を使う場合は
|
||||
# chat_template_kwargs を明示すること。
|
||||
# - id: vllm-reasoning
|
||||
# connection_type: direct
|
||||
# endpoint: http://localhost:8000/v1
|
||||
# model: deepseek-r1
|
||||
# roles: [quality]
|
||||
# max_concurrency: 1
|
||||
# enabled: true
|
||||
# extra_body:
|
||||
# reasoning_effort: max
|
||||
# reasoning_efforts: [low, medium, high, max]
|
||||
# reasoning_effort_mode: body
|
||||
|
||||
# Prometheus exporter (worker side). default で enabled。
|
||||
# /metrics が bridge HTTP server (PORT, default 9876) に mount される。
|
||||
# access control: default では localhost (127.0.0.1 / ::1) のみ通る。
|
||||
|
||||
Reference in New Issue
Block a user