diff --git a/src/llm/inference_engine_enhanced.cpp b/src/llm/inference_engine_enhanced.cpp index fb7d2be977..d03ef46289 100644 --- a/src/llm/inference_engine_enhanced.cpp +++ b/src/llm/inference_engine_enhanced.cpp @@ -2257,6 +2257,9 @@ bool InferenceEngineEnhanced::trySpeculativeGeneration( supportsTokenizerlessNativeDraftTokens(draft_plugin); if (!tok_fn_copy && !allow_native_draft_tokens) { + const auto draft_info = draft_plugin ? draft_plugin->getModelInfo() : std::nullopt; + const std::string draft_model_id = (draft_info && !draft_info->model_id.empty()) + ? draft_info->model_id : "(unknown draft model)"; spdlog::info("Speculative draft model '{}' has no tokenizer bridge or " "known native draft-token implementation; falling back " "to target generation", diff --git a/src/llm/llama_wrapper.cpp b/src/llm/llama_wrapper.cpp index d18aa4e41e..ff2fa2510b 100644 --- a/src/llm/llama_wrapper.cpp +++ b/src/llm/llama_wrapper.cpp @@ -1766,7 +1766,7 @@ std::vector> LlamaWrapper::computeTargetLogitsForTokens( "Draft token out of target vocabulary range"); } - const auto draft_token = static_cast(token_id); + auto draft_token = static_cast(token_id); const auto batch = llama_batch_get_one(&draft_token, 1); if (llama_decode(context_handle, batch) != 0) { throw std::runtime_error(