import os from llama_index.llms.openai_like import OpenAILike base_url = os.environ["LLAMA_CPP_BASE_URL"] model = os.environ["LLAMA_CPP_MODEL"] llm = OpenAILike( model=model, api_base=base_url, api_key=os.getenv("LLAMA_CPP_API_KEY", "not-needed"), is_chat_model=False, is_function_calling_model=False, context_window=4096, max_tokens=64, temperature=0, timeout=120, ) response = llm.complete( "Write one short sentence confirming LlamaIndex reached llama.cpp." ) print(f"endpoint={base_url}") print(f"model={model}") print(f"response={str(response).strip()}")