Skip to content

Embeddings & Rerank

Generate vector embeddings from text. Embeddings are fixed-length numeric arrays that capture semantic meaning – useful for search, clustering, and RAG.

import asyncio
import os
from liter_llm import create_client
from liter_llm._internal_bindings import EmbeddingRequest
async def main() -> None:
client = create_client(api_key=os.environ["OPENAI_API_KEY"])
request = EmbeddingRequest.from_json(
'{"model":"openai/text-embedding-3-small","input":["The quick brown fox jumps over the lazy dog"]}'
)
response = await client.embed(request)
print(f"Dimensions: {len(response.data[0].embedding)}")
print(f"First 5 values: {response.data[0].embedding[:5]}")
asyncio.run(main())
Parameter Type Description
model string Embedding model (e.g. "openai/text-embedding-3-small")
input string/array Text(s) to embed
encoding_format string Output format ("float" or "base64")
dimensions int Output dimensionality (model-dependent)
Provider Prefix Example Model
OpenAI openai/ text-embedding-3-small, text-embedding-3-large
Cohere cohere/ embed-english-v3.0
Voyage AI voyage/ voyage-3
Mistral mistral/ mistral-embed
Google Vertex AI vertex_ai/ text-embedding-004
AWS Bedrock bedrock/ amazon.titan-embed-text-v2:0
Ollama ollama/ nomic-embed-text
LM Studio lmstudio/ Depends on loaded model
vLLM vllm/ BAAI/bge-base-en-v1.5
llama.cpp llamacpp/ Depends on loaded GGUF
LocalAI localai/ Depends on configuration
llamafile llamafile/ Depends on loaded model
Jina AI jina_ai/ jina-embeddings-v3

See the Providers page for the complete capability matrix.

Rerank documents by relevance to a query. Useful for improving retrieval quality in RAG pipelines:

import asyncio
import json
import os
from liter_llm import create_client
from liter_llm._internal_bindings import RerankRequest
async def main() -> None:
client = create_client(api_key=os.environ["COHERE_API_KEY"])
payload = {
"model": "cohere/rerank-v3.5",
"query": "What is the capital of France?",
"documents": [
"Paris is the capital of France.",
"Berlin is the capital of Germany.",
"London is the capital of England.",
],
}
request = RerankRequest.from_json(json.dumps(payload))
response = await client.rerank(request)
for result in response.results:
print(f"Index: {result.index}, Score: {result.relevance_score:.4f}")
asyncio.run(main())
Parameter Type Description
model string Rerank model (e.g. "cohere/rerank-v3.5")
query string The query to rank documents against
documents array Documents to rerank
top_n int Number of top results to return
return_documents bool Include document text in results