from pathlib import Path from sentence_transformers import SentenceTransformer, export_dynamic_quantized_onnx_model model_id = "sentence-transformers/all-MiniLM-L6-v2" output_dir = Path("miniLM-onnx-int8") output_dir.mkdir(parents=True, exist_ok=True) model = SentenceTransformer( model_id, backend="onnx", model_kwargs={"file_name": "onnx/model.onnx"}, ) model.save_pretrained(str(output_dir)) export_dynamic_quantized_onnx_model( model, "avx2", str(output_dir), ) quantized_file = output_dir / "onnx" / "model_quint8_avx2.onnx" print(f"saved: {quantized_file}") print(f"exists: {quantized_file.exists()}") print(f"bytes: {quantized_file.stat().st_size}")