from langchain.document_loaders import PyPDFLoader
from langchain.text_splitter import RecursiveCharacterTextSplitter
from langchain.embeddings import HuggingFaceEmbeddings
from langchain.vectorstores import FAISS
Load document
loader = PyPDFLoader("data/sample.pdf")
documents = loader.load()
Split text
text_splitter = RecursiveCharacterTextSplitter(
chunk_size=500,
chunk_overlap=50
)
chunks = text_splitter.split_documents(documents)
Embedding model (FREE)
embeddings = HuggingFaceEmbeddings(
model_name="sentence-transformers/all-MiniLM-L6-v2"
)
Vector store
vectorstore = FAISS.from_documents(chunks, embeddings)
vectorstore.save_local("faiss_db")
print("✅ Documents ingested successfully")