mirror of
https://github.com/semantica-agi/semantica.git
synced 2026-08-29 04:26:20 +00:00
Add high-performance VectorStore ingestion and docs
This commit is contained in:
@@ -915,23 +915,21 @@
|
||||
"metadata": {},
|
||||
"outputs": [],
|
||||
"source": [
|
||||
"from semantica.vector_store import VectorStore \n",
|
||||
"from semantica.context import ContextRetriever \n",
|
||||
"import numpy as np\n",
|
||||
"from semantica.vector_store import VectorStore\n",
|
||||
"from semantica.context import ContextRetriever\n",
|
||||
"\n",
|
||||
"# Initialize vector store (dimension should match your embedder; default is 768)\n",
|
||||
"vector_store = VectorStore(backend=\"faiss\", dimension=768)\n",
|
||||
"\n",
|
||||
"# 1) Embed the full transcript\n",
|
||||
"embedding = vector_store.embed(parsed_doc[\"full_text\"])\n",
|
||||
"documents = [parsed_doc[\"full_text\"]]\n",
|
||||
"metadata = [{\"source\": \"earnings_call\", \"type\": \"transcript\"}]\n",
|
||||
"\n",
|
||||
"# 2) Store the embedding + metadata\n",
|
||||
"vector_store.store(\n",
|
||||
" vectors=[embedding],\n",
|
||||
" metadata=[{\"source\": \"earnings_call\", \"type\": \"transcript\"}],\n",
|
||||
"vector_ids = vector_store.add_documents(\n",
|
||||
" documents=documents,\n",
|
||||
" metadata=metadata,\n",
|
||||
" batch_size=32,\n",
|
||||
" parallel=True,\n",
|
||||
")\n",
|
||||
"\n",
|
||||
"# 3) Configure the context retriever as before\n",
|
||||
"context_retriever = ContextRetriever(\n",
|
||||
" knowledge_graph=knowledge_graph,\n",
|
||||
" vector_store=vector_store,\n",
|
||||
|
||||
Reference in New Issue
Block a user