Quanto valgono i crediti gratuiti di Qdrant?
Qdrant offre 2.000 dollari in crediti gratuiti per le startup, applicati a Qdrant Cloud, la versione gestita del suo database vettoriale open source.
Quel numero è modesto rispetto alle sovvenzioni a sei cifre presenti in altre categorie, ed è utile leggerlo correttamente piuttosto che liquidarlo. Qdrant ha licenza Apache 2.0 ed è self-hostable, quindi il prodotto a pagamento è l'hosting gestito, non il motore. Il credito è un budget di hosting, non una chiave di accesso.
L'idoneità dipende dalla fase e dal finanziamento, e i termini dei programmi per l'infrastruttura si muovono più dei termini dei programmi per i modelli. AI Perks tiene traccia della versione corrente insieme a 7,7 milioni di dollari in crediti per 194 aziende.

Cosa fa effettivamente Qdrant
Qdrant memorizza gli embedding insieme ai metadati strutturati e restituisce le corrispondenze più vicine a un vettore di query in millisecondi. È scritto in Rust, viene distribuito come singolo binario e si comporta allo stesso modo su un laptop come in produzione.
Ogni prodotto che risponde a domande su documenti privati, cerca per significato anziché per parola chiave, raccomanda articoli simili, deduplica record o fornisce a un agente una memoria a lungo termine necessita di questo livello. O lo esegui o lo noleggi.
Tre proprietà separano Qdrant dal resto della categoria:
Il payload è un cittadino di prima classe. I metadati vivono con il vettore e sono indicizzabili, quindi i filtri fanno parte della query anziché essere un secondo passaggio sui risultati. Maggiori dettagli sul perché questo sia importante di seguito.
È un singolo binario. La parità di sviluppo locale è un reale vantaggio operativo. È possibile eseguire lo stesso identico motore in un container Docker sulla propria macchina e in un cluster gestito, il che rimuove una categoria di sorprese "funziona localmente".
La licenza è permissiva. Apache 2.0 significa che l'auto-hosting rimane disponibile permanentemente. Questo è un potere negoziale piuttosto che un piano: sapere di poter passare mantiene onesta la fattura gestita.
La ricerca filtrata è dove i prodotti di recupero si rompono
Quasi nessuna query di produzione è "trova simili". È "trova simili, all'interno dei documenti di questo cliente, degli ultimi 90 giorni, di questo tipo". Quella combinazione, non la pura somiglianza, è dove la maggior parte delle ricerche vettoriali fallisce silenziosamente.
Il fallimento ha una forma specifica. Le implementazioni naive post-filtrano: recuperano i 100 vettori più vicini, quindi scartano quelli che non corrispondono al filtro. Se il filtro è selettivo, si ottengono tre risultati, o zero, e il prodotto sembra rotto anche se l'indice è a posto.
L'alternativa, il pre-filtraggio per forza bruta sul sottoinsieme corrispondente, è corretta ma lenta una volta che il sottoinsieme è grande. La risposta di Qdrant è applicare le condizioni di filtro durante l'attraversamento del grafo e mantenere il grafo di ricerca connesso sotto filtraggio, supportato da indici di payload sui campi su cui si filtra. Il dettaglio ingegneristico conta meno della conseguenza: le query filtrate rimangono sia veloci che complete.
Questa è la proprietà più importante per chiunque venda software B2B, perché ogni query in un prodotto multi-tenant è filtrata per tenant. Se il tuo recupero degrada sotto i filtri, degrada per ogni cliente contemporaneamente.

Come si comporta il costo del database vettoriale su larga scala
Il costo della ricerca vettoriale è determinato da quanti vettori memorizzi moltiplicato per le loro dimensioni, non da quante query esegui. Un indice inattivo su un corpus ampio è costoso. Un indice attivo su un corpus piccolo è economico.
Questo è l'inverso di come le API dei modelli ti fatturano, ed è il motivo per cui i fondatori prevedono erroneamente questa voce in modo così costante. Ecco l'aritmetica per un milione di vettori, prima dell'overhead dell'indice:
| Modalità di archiviazione | Bit per dimensione | 1 milione di vettori a 768 dimensioni | 1 milione di vettori a 1.536 dimensioni |
|---|---|---|---|
| float32 in memoria | 32 | ~3,1 GB | ~6,1 GB |
| Quantizzazione scalare (int8) | 8 | ~0,8 GB | ~1,5 GB |
| Quantizzazione binaria | 1 | ~0,1 GB | ~0,2 GB |
| Mappato in memoria su disco | 32, paginato | La RAM contiene l'indice | La RAM contiene l'indice |
Considerale un limite inferiore. L'overhead del grafo e il payload stanno sopra.
Due leve cambiano il quadro più di quanto farai al tuo codice. La quantizzazione comprime i vettori memorizzati e Qdrant può riordinare la shortlist contro vettori a precisione completa per recuperare la maggior parte della recall persa, il che la rende molto meno un downgrade di quanto sembri. La scelta della dimensione è l'altra: molti modelli di embedding ora supportano output abbreviati, e dimezzare le dimensioni dimezza l'intera tabella.
La conclusione pratica è che la strategia di chunking è una decisione di costo, non solo una decisione di qualità. Suddividere i documenti in pezzi più piccoli moltiplica il numero di vettori e la fattura della memoria con essi. AI Perks tiene traccia dei crediti su questo livello in modo da poter testare su larga scala reale prima che la fattura ti insegni.
Per cosa serve effettivamente un credito di 2.000 dollari
Una sovvenzione di 2.000 dollari non è un anno di autonomia. È sufficiente per eseguire il tuo corpus reale su larga scala reale abbastanza a lungo da imparare quanto costerà la produzione, il che vale più del denaro.
I team che dimensionano una fattura vettoriale da un campione di 10.000 righe di solito sbagliano di un ordine di grandezza. La recall, le prestazioni dei filtri e il calo di qualità dalla quantizzazione cambiano tutti con la dimensione del corpus, e nessuno di essi si estrapola in modo pulito da un indice giocattolo.
Quindi, spendi il credito come misurazione, non come sconto:
Carica tutto, non un campione. Il punto è vedere comportamenti che non puoi vedere su piccola scala.
Interroga con filtri attivi. Testa la forma della query che il tuo prodotto emetterà effettivamente, incluso il filtro tenant.
Misura la recall con le impostazioni di quantizzazione. Decidi il compromesso di memoria con un numero invece di una preferenza.
Quindi confronta l'auto-hosting con il gestito. Con una dimensione reale dell'indice, ciò diventa aritmetica piuttosto che un argomento.
La tempistica è importante quanto la quantità. I crediti sono a tempo, quindi attivare una sovvenzione mentre stai ancora scegliendo una dimensione di chunk brucia la maggior parte di essa su un indice vuoto. Allinea l'orologio al momento in cui hai sia un corpus che traffico. I programmi attuali e i loro termini si trovano su AI Perks.

Con cosa si combinano i crediti Qdrant
La fattura del recupero si divide in tre voci: creazione degli embedding, archiviazione e ricerca degli stessi, e generazione della risposta. Una sovvenzione per il database vettoriale copre una delle tre.
| Livello | Come fattura | Dove esistono i crediti |
|---|---|---|
| Embedding | Una volta per documento, di nuovo ad ogni modifica del modello | OpenAI, Cohere, Voyage, Mistral |
| Archiviazione e ricerca vettoriale | Continuamente, guidata dalla memoria | Qdrant, Pinecone, Weaviate |
| Generazione | Per risposta, per utente | Anthropic, OpenAI, Google, xAI |
| Calcolo e hosting | Continuamente, guidata dall'uptime | AWS, Google Cloud, Azure, Modal |
La riga degli embedding è quella che coglie le persone. Incorpori il corpus una volta per indicizzarlo, quindi lo re-incorpori tutto ogni volta che cambi modello. Un aggiornamento dell'embedding è una re-indicizzazione completa, e su un corpus ampio questa è una fattura reale piuttosto che un processo in background.
Avere crediti su diverse righe consente a un team di cambiare idea senza una riunione di budget. Questo è l'argomento reale per lo stacking.
Cosa sbagliano i fondatori sui database vettoriali
Gli errori più comuni sono adottarne uno prima che il prodotto ne abbia bisogno, e trattare la qualità del recupero come un problema del modello quando è solitamente un problema di filtraggio o di chunking.
Cinque fallimenti da evitare:
Iniziare troppo presto. Postgres con pgvector gestisce qualche centinaio di migliaia di vettori e query semplici, e rimuove un servizio dal tuo stack. Un database vettoriale dedicato si guadagna il suo posto su larga scala, con un volume di query sostenuto, o quando la ricerca filtrata inizia a restituire troppo poco.
Ignorare i filtri fino all'arrivo del multi-tenancy. A quel punto i pattern di query sono consolidati e la correzione è una migrazione.
Trattare la quantizzazione come un downgrade. È la differenza tra un indice da 6 GB e uno da 1,5 GB, e con il riordino il costo di recall è spesso trascurabile. Misuralo piuttosto che presumere.
Confondere open source con gratuito. L'auto-hosting rimuove la commissione di licenza, non la fattura della memoria o la rotazione di reperibilità.
Dimenticare il lato dell'embedding. I crediti di archiviazione coprono metà di una fattura di recupero. I fondatori che cercano entrambi contemporaneamente finanziano un anno. Il resto finanzia un quarto. Entrambi i lati sono catalogati su AI Perks.

Domande frequenti
Quanto valgono i crediti Qdrant?
Qdrant offre 2.000 dollari in crediti gratuiti per le startup, applicati a Qdrant Cloud piuttosto che al motore open source, che è comunque gratuito. Quanto vale dipende dalle dimensioni del corpus e dalle dimensioni dei vettori piuttosto che dal volume delle query, poiché il costo è guidato dalla memoria. I termini e l'idoneità attuali sono tracciati su getaiperks.com.
Qdrant è gratuito da usare?
Sì, nel senso che conta: Qdrant ha licenza Apache 2.0 e puoi eseguirlo sul tuo hardware senza commissioni di licenza. Ciò che costa denaro è Qdrant Cloud, il servizio gestito, oltre alla memoria consumata dal tuo indice ovunque si trovi. L'auto-hosting scambia denaro con lavoro operativo.
Ho bisogno di un database vettoriale, o pgvector è sufficiente?
Per qualche centinaio di migliaia di vettori e query semplici, Postgres con pgvector è solitamente sufficiente e rimuove un servizio dal tuo stack. Un database vettoriale dedicato si guadagna il suo posto con decine di milioni di vettori, carico di query sostenuto, o ricerche filtrate e multi-tenant intensive, dove le implementazioni naive degradano rapidamente.
Quanta RAM necessita Qdrant?
Più di quanto la maggior parte dei team preveda. Vettori non compressi a 32 bit necessitano di circa 4 byte per dimensione per vettore, quindi un milione di vettori a 1.536 dimensioni sono circa 6 GB prima dell'overhead dell'indice. La quantizzazione scalare lo riduce di quasi quattro volte e la quantizzazione binaria molto di più, il che rende la quantizzazione una decisione di pianificazione piuttosto che un'ottimizzazione.
Posso combinare i crediti Qdrant con i crediti OpenAI o Anthropic?
Sì, e coprono fatture diverse. Qdrant copre l'archiviazione e la ricerca dei tuoi vettori, i provider di embedding coprono la loro creazione, e i provider di modelli coprono la generazione della risposta. I team che detengono crediti su tutte e tre coprono un realistico primo anno di un prodotto di recupero. Vedi quali combinazioni esistono su getaiperks.com.
Quali sono le principali alternative a Qdrant?
Pinecone, Weaviate, Milvus, Chroma e Postgres con pgvector. I punti distintivi di Qdrant sono il suo motore Rust, il suo modello di filtraggio e una licenza permissiva che mantiene l'auto-hosting disponibile come una vera uscita piuttosto che un bluff. AI Perks tiene traccia dei programmi di credito nell'intera categoria su getaiperks.com.
Memorizza i vettori. Lascia che qualcun altro paghi per la memoria.