Hugging Face ospita centinaia di migliaia di modelli aperti e ti consente di eseguirli attraverso API di inferenza serverless, dedicato Endpoint di inferenza, O Spazi. Ecco quanto costa, il livello gratuito e come ottenere il token di accesso.
| Piano/prodotto | Prezzo | Cosa ottieni |
|---|---|---|
| Conto gratuito livello gratuito | $0 | Crediti serverless mensili limitati, inferenza a velocità limitata, spazi CPU gratuiti |
| PRO | ~$9/mese | Più crediti serverless, limiti di velocità più elevati, spazi ZeroGPU |
| Endpoint di inferenza (CPU) | da ~$ 0,03/ora | Dedicato, scalabile automaticamente, fatturato in base all'ora |
| Endpoint di inferenza (GPU) | da ~$0,50/ora | Piccola GPU; le GPU più grandi raggiungono diversi $/ora |
| Squadra/Impresa | da ~$20/utente/mese | SSO, hub privato, supporto, controlli |
Un account Hugging Face gratuito include a piccolo credito mensile per l'API Serverless Inference inoltre accesso a tariffa limitata a molti modelli ospitati e gratuito Spazi della CPU per le demo. È sufficiente prototipare e testare i modelli. Per un traffico costante puoi passare a PRO (~$9/mese) per crediti e limiti maggiori, oppure creane uno dedicato Endpoint di inferenza fatturato all'ora dall'hardware.
1. Crea un account su www.huggingface.co.
2. Vai a Impostazioni → Token di accesso.
3. Clic Nuovo gettone, scegli a a grana fine scope (o semplice lettura/scrittura), nominatelo.
4. Copia il hf_… token una volta: trattalo come una password.
Chiama un modello ospitato:
Se desideri un'API ospitata con pagamento per token invece di gestire modelli, confronta Insieme AI, Replicare, Groq E OpenRouter - tutti eseguono modelli aperti con una semplice fatturazione per token. Per i modelli a frontiera chiusa vedere OpenAI E Antropico. Per stimare uno di questi per il tuo utilizzo, usa il file Calcolatore dei costi dell'IA.
Sì: un account gratuito con crediti serverless mensili limitati, inferenza a velocità limitata e spazi CPU gratuiti. L'utilizzo più intenso passa a PRO (~$9/mese) o agli endpoint di inferenza orari.
Account → Impostazioni → Token di accesso → Nuovo token. Scegli un ambito a grana fine o di lettura/scrittura e copia il token hf_ una volta.
Il serverless viene eseguito in modo condiviso, con velocità limitata ed è ottimo per i test. Gli endpoint di inferenza sono distribuzioni dedicate con scalabilità automatica fatturate all'ora in base all'hardware scelto, prevedibili per il traffico di produzione.
Non affiliato con Hugging Face. I prezzi sono stime di riferimento: verifica sempre sulla pagina dei prezzi ufficiali.
Strumenti e hosting