Le taux de repli est tout le jeu de balle. Un modèle distillé qui gère 90 % de votre trafic et renvoie le reste à l'enseignant ne fournit pas le multiple global : le dixième augmenté est facturé au tarif frontière complet et représente généralement la majeure partie de la facture restante. Entrez un chiffre honnête ci-dessous et observez l’évolution de la période de récupération.
Quel est l'effet du taux de repli sur votre retour sur investissement
Même modèle d'étudiant, mêmes dépenses initiales : seule la part du trafic qui doit revenir à l'enseignant change. C'est la variable qui décide si un projet de distillation est une victoire d'un quart ou une erreur d'arrondi.
| Taux de repli | Efficace / mois | Économie / mois | Épargnant contre enseignant | Remboursement |
|---|
Pourquoi le titre "20 fois moins cher" ne vous permet pas d'économiser
La distillation fonctionne, et les multiples publiés sont réels : entraînez un petit étudiant à imiter un grand enseignant sur une tâche précise et le coût de service par jeton diminue généralement entre cinq et vingt fois. Ce que ces chiffres décrivent, c'est le coût d'un jeton passant par l'étudiant plutôt que par l'enseignant. Ce qu’ils ne décrivent pas, c’est le coût de fonctionnement d’un système de production, qui est une quantité différente, car les systèmes de production n’acheminent pas 100 % du trafic vers un modèle qui est tout simplement presque aussi bon. Ils acheminent les cas confidentiels vers l’étudiant et transmettent le reste – et le reste est facturé au tarif plein enseignant. Avec un taux de repli de 10 %, l'enseignant gère toujours un dixième de votre volume à 30 fois le prix de l'étudiant, ce qui signifie qu'il est toujours responsable de la majorité de votre facture restante. La modélisation de la distillation comme un échange propre est l’erreur la plus courante dans ces analyses de rentabilisation.
Le coût initial concerne principalement les personnes, pas les GPU
La ligne de calcul est presque toujours la partie la moins chère. L'étiquetage de 50 000 exemples par l'intermédiaire de l'enseignant coûte quelques centaines de dollars aux tarifs habituels. Un réglage fin pour un petit étudiant représente des dizaines d'heures GPU – appelons cela une centaine de dollars supplémentaires aux prix de location des produits de base. Vient ensuite la partie qui n'apparaît dans le calculateur de coûts d'aucun fournisseur : quelqu'un doit organiser l'ensemble de formation, construire un harnais d'évaluation qui peut réellement vous dire si l'étudiant est assez bon, définir le seuil de confiance pour le routeur de secours et le valider par rapport au trafic de production avant d'oser y transférer de vrais utilisateurs. Quarante heures d'ingénierie est une estimation optimiste pour ce travail, et quel que soit le taux pondéré réaliste, il domine tout le reste dans la colonne initiale. C’est pourquoi la calculatrice le demande explicitement au lieu de le laisser tranquillement à zéro.
L'horloge avec laquelle vous courez
La dernière considération ne vous est pas imposée par les feuilles de calcul : les prix frontières continuent de baisser. Un projet avec un retour sur investissement de deux mois est à l’abri de cela ; un projet avec un retour sur investissement de dix-huit mois parie que le prix du professeur et le paysage des petits modèles resteront tous deux stables pendant un an et demi, ce que l'histoire récente dit que ce ne sera pas le cas. Si le chiffre de retour sur investissement ci-dessus dépasse quelques trimestres, la lecture honnête est généralement que vous devriez opter pour un modèle standard moins cher, une compression rapide ou une mise en cache d'abord - voir le calculateur d'économies de mise en cache rapide et le calculateur d'économies de routage modèle, qui génèrent tous deux une fraction de l’économie pour une fraction de l’engagement. La distillation gagne sa place sur des tâches à volume élevé, étroites et stables, et est punie partout ailleurs. Comparez avec un réglage fin direct avec le calculateur de réglage fin et d'invite, ou contre l'exécution du modèle vous-même avec le calculateur LLM vs API auto-hébergé.