—monatliche Rechnung
—pro Audiostunde
—ist Speech-to-Text
Wohin das Geld fließt – pro Sitzung
Eine Besprechung, aufgeteilt in drei abrechenbare Teile. Beachten Sie, dass das Transkript, das das Modell liest, und die Zusammenfassung, die es schreibt, neben dem Audio, das es transkribieren musste, fast kostenlos sind.
| Komponente | Größe | Kosten / Treffen | Aktie |
|---|
Bauen Sie Ihren eigenen Platz im Vergleich zu einem SaaS-Platz – die Gewinnschwelle
Für ein Abonnement wird eine Pauschalgebühr erhoben, unabhängig davon, wie viel Sie aufnehmen. Ihre eigenen Pipeline-Gebühren pro Sitzung ohne Mindestpreis. Jede Zeile stellt ein monatliches Volumen dar: In der API-Spalte steht, was Sie bezahlen würden, in der Sitzplatz-Spalte ist die Pauschalgebühr und der Gewinner wechselt, sobald Sie genug erfasst haben.
| Treffen / Monat | Ihre API-Kosten | SaaS-Sitz | Günstiger |
|---|
Die Zusammenfassung ist kostenlos; Sie zahlen für das Mikrofon
Jeder, der einen internen Notator baut, macht sich auf eine große Rechnung für ein Sprachmodell gefasst und stellt dann fest, dass das Modell der billigste Teil des Ganzen ist. Die Rechnung ist krass: Ein 45-minütiges Meeting besteht nur aus ein paar tausend gesprochenen Worten, was weit unter zehntausend Tokens liegt, und zusammenfassend lässt sich sagen, dass es bei einem günstigen Modell nur den Bruchteil eines Cents kostet – man könnte über das LLM tausend Meetings zum Preis eines Sandwichs abhalten. Was tatsächlich Geld kostet, ist der Speech-to-Text-Pass, denn er wird pro Minute Audio abgerechnet und jede Sekunde muss verarbeitet werden, egal ob jemand spricht oder nicht. Der entscheidende Hebel ist also nicht, welches Grenzmodell die Zusammenfassung schreibt; Dabei handelt es sich um Ihre Transkriptionsrate und die Anzahl der von Ihnen aufgezeichneten Besprechungen. Das stellt die gesamte Bau-gegen-Kauf-Frage neu dar. Ein SaaS-Sitz ist eine Pauschalgebühr, die für jemanden, der den ganzen Tag aufeinanderfolgende Telefongespräche führt, sinnvoll ist, aber für ein Team, das eine Handvoll Besprechungen pro Woche aufzeichnet, kostet eine Do-it-yourself-Pipeline ein paar Dollar pro Monat und die Gewinnschwelle ist bei weitem nicht erreicht. Passen Sie die Transkriptionsseite genau an Transkriptionskostenrechner, Preis der Zusammenfassungstoken auf dem Token-Zähler, und vergleichen Sie den Pauschalpreis-Kompromiss direkt mit dem SaaS vs. API-Kostenrechner.
TranskriptionskostenSpeech-to-Text-KostenToken-ZählerSaaS vs. APIChatbot-Kosten
So funktioniert dieser Rechner
Der Preis für jedes Treffen besteht aus zwei Teilen. Die Speech-to-Text-Kosten sind die Besprechungsdauer in Minuten multipliziert mit Ihrer Transkriptionsrate pro Minute. Die Zusammenfassungskosten lesen ein Transkript, dessen Größe aus der Länge mal Wörtern pro Minute mal etwa 1,33 Token pro Wort zum Eingabepreis und der von Ihnen angeforderten Zusammenfassung zum Ausgabepreis berechnet wird. Addiert man beides, ergeben sich die Kosten pro Sitzung; Die Multiplikation mit den Sitzungen pro Monat ergibt die monatliche Rechnung, und die Division durch die Sitzungsdauer ergibt den Wert pro Audiostunde. Der Speech-to-Text-Anteil ist der erste Teil der Gesamtmenge. In der Break-Even-Tabelle werden die monatlichen Kosten für eine Reihe von Volumina erneut berechnet und mit dem von Ihnen eingegebenen Pauschal-SaaS-Platz verglichen, sodass Sie genau sehen können, wo der Kauf den Aufbau übertrifft.
Häufig gestellte Fragen
Was kostet es eigentlich, einen KI-Meetingnotizer selbst zu leiten?
Weit weniger, als die meisten Leute erwarten – normalerweise ein paar Cent pro Sitzung. Ein Notizzettel besteht aus zwei API-Aufrufen: einem Speech-to-Text-Durchlauf, der Audio in ein Transkript umwandelt, und einem Sprachmodell-Durchlauf, der das Transkript in eine Zusammenfassung mit Aktionselementen umwandelt. Speech-to-Text wird nach Audiominute abgerechnet, sodass ein 45-minütiges Meeting bei etwa einem Cent pro Minute etwa einen viertel bis halben Dollar kostet. Man geht davon aus, dass das Geld in die Zusammenfassung fließt, aber ein vollständiges Transkript kostet nur etwa achttausend Token, und die Zusammenfassung auf einem billigen Modell kostet den Bruchteil eines Cents.
Warum ist Speech-to-Text der größte Kostenfaktor, nicht die KI-Zusammenfassung?
Denn für die Transkription wird die Audiominute berechnet, während für die Zusammenfassung der Preis pro Token berechnet wird und ein Meeting im Verhältnis zu seiner Laufzeit nur sehr wenige Token generiert. Die Leute sprechen ungefähr 130 Wörter pro Minute, sodass das Modell selbst bei einer langen Besprechung deutlich weniger als zehntausend Token zum Lesen benötigt. Der Speech-to-Text-Durchlauf muss jede Audiosekunde verarbeiten und wird entsprechend abgerechnet, sodass er in der Regel den überwiegenden Teil der Rechnung ausmacht.
Ist es günstiger, einen eigenen Notizzettel zu bauen oder für Otter oder Fireflies zu bezahlen?
Es hängt davon ab, wie viele Besprechungen Sie aufzeichnen. Ein SaaS-Protokollierer berechnet eine monatliche Pauschalgebühr für Sitzplätze, unabhängig davon, ob Sie zwei oder zweihundert Meetings aufzeichnen, während eine Do-it-yourself-Pipeline pro Meeting ohne Mindestgebühr abrechnet. Die API-Route gewinnt für leichte und mittelschwere Benutzer und die SaaS-Route für starke Benutzer, und es gibt eine Break-Even-Anzahl von Meetings, bei denen sie sich kreuzen – dieser Rechner gibt sie direkt aus. Denken Sie daran, dass der SaaS-Preis auch Integrationen, Lautsprecheretiketten und eine ausgefeilte Benutzeroberfläche beinhaltet.
Wie schätze ich die symbolischen Kosten für die Zusammenfassung einer Besprechung ein?
Multiplizieren Sie die Minuten mit Wörtern pro Minute, um die Wortanzahl zu erhalten, und dann mit etwa 1,33, um Wörter in Token umzuwandeln – so liest sich das zusammenfassende Modell. Fügen Sie die gewünschte Zusammenfassungslänge in den niedrigen Hunderten von Token hinzu. Bewerten Sie die Eingabe mit der Eingaberate des Modells pro Million Token und die Ausgabe mit ihrer Ausgaberate. Bei einem typischen Meeting beträgt dieser Bruchteil eines Cents, das Geld fließt also in die Speech-to-Text-Rate und die Anzahl der Meetings ein, nicht in die Token.