1
00:00:00,240 --> 00:00:03,680
In dieser Folge tauchen wir tief
in die Kosten des AI Codings 

2
00:00:03,680 --> 00:00:05,600
ein. 
Warum wächst der Tokenverbrauch 

3
00:00:05,600 --> 00:00:08,720
in langen Session auf einmal 
exponentiell, was kostet 

4
00:00:08,720 --> 00:00:11,200
eigentlich die meisten Tokens, 
welchen Einfluss haben 

5
00:00:11,200 --> 00:00:14,320
Inputlängen, MCP Tools und die 
Chat Historie? 

6
00:00:14,720 --> 00:00:18,080
Wir diskutieren sinnvolle 
Strategien für gezieltes 

7
00:00:18,080 --> 00:00:21,520
Kontextmanagement, prüfen 
Maßnahmen wie Tasksplitting, 

8
00:00:21,520 --> 00:00:25,440
Modellauswahl, Subagents und 
auch den populären Cave Man 

9
00:00:25,440 --> 00:00:29,600
Modus und klären, wann KI 
Agenten wirklich wirtschaftlich 

10
00:00:29,600 --> 00:00:32,240
bleiben. 
Bereit deinen Einsatz von KI 

11
00:00:32,240 --> 00:00:34,560
effizienter zu machen, dann 
bleib dran. 

12
00:00:40,080 --> 00:00:44,320
Und damit herzlich willkommen 
zum To do Developer Podcast, 

13
00:00:44,320 --> 00:00:47,800
Eurem deutschsprachigen 
Developer Podcast hier mit Folge

14
00:00:47,800 --> 00:00:50,760
163. 
Und heute geht es um die echten 

15
00:00:50,760 --> 00:00:54,960
Kosten von AI Coding Assistance 
und wie immer hört ihr hier am 

16
00:00:55,200 --> 00:00:58,800
Mikrofon Robin Manuel Thiel und 
mich, malte Lantin Robin Manuel 

17
00:00:58,800 --> 00:01:02,240
ist Director AI und Cloud beim E
Commerce Soft Unternehmen jtl 

18
00:01:02,240 --> 00:01:05,600
ich bin Solution Engineer bei 
github, den Podcast machen wir 

19
00:01:05,840 --> 00:01:08,800
aber natürlich in unserer 
Freizeit und wie auch dieses. 

20
00:01:10,120 --> 00:01:14,160
Mal am Wochenende berichten, 
aber hier auch auf Basis unserer

21
00:01:14,160 --> 00:01:18,320
Praxiserfahrung, unserer 
täglichen Nutzung mit all diesen

22
00:01:18,320 --> 00:01:22,880
spannenden Developer Tools und 
in den letzten 2 Jahren 

23
00:01:22,880 --> 00:01:27,440
zumindest gehören Coding Agents 
zu den spannendsten Developer 

24
00:01:27,440 --> 00:01:31,200
Tools und da soll es heute mal 
um einen anderen Aspekt gehen 

25
00:01:31,200 --> 00:01:34,760
und zwar wie halte ich die 
Kosten unter Kontrolle, weil wir

26
00:01:34,760 --> 00:01:38,000
wissen alle diese Coding 
Assistance nutzen Large language

27
00:01:38,000 --> 00:01:41,400
Models, diese brauchen. 
Relativ teure Hardware und 

28
00:01:41,400 --> 00:01:45,120
dementsprechend kann es ja sein,
dass hier und da mal die Kosten 

29
00:01:45,120 --> 00:01:48,400
aus dem Ruder laufen. 
Und wer so viel wie wir mit den 

30
00:01:48,400 --> 00:01:51,240
ganzen Coding Agenten Rumspielt 
oder auch wie es in den letzten 

31
00:01:51,240 --> 00:01:54,480
News folgen gehört hat, dass 
sich auch die Preispolitik 

32
00:01:54,480 --> 00:01:56,320
diverser Anbieter sich immer 
wieder ändert. 

33
00:01:57,160 --> 00:01:59,120
Der oder diejenige wird bestimmt
auch schon an die ein oder 

34
00:01:59,120 --> 00:02:01,600
anderen Limits gelaufen sein, 
entweder weil die inkludierten 

35
00:02:01,600 --> 00:02:05,120
Tokens mit der Subscription 
vielleicht aufgebraucht waren, 

36
00:02:05,120 --> 00:02:08,080
oder weil man zu viele Anfragen 
gleichzeitig geschickt hat und 

37
00:02:08,160 --> 00:02:10,960
ein Tropic einen vielleicht Rate
Limited und da kann man dann 

38
00:02:10,960 --> 00:02:15,200
entweder Münzen einwerfen oder 
einfach ein bisschen warten und 

39
00:02:15,200 --> 00:02:19,440
Münzen einwerfen könnt ihr auch 
bei diesem Podcast und Münzen in

40
00:02:19,440 --> 00:02:23,080
Form von Kaffee, das hilft ja 
bekanntlich beim Coden, hilft ja

41
00:02:23,080 --> 00:02:26,360
Koffein und ihr. 
Als Community gebt uns auch 

42
00:02:26,360 --> 00:02:28,520
immer ganz fleißig für die 
Folgen, die ihr hört, Kaffee aus

43
00:02:28,520 --> 00:02:31,040
und da sind wir aber ganz 
gerührt und so hat es auch der 

44
00:02:31,200 --> 00:02:33,560
Christoph dieses Mal wieder 
getan und uns einen Kaffee 

45
00:02:33,600 --> 00:02:35,840
ausgegeben. 
Ganz ganz lieben Dank, wenn auch

46
00:02:35,840 --> 00:02:38,400
ihr uns einen Kaffee ausgeben 
möchtet, hier für den Podcast 

47
00:02:38,400 --> 00:02:41,360
und Euch die Folge gefallen hat,
dann findet ihr einen Link zu 

48
00:02:41,360 --> 00:02:43,600
bei mir Coffee unten in den 
Shownotes. 

49
00:02:43,840 --> 00:02:47,760
Und damit genug der Vorrede. 
Lasst uns ins Thema einsteigen 

50
00:02:47,760 --> 00:02:52,080
und wir versetzen uns mal so in 
die Rolle von. 

51
00:02:52,880 --> 00:02:56,880
Einem Developer, der gerade in 
einer Coding Session ist und 

52
00:02:56,880 --> 00:03:01,840
irgendwann mitten in der Session
merken wir unsere Token Limits 

53
00:03:01,840 --> 00:03:04,640
sind ausgeschöpft. 
Also das was mir mein 

54
00:03:04,640 --> 00:03:08,160
Arbeitgeber zur Verfügung stellt
oder das was mir mein Tool 

55
00:03:08,160 --> 00:03:11,880
Anbieter gerade gibt, die 
Anbieter, die arbeiten ja ein 

56
00:03:11,880 --> 00:03:14,000
bisschen unterschiedlich, je 
nachdem ob ich da so eine 

57
00:03:14,000 --> 00:03:17,680
private Subscription irgendwie 
für $20 im Monat habe oder ob 

58
00:03:18,000 --> 00:03:19,520
ich das über meinen Arbeitgeber 
beziehe. 

59
00:03:20,920 --> 00:03:24,080
Aber in beiden Fällen kann es 
passieren, dass wenn ich nicht 

60
00:03:24,080 --> 00:03:28,600
aufpasse, mitten im 
Arbeitsalltag mir dann plötzlich

61
00:03:28,600 --> 00:03:31,520
Limits angezeigt werden und 
plötzlich mein Coding Agent 

62
00:03:31,520 --> 00:03:35,200
aufhört zu arbeiten und ich dann
aufgefordert werde, entweder ein

63
00:03:35,200 --> 00:03:38,160
paar Stunden zu warten, was 
natürlich irgendwie im 

64
00:03:38,160 --> 00:03:40,400
Arbeitsalltag ganz praktisch 
sein kann, weil ich dann 

65
00:03:40,400 --> 00:03:44,080
vielleicht früher Feierabend 
mache oder ich entsprechend 

66
00:03:44,720 --> 00:03:47,840
Münzen nachwerfen muss. 
Und das wollen wir natürlich 

67
00:03:47,840 --> 00:03:51,520
verhindern und. 
Ich glaube, wir alle nutzen sie,

68
00:03:51,520 --> 00:03:55,200
egal ob es jetzt irgendwie 
persor Cloud Code, get up Code 

69
00:03:55,200 --> 00:03:59,760
Pilot Germany CLI oder Open Code
oder was auch immer ist. 

70
00:04:00,480 --> 00:04:04,000
Am Ende stehen wir alle vor den 
gleichen Herausforderungen. 

71
00:04:04,800 --> 00:04:06,840
Und trotzdem sehen diese 
Herausforderungen oder zumindest

72
00:04:06,840 --> 00:04:09,120
diese Limits ja überall so ein 
bisschen anders aus. 

73
00:04:09,520 --> 00:04:11,480
Während ich jetzt, ich habe ja 
sogar schon bei Entropic 2 

74
00:04:11,480 --> 00:04:13,760
verschiedene Möglichkeiten, zum 
Beispiel Cloud Code zu 

75
00:04:13,760 --> 00:04:15,640
verwenden. 
Du hast gerade gesagt, es gibt 

76
00:04:15,640 --> 00:04:17,680
so Subscriptions, $20 oder auch 
bis zu $200. 

77
00:04:19,160 --> 00:04:21,920
Kann man dafür bezahlen und hat 
dann verschiedene Usage Limits 

78
00:04:22,240 --> 00:04:25,200
oder man kann sagen, das ist mir
alles total egal. 

79
00:04:25,200 --> 00:04:28,320
Ich hole mir direkt Zugang zu 
einem Modell von einem Tropic 

80
00:04:28,320 --> 00:04:31,880
und Kriege davon ein API Key und
werde dann wirklich entsprechend

81
00:04:31,880 --> 00:04:34,800
nach den verbrauchten Tokens 
abgerechnet. 

82
00:04:35,200 --> 00:04:37,240
Das heißt da kann ich bei dem 
einen habe ich wirklich ich 

83
00:04:37,240 --> 00:04:39,520
kaufe einfach, also ein Token 
hat einen Preis, kommt ein 

84
00:04:39,520 --> 00:04:42,720
bisschen auf das Modell an und 
danach werde ich dann 

85
00:04:42,960 --> 00:04:45,040
entsprechend abgerechnet wenn 
ich mir jetzt irgendwie hier. 

86
00:04:45,720 --> 00:04:48,760
Cloud angucke, wenn ich das 
Cloud opus 47 ist glaube ich so 

87
00:04:48,760 --> 00:04:51,440
das wo die meisten, das ist 
gerade so eine der besten Coding

88
00:04:51,440 --> 00:04:56,400
Performances hat, da kosten mich
dann eine Millionen Input Tokens

89
00:04:56,400 --> 00:05:01,520
$5 und 1000000 Output Tokens 
$25,00 was genau das ist. 

90
00:05:01,520 --> 00:05:04,320
Da gehen wir gleich noch ein 
bisschen tiefer drauf rein oder 

91
00:05:04,320 --> 00:05:07,720
ich kaufe halt eine Subscription
unter anderem auch vielleicht 

92
00:05:07,720 --> 00:05:11,280
wenn ich bei Kodex zum Beispiel 
bin oder auch bei bei and Dropic

93
00:05:11,280 --> 00:05:13,960
oder bei Cursor oder zuletzt 
auch bei Gitar Co Pilot und. 

94
00:05:13,960 --> 00:05:15,200
Und da ist dann so ein bisschen 
versteckter. 

95
00:05:15,200 --> 00:05:17,760
Wieviel Tokens inkludiert das 
denn eigentlich? 

96
00:05:17,760 --> 00:05:19,960
Ich glaube, das ist auch bei den
meisten gar nicht so ganz 

97
00:05:19,960 --> 00:05:22,360
öffentlich gemacht. 
Natürlich erreiche ich die 

98
00:05:22,360 --> 00:05:24,800
inkludierten Limits auch immer 
häufiger, wenn ich ein sehr, 

99
00:05:24,800 --> 00:05:28,000
sehr, sehr, sehr, sehr 
performantes Modell benutze, 

100
00:05:28,880 --> 00:05:32,400
aber da ist es dann nicht mehr 
ganz so transparent und auch in 

101
00:05:32,400 --> 00:05:34,400
der letzten News Folge haben wir
ja gesagt, es geht da, Koop 

102
00:05:34,400 --> 00:05:37,360
heilt gerade so ein bisschen das
Pricing Modell umstellt von 

103
00:05:37,600 --> 00:05:41,720
Premium Request, also von dem 
Anstoßen einer eigentlichen, ja 

104
00:05:41,720 --> 00:05:46,400
agentischen Coding Sessions und.
Über zu echte Abrechnung von was

105
00:05:46,400 --> 00:05:48,760
verbraucht denn jetzt so eine 
Session, weil die können ja 

106
00:05:48,760 --> 00:05:52,560
komplett unterschiedlich sein. 
Das heißt, so ganz transparent 

107
00:05:52,560 --> 00:05:55,680
ist das auch alles gar nicht, 
wir hören nur immer häufiger 

108
00:05:55,680 --> 00:05:58,720
davon, dass man eben an diese 
Token Limits stößt. 

109
00:05:59,200 --> 00:06:03,160
Und gerade im beruflichen 
Kontext ist es ja so und da kann

110
00:06:03,160 --> 00:06:05,960
ich so ein bisschen aus meinem 
Arbeitsalltag sprechen, dass 

111
00:06:05,960 --> 00:06:10,800
diese Anbieter von den AI Coding
Tools ja in der Regel keinen 

112
00:06:10,880 --> 00:06:14,400
Festpreis anbieten und dann 
irgendwie so ein Zeitfenster, in

113
00:06:14,400 --> 00:06:17,320
dem du irgendwie was machen 
kannst, sondern du hast 

114
00:06:17,320 --> 00:06:20,600
tatsächlich eine in gewisser 
Weise verbrauchsorientierte 

115
00:06:20,600 --> 00:06:22,640
Abrechnung. 
Du hast ja gerade gesagt, bei 

116
00:06:22,640 --> 00:06:25,600
Gitter Co Pilot ändert es sich, 
aber es ändert sich von einer 

117
00:06:25,600 --> 00:06:26,880
Verbrauchsorientierten noch 
eine. 

118
00:06:27,440 --> 00:06:30,240
Neue Tokenbasierte, 
Verbrauchsorientierte Abrechnung

119
00:06:30,480 --> 00:06:32,880
und diese verbrauchsorientierte 
Abrechnung, die sehen wir auch 

120
00:06:32,880 --> 00:06:36,880
bei anderen Coding Agents, 
gerade im Unternehmenskontext, 

121
00:06:37,040 --> 00:06:39,960
wo wir halt nicht mit diesen 
pauschalen arbeiten, weil im 

122
00:06:39,960 --> 00:06:43,680
Unternehmenskontext macht das 
zum einen häufig gar nicht so 

123
00:06:43,680 --> 00:06:47,560
viel Sinn, weil wir natürlich da
nicht, wie gerade schon so 

124
00:06:47,560 --> 00:06:50,800
scherzhaft angedeutet, mitten im
Arbeitsalltag plötzlich den 

125
00:06:50,800 --> 00:06:53,040
Stecker ziehen wollen, sondern 
wir wollen den Leuten die 

126
00:06:53,040 --> 00:06:56,240
Möglichkeit geben, wirklich ihre
Use Cases auch. 

127
00:06:56,800 --> 00:06:59,640
Zu Ende zu bringen. 
Und zum anderen liegt das ja 

128
00:06:59,640 --> 00:07:02,280
auch daran, dass man bei dieser 
nutzungsbasierten Abrechnung 

129
00:07:02,280 --> 00:07:06,240
dann auch gerne diese 
volumenbasierten Verträge dann 

130
00:07:06,240 --> 00:07:09,440
abschließt, egal ob ich jetzt 
mit einem Hyperscaler oder mit 

131
00:07:09,440 --> 00:07:12,720
direkt mit so einem AI Coding 
Tool Anbietern Vertrag schließe,

132
00:07:12,960 --> 00:07:15,280
habe ich da natürlich auch die 
Möglichkeit mich zu einem 

133
00:07:15,280 --> 00:07:18,240
Gewissen. 
Zu einer gewissen Abnahmemenge 

134
00:07:18,560 --> 00:07:21,840
zu verpflichten und bekomme 
dementsprechend dann Discounts 

135
00:07:21,840 --> 00:07:25,080
auf diese Token Preise, so wie 
du es gerade genannt hattest. 

136
00:07:25,080 --> 00:07:27,360
Das sind natürlich die 
Listenpreise, die auf der 

137
00:07:27,360 --> 00:07:29,000
Webseite stehen. 
Das heißt, wenn ich jetzt mit 

138
00:07:29,000 --> 00:07:32,200
meiner Kreditkarte komme und 
mich da anmelde, zahle ich diese

139
00:07:32,200 --> 00:07:35,880
Preise, aber die Preise die 
Großkunden zahlen liegen 

140
00:07:35,880 --> 00:07:39,080
natürlich darunter, aber da 
stehen ja natürlich auch in der 

141
00:07:39,080 --> 00:07:42,440
Regel Hunderte oder Tausende 
Developer dahinter, die dann 

142
00:07:42,440 --> 00:07:44,400
gleichzeitig dieses Werkzeug 
einsetzen. 

143
00:07:45,360 --> 00:07:47,840
Das hat natürlich zum anderen 
den Nachteil, aber auch, dass 

144
00:07:47,840 --> 00:07:49,560
ich dann auch schon erlebt habe,
dass zum Beispiel das 

145
00:07:49,560 --> 00:07:52,160
Kontingent, was eine Firma 
kauft, von Einzelnen besonders 

146
00:07:52,160 --> 00:07:57,160
stark belastet wird und dann 
vielleicht einzelne das gesamte 

147
00:07:57,160 --> 00:07:58,480
Kontingent von einem Monat 
aufbraucht. 

148
00:07:58,480 --> 00:08:00,400
Das heißt, man muss das schon 
noch mal irgendwo auf einer pro 

149
00:08:00,400 --> 00:08:03,160
Kopf Ebene limitieren und zum 
anderen ist es teilweise gar 

150
00:08:03,160 --> 00:08:05,160
nicht so einfach, da wirklich 
noch mal bessere Preise als die 

151
00:08:05,160 --> 00:08:08,240
Listenpreise zu bekommen. 
Also ich habe zumindest selber 

152
00:08:08,240 --> 00:08:11,640
die Erfahrung gemacht, dass ein 
Tropic einen relativ arroganten 

153
00:08:11,640 --> 00:08:14,400
Sales hat und dass die mit 
vielen Firmen gar nicht. 

154
00:08:15,280 --> 00:08:17,760
Gar nicht sprechen. 
Einfach sagen, Kauf bitte die 

155
00:08:17,760 --> 00:08:20,480
Listenpreise ein und auch du 
hast mir ja schon von von 

156
00:08:20,480 --> 00:08:22,280
einigen Situationen erzählt, von
denen du gehört hast. 

157
00:08:22,280 --> 00:08:25,400
Wo jetzt End dropping zum 
Beispiel überhaupt nicht, ja 

158
00:08:25,400 --> 00:08:27,320
überhaupt nicht bereit ist, zum 
Beispiel von ihren Listenpreisen

159
00:08:27,320 --> 00:08:28,880
abzurücken, auch bei recht 
großen Kunden. 

160
00:08:29,200 --> 00:08:32,240
Ja, es hängt dann immer davon 
ab, wieviel du auch bereit bist 

161
00:08:32,240 --> 00:08:34,960
abzunehmen. 
Ich kann jetzt da keine Preise 

162
00:08:34,960 --> 00:08:37,440
nennen, die ich von den 
einzelnen Firmen hier irgendwie 

163
00:08:37,440 --> 00:08:41,440
über Hörensagen gehört habe, 
aber wir reden da tatsächlich um

164
00:08:41,600 --> 00:08:44,400
über Millionen, die du dann 
teilweise abnehmen musst. 

165
00:08:44,880 --> 00:08:48,720
Da unterscheidet sich dann 
vielleicht so ein oder Micro. 

166
00:08:48,720 --> 00:08:51,360
Friends, das ist genau. 
Da unterscheidet sich dann 

167
00:08:51,440 --> 00:08:54,800
irgendwie oder Microsoft Azure 
oder and Dropic gar nicht so 

168
00:08:54,800 --> 00:08:57,440
sehr voneinander. 
Da reden wir natürlich über ganz

169
00:08:57,440 --> 00:09:00,720
andere Volumina, das ist jetzt 
kein Kontingent, was man mal 

170
00:09:00,720 --> 00:09:03,360
eben so als kleines oder 
mittelständiges Unternehmen 

171
00:09:03,680 --> 00:09:06,800
abrufen würde und. 
Oder erst recht nicht als 

172
00:09:06,960 --> 00:09:09,520
Wochenenddeveloper. 
Aber dafür gibt es wiederum dann

173
00:09:09,520 --> 00:09:11,800
ja diese anderen Preismodelle, 
die dann ein bisschen anders 

174
00:09:11,800 --> 00:09:14,440
funktionieren, aber dann mit den
entsprechenden Einschränkungen 

175
00:09:14,440 --> 00:09:17,920
kommen, oder ich zahle halt die 
entsprechenden Listenpreise und 

176
00:09:17,920 --> 00:09:21,760
gerade wenn wir jetzt über 
wirklich größere Summen reden, 

177
00:09:21,840 --> 00:09:26,320
die ja dann nach oben hin sich 
irgendwie aufsummieren, dann 

178
00:09:26,320 --> 00:09:28,880
kommt häufig aus dem Management 
dann ja auch die Frage. 

179
00:09:29,360 --> 00:09:31,520
Lohnt sich das eigentlich? 
Also, wir geben jetzt wirklich 

180
00:09:31,520 --> 00:09:34,160
so viel Geld für 
Softwareentwicklung zusätzlich 

181
00:09:34,160 --> 00:09:38,320
aus zu dem, was wir ohnehin für 
unsere Developer bezahlen, lohnt

182
00:09:38,320 --> 00:09:41,680
sich das eigentlich, diese 
Coding Assistance überhaupt noch

183
00:09:41,680 --> 00:09:44,160
zu nutzen? 
Ja, aber fragt sich das wirklich

184
00:09:44,160 --> 00:09:46,560
jemand? 
Also ja, die werden teurer 

185
00:09:46,560 --> 00:09:49,000
gefühlt, gerade die Modelle 
werden auch mächtiger und 

186
00:09:49,000 --> 00:09:51,560
verbrauchen irgendwie mehr und 
irgendwie überall gehen die 

187
00:09:51,560 --> 00:09:54,320
Kosten nach oben, aber es fragt 
sich ja nicht wirklich jemand, 

188
00:09:54,320 --> 00:09:57,800
ob sich das lohnt. 
Also sag ich mal zwischen 20 und

189
00:09:57,800 --> 00:10:00,880
$200 irgendwie pro Person würde 
ich sie es als unstrittig 

190
00:10:00,880 --> 00:10:03,920
empfinden zu sagen, dass das 
meine Produktivität nicht 

191
00:10:03,920 --> 00:10:06,640
mindestens um etwas, was diesen 
wert hat steigert. 

192
00:10:06,640 --> 00:10:10,000
Wenn es dann irgendwann in die 
Tausende geht oder sowieso wie 

193
00:10:10,000 --> 00:10:13,000
Jensen Wang hier der Nvidia CEO 
gesagt hat, jeder der nicht 

194
00:10:13,000 --> 00:10:14,440
irgendwie mindestens sein 
eigenes Gehalt in Tokens 

195
00:10:14,440 --> 00:10:16,760
ausgibt, gehört eigentlich 
gefeuert, da hat vielleicht auch

196
00:10:16,760 --> 00:10:19,040
noch mal ein anderes Interesse 
daran, aber für mich stellt sich

197
00:10:20,000 --> 00:10:23,360
da nicht irgendwie wirklich die 
Frage, ob ob sich zumindest mal 

198
00:10:23,680 --> 00:10:27,120
irgendwie eine. 
Also zumindest die $20 

199
00:10:27,120 --> 00:10:29,760
subscription. 
Das ist nach wie vor no brainer 

200
00:10:29,760 --> 00:10:32,640
für mich. 
Ja, ist halt immer die Frage mit

201
00:10:32,640 --> 00:10:35,120
wem du sprichst und ich glaube, 
gerade in den 

202
00:10:35,120 --> 00:10:38,480
Entwicklungsabteilungen oder bei
den technischen Verantwortlichen

203
00:10:38,640 --> 00:10:40,880
ist glaube ich diese 
Argumentation, die du gerade 

204
00:10:40,880 --> 00:10:43,960
genannt hattest, absolut klar. 
Aber diese Zahlen werden 

205
00:10:43,960 --> 00:10:46,000
natürlich wie gesagt aggregiert 
und angenommen. 

206
00:10:46,000 --> 00:10:49,120
Du hast irgendwie 1000 developer
und dann 1000 * 150. 

207
00:10:51,320 --> 00:10:54,560
Haben wir schon eine große Summe
stehen die dann am Ende in der 

208
00:10:54,560 --> 00:10:57,440
Finanzabteilung auflaufen und in
der Finanzabteilung hat man dann

209
00:10:57,440 --> 00:11:00,360
vielleicht gar kein Verständnis 
und sagt Okay ich habe jetzt 

210
00:11:00,360 --> 00:11:03,760
hier einen gewissen Etat 
vorgesehen an Personalkosten für

211
00:11:03,760 --> 00:11:06,880
die Softwareentwicklung und für 
ein paar Software Tools, die ich

212
00:11:06,880 --> 00:11:08,800
auch eingekauft habe, und jetzt 
kommt plötzlich die 

213
00:11:08,800 --> 00:11:11,440
Entwicklungsabteilung und sagt, 
jetzt hätten wir gerne noch mal 

214
00:11:11,440 --> 00:11:16,440
hier irgendwie 200000€ pro Monat
mehr an Budget für die 

215
00:11:16,440 --> 00:11:19,680
Softwareentwicklung und da 
kommen dann natürlich die 

216
00:11:19,680 --> 00:11:22,320
Rückfragen. 
Lohnt sich das eigentlich? 

217
00:11:22,720 --> 00:11:26,400
Die Diskussion hatten wir vor 3 
Jahren auch schon und zu dem 

218
00:11:26,400 --> 00:11:29,200
Zeitpunkt hatten wir natürlich 
noch andere Modelle, mit denen 

219
00:11:29,200 --> 00:11:32,520
wir dort gearbeitet haben, also 
wir haben irgendwie nur Code 

220
00:11:32,520 --> 00:11:35,760
compreation oder nur Chat Agents
gehabt, die natürlich viel 

221
00:11:35,760 --> 00:11:41,400
weniger lm Tokens verbraucht 
haben, aber selbst da bei diesen

222
00:11:41,400 --> 00:11:45,240
niedrigen Preisen, die irgendwie
bei $20 plus minus Listenpreis 

223
00:11:45,240 --> 00:11:50,000
im Monat pro User lagen. 
Gab es viele Diskussionen, lohnt

224
00:11:50,000 --> 00:11:52,960
sich dieses Investment 
eigentlich und jetzt, wo es 

225
00:11:52,960 --> 00:11:55,280
teurer wird, wird es diese 
Diskussion glaube ich 

226
00:11:55,280 --> 00:11:57,200
wiedergeben. 
Also du hattest wirklich mit 

227
00:11:57,200 --> 00:11:59,400
potenziellen getap Kunden 
Diskussionen, ob sich 15€ im 

228
00:11:59,400 --> 00:12:01,840
Monat, ob da ein Return of 
Invest drin ist. 

229
00:12:02,000 --> 00:12:04,400
Damals konnte das wahrscheinlich
Autor Vervollständigung und 

230
00:12:04,400 --> 00:12:07,040
vielleicht einzelne Chap 
Anfragen, aber da hast du schon 

231
00:12:07,040 --> 00:12:08,800
Diskussionen, ja. 
Ja, absolut. 

232
00:12:08,800 --> 00:12:11,320
Und ich glaube, jetzt haben 
mittlerweile alle verstanden, 

233
00:12:11,320 --> 00:12:13,720
dass der Return on Investment da
ist. 

234
00:12:13,720 --> 00:12:16,960
Wenn man diese ki tools. 
Verwendet aber, wenn man 

235
00:12:16,960 --> 00:12:20,480
natürlich dann in den Preisen 
nach oben geht, weil diese Tools

236
00:12:20,480 --> 00:12:23,920
werden mächtiger, aber damit 
werden sie leider auch teurer, 

237
00:12:24,160 --> 00:12:27,160
gerade wenn man sich die die 
echten Kosten dahinter ansieht. 

238
00:12:27,160 --> 00:12:30,280
Man sieht es ja auch in den 
ganzen Investitionen, jetzt 

239
00:12:30,280 --> 00:12:32,880
kamen gerade wieder die 
Quartalszahlen von den ganzen 

240
00:12:34,000 --> 00:12:36,360
Technologieunternehmen in den 
USA und wenn man sich da 

241
00:12:36,360 --> 00:12:40,720
anschaut, wie viele Milliarden 
die pro Quartal wirklich in 

242
00:12:40,800 --> 00:12:45,160
Rechenzentrumsinfrastruktur für 
diese KI investieren, dann kann 

243
00:12:45,160 --> 00:12:47,600
man sich. 
Vorstellen, dass irgendwie 

244
00:12:47,600 --> 00:12:51,680
dieses Geld natürlich auch 
wieder eingenommen werden muss. 

245
00:12:51,840 --> 00:12:56,160
Und umso komplexer die Aufgaben 
sind, die wir an diese KI 

246
00:12:56,160 --> 00:12:58,400
Systeme geben, umso mehr 
Rechenleistung brauchen wir, 

247
00:12:58,400 --> 00:13:02,960
umso mehr RAM brauchen wir und 
umso höher sind letzten Endes 

248
00:13:02,960 --> 00:13:06,000
für die Nutzer auch die Kosten. 
Ja, das ist dann auch so ein 

249
00:13:06,000 --> 00:13:07,760
bisschen der Grund. 
Wir haben gerade schon gesagt, 

250
00:13:07,760 --> 00:13:09,960
es gibt so ein bisschen das 
Gefühl, dass KI Coding irgendwie

251
00:13:09,960 --> 00:13:12,360
teurer wird. 
Und das liegt nicht nur an den 

252
00:13:12,360 --> 00:13:14,320
Modellen, sondern weil einfach 
eben auch die Aufgaben komplexer

253
00:13:14,320 --> 00:13:15,400
werden. 
Also wenn wir uns mal angucken, 

254
00:13:15,400 --> 00:13:18,480
warum wird das denn teurer, 
dann, weil gerade bei so 

255
00:13:18,480 --> 00:13:22,240
agentischen Loops, die sich 
irgendwie mehrfach im Kreis 

256
00:13:22,240 --> 00:13:25,680
drehen, Tools aufrufen und so 
weiter da wird erstmal der Input

257
00:13:25,680 --> 00:13:29,600
sehr sehr schnell groß, weil ich
habe Sachen wie Systempromps 

258
00:13:29,600 --> 00:13:32,240
drin, okay ich vorher auch da 
eine längere Chat Historie, dann

259
00:13:32,320 --> 00:13:35,960
zieht sich das Ding immer mehr 
Dateien ran, quasi in den 

260
00:13:35,960 --> 00:13:38,000
Kontext, dann führst du 
irgendwelche Tools aus und hat 

261
00:13:38,000 --> 00:13:40,640
davon die Logs in den Tools oder
von meinen Tests. 

262
00:13:41,080 --> 00:13:44,640
Dann macht es irgendwelche Git 
commits und hat so Git diffs auf

263
00:13:44,640 --> 00:13:48,320
einmal alles alles im Kontext 
mit drin irgendwelche Terminal 

264
00:13:48,320 --> 00:13:51,160
Outputs, denn macht es irgendwie
einen Tool Call mit dem Kontext 

265
00:13:51,160 --> 00:13:54,600
7 MCP Server oder redet mit der 
github API um vielleicht einen 

266
00:13:54,600 --> 00:13:58,000
issue zu erstellen oder redet 
mit Atlassian um sich irgendwie 

267
00:13:58,000 --> 00:14:01,760
eine Confluence Seite zu holen 
und da habe ich dann ja super 

268
00:14:01,760 --> 00:14:05,160
schnell dieses Token window und 
da haben wir gerade schon gesagt

269
00:14:05,160 --> 00:14:08,480
so 1000000 Token kosten ungefähr
$5. 

270
00:14:09,320 --> 00:14:11,760
Das ist dann schon relativ 
schnell voll, wenn ich eben 

271
00:14:11,760 --> 00:14:14,680
agentisch arbeite und halt immer
wieder über so ne Schleife 

272
00:14:14,680 --> 00:14:18,400
iteriere und der ergänzt sich 
selber im Prinzip den Kontext 

273
00:14:18,400 --> 00:14:21,200
immer voller Macht. 
Ja, und wenn man sich noch nicht

274
00:14:21,200 --> 00:14:23,520
mit diesen Agenten wirklich 
unter der Haube beschäftigt hat,

275
00:14:23,520 --> 00:14:25,640
dann ist einem vielleicht das 
Prinzip nicht so vertraut. 

276
00:14:25,640 --> 00:14:28,880
Aber am Ende ist es eine 
Schleife, in der so ein Large 

277
00:14:28,880 --> 00:14:33,000
Language Model aufgerufen wird. 
Das heißt, man liest erst 

278
00:14:33,000 --> 00:14:37,720
entweder den System prompt und 
den User Input, dann plant man 

279
00:14:37,720 --> 00:14:41,360
eine Aufgabe, man führt ein paar
Tools aus und interpretiert dann

280
00:14:41,360 --> 00:14:45,200
das Ergebnis, was vom Large 
Language Model mit oder 

281
00:14:45,200 --> 00:14:48,800
basierend auf diesem ganzen 
Input zurückkommt, dann. 

282
00:14:49,680 --> 00:14:52,120
Verarbeitet man das und gibt es 
dann wieder an das Large 

283
00:14:52,120 --> 00:14:56,200
Language Model, das heißt im 
Rahmen dieser Schleifen, wird 

284
00:14:56,200 --> 00:14:58,960
natürlich die Menge an 
Informationen, die wir jedes Mal

285
00:14:58,960 --> 00:15:02,400
reingeben, theoretisch immer ein
bisschen größer, weil ja immer 

286
00:15:02,400 --> 00:15:07,000
mehr wissen dazu kommt und am 
Ende ja dieses Large Language 

287
00:15:07,000 --> 00:15:11,440
Model selber ja eigentlich kein 
Memory hat, also immer mehr 

288
00:15:11,440 --> 00:15:15,120
dieser Modelanbieter führen zwar
einen Caching ein. 

289
00:15:15,680 --> 00:15:19,040
Dieses Caching führt aber nur 
dazu, dass wir tatsächlich nicht

290
00:15:19,200 --> 00:15:23,360
jedes Mal alle diese Input Input
Tokens neu einlesen müssen. 

291
00:15:23,360 --> 00:15:27,440
Das heißt, diese werden zwar 
zwischengespeichert und können 

292
00:15:27,440 --> 00:15:30,800
dann günstiger ausgelesen 
werden, aber das setzt auch 

293
00:15:30,800 --> 00:15:34,520
voraus, dass diese Informationen
sich nicht verändern, das heißt,

294
00:15:34,520 --> 00:15:37,880
wir haben da so eine gewisse 
Reihenfolge, also den System 

295
00:15:37,880 --> 00:15:41,280
prompt, dann haben wir das, was 
wir vielleicht in unserer. 

296
00:15:42,000 --> 00:15:45,120
Agents MD haben oder eine Cloud 
MD, was auch statisch ist. 

297
00:15:45,120 --> 00:15:47,280
Und dann haben wir den 
veränderlichen Teil, also den 

298
00:15:47,280 --> 00:15:51,520
User prompt oder den Tool Output
und alles was sich nicht 

299
00:15:51,520 --> 00:15:55,240
verändert über diese Loops 
hinweg können wir cashen und 

300
00:15:55,240 --> 00:15:57,720
damit die Kosten so ein bisschen
reduzieren, bedeutet aber auch 

301
00:15:57,720 --> 00:16:00,280
für uns, dass wir aufpassen 
müssen, dass diese Dinge 

302
00:16:00,280 --> 00:16:03,360
wirklich konstant bleiben, aber 
am Ende im Rahmen so einer 

303
00:16:03,360 --> 00:16:06,000
agentischen Session und du hast 
ja auch mal selber erzählt, dass

304
00:16:06,240 --> 00:16:09,280
bei dir die Agenten auch gerne 
mal mehrere Stunden laufen. 

305
00:16:09,880 --> 00:16:13,520
Da kann man sich schon 
überlegen, dass da extrem viel 

306
00:16:13,760 --> 00:16:17,680
an Tokens auch zusammenkommt für
diejenigen, die sich noch nicht 

307
00:16:17,680 --> 00:16:21,600
damit beschäftigt haben. 
So ein Token ist quasi die 

308
00:16:21,600 --> 00:16:24,920
menschliche Sprache, die wir 
eigentlich in Wörtern und 

309
00:16:24,920 --> 00:16:28,240
Grammatik aufbauen, 
Runtergebrochen in einzelne 

310
00:16:28,240 --> 00:16:32,720
Brocken, die dann so ein 
neuronales Netzwerk verarbeiten 

311
00:16:32,720 --> 00:16:36,560
kann und mit entsprechenden 
Gewichten versehen, um einen 

312
00:16:36,560 --> 00:16:39,800
Output zu generieren, quasi 
durchdenken kann und. 

313
00:16:39,920 --> 00:16:42,720
Und diese Tokens werden halt 
gezählt und das ist der 

314
00:16:42,720 --> 00:16:46,640
Industriestandard, auf dessen 
Basis am Ende die Arbeit des 

315
00:16:46,640 --> 00:16:48,400
Lush Language Models abgerechnet
wird. 

316
00:16:49,120 --> 00:16:51,040
Okay also das können wir schon 
mal festhalten, nicht der 

317
00:16:51,040 --> 00:16:53,600
Einzelne. 
Prompt macht jetzt irgendwie ki 

318
00:16:53,600 --> 00:16:55,400
Coding teuer. 
Sondern eben die. 

319
00:16:55,400 --> 00:16:58,720
Summe aus diesen vielen 
Agentenschritten mit einem 

320
00:16:58,720 --> 00:17:01,680
wachsendem Kontext und natürlich
auch einem wachsendem Output, 

321
00:17:01,680 --> 00:17:03,880
der dann im Blödsinn von dann 
noch ungefiltert ist. 

322
00:17:03,880 --> 00:17:05,319
Was? 
Bevor wir reingehen, wie ich 

323
00:17:05,319 --> 00:17:06,880
jetzt irgendwie so was 
optimieren kann, lass uns mal 

324
00:17:06,880 --> 00:17:09,319
kurz verstehen, was kostet das 
denn jetzt eigentlich wirklich, 

325
00:17:09,319 --> 00:17:11,760
also worüber reden wir denn da, 
wie teuer ist denn eigentlich am

326
00:17:11,760 --> 00:17:15,599
Ende so ein Task und man redet 
immer von diesem Preis für 

327
00:17:15,599 --> 00:17:18,680
1000000 Tokens. 
Ich habe gerade mal, haben wir 

328
00:17:18,680 --> 00:17:21,680
gerade schon gesagt, Cloud Opus 
47 wahrscheinlich ist gerade 

329
00:17:22,000 --> 00:17:25,839
einer der mächtigsten Coding 
Modelle mit gpd 55. 

330
00:17:26,599 --> 00:17:29,240
Das kostet halt $25,00 pro 
1000000 Output Tokens. 

331
00:17:29,240 --> 00:17:32,760
Also ich bin hier gerade auf 
lmstats.com und da kann man 

332
00:17:33,040 --> 00:17:34,960
immer so ein bisschen gucken, 
was kosten diese Tokens 

333
00:17:34,960 --> 00:17:37,920
eigentlich und wie teuer sind 
die Modelle und die 

334
00:17:37,920 --> 00:17:40,120
unterscheiden wie gesagt eben 
zwischen Input Tokens, also das 

335
00:17:40,120 --> 00:17:43,040
was wir ihnen über diese Prompts
Reingeben und Output Tokens, das

336
00:17:43,040 --> 00:17:46,560
was sie dann selber ein Output 
daraus generieren müssen und da 

337
00:17:46,560 --> 00:17:50,280
haben wir gesagt $5 pro 1000000 
Input Tokens, $25 pro 1000000 

338
00:17:50,280 --> 00:17:54,600
Output Tokens für Cloud Opus 47 
jetzt einfach mal im Vergleich. 

339
00:17:54,600 --> 00:17:58,720
Ich habe jetzt hier einfach mal.
Kimi 26 aufgemacht und da werden

340
00:17:58,720 --> 00:18:01,200
auch verschiedene Anbieter 
verglichen und daher zahle ich 

341
00:18:01,200 --> 00:18:06,920
zum Beispiel für 1000000 Input 
Tokens nur 0,95€ statt $5 und 

342
00:18:06,920 --> 00:18:11,680
für 1000000 Output Tokens nur $4
statt $25 und Kimi 26 ist 

343
00:18:11,680 --> 00:18:15,280
zumindest eine, ich sag mal 
vergleichbare Performance zu dem

344
00:18:15,280 --> 00:18:19,480
Cloud Opus 47 Modell ist nicht 
ganz so gut, aber wird auch so 

345
00:18:19,480 --> 00:18:22,000
ein bisschen unter der Hand 
hinter vorgehaltener Hand 

346
00:18:22,000 --> 00:18:25,240
gemunkelt, dass die. 
Bikini Modelle ohnehin mit Hilfe

347
00:18:25,240 --> 00:18:28,320
der Cloud Modelle dann auch noch
mal trainiert werden. 

348
00:18:28,720 --> 00:18:31,280
Das heißt man sieht schon, da 
sind ganz schöne Diskrepanzen in

349
00:18:31,280 --> 00:18:32,880
den in den Preisen. 
Wir reden jedes Mal über die 

350
00:18:32,880 --> 00:18:36,360
gleichen 1000000 Tokens und was 
kann ich jetzt machen mit so 

351
00:18:36,360 --> 00:18:39,360
einer 1000000 Tokens ungefähr 50
bis 60000 Zeilen Code zum 

352
00:18:39,360 --> 00:18:41,520
Beispiel verarbeiten klingt 
jetzt erstmal sehr viel das 

353
00:18:41,520 --> 00:18:44,320
wahrscheinlich nicht das was man
coling Agent sich in einem Lauf 

354
00:18:44,320 --> 00:18:49,080
angucken muss. 
Aber das sind ja nicht 50000 

355
00:18:49,080 --> 00:18:51,520
Zeilen von meinem Code, sondern 
das sind 50000. 

356
00:18:51,760 --> 00:18:53,720
Sind vielleicht ein paar 100 
Zeilen von meinem Code und dann 

357
00:18:53,720 --> 00:18:56,240
werden Zwischenergebnisse 
produziert, dann wird ein Test 

358
00:18:56,240 --> 00:18:59,560
Call ausgeführt, dann wird sich 
Dokumentation in den Kontext 

359
00:18:59,560 --> 00:19:02,320
geholt und so füllen sich eben 
auf 50000 Zeilen relativ 

360
00:19:02,320 --> 00:19:05,360
schnell. 
Was würdest du sagen, weil was 

361
00:19:05,360 --> 00:19:08,720
hast du so ein Gefühl dafür was 
was so normale Coding task oder 

362
00:19:08,720 --> 00:19:11,240
so normale Aufgaben kosten? 
Also wenn ich jetzt irgendwie 

363
00:19:11,240 --> 00:19:14,000
sage Hey das und das ist eine 
typische Aufgabe die ich meinem 

364
00:19:14,000 --> 00:19:16,400
Coding Agenten gebe. 
Was kostet so ein Task? 

365
00:19:16,800 --> 00:19:20,160
Ja, ich glaube, wenn du so eine 
etwas länger laufende Aufgabe 

366
00:19:20,160 --> 00:19:23,800
hast, die halt nicht ultra 
komplex ist, aber auch jetzt 

367
00:19:23,800 --> 00:19:27,760
nicht einfach nur das verändern 
von wenigen Zeilen Code, dann 

368
00:19:27,760 --> 00:19:31,200
kann das auch schon mal so 
Richtung von irgendwie 12 $3 

369
00:19:31,200 --> 00:19:34,520
gehen und ich finde es 
interessant, wenn man dann sich 

370
00:19:34,520 --> 00:19:37,480
auch anschaut, was die 
Abschätzung von Anthropic für so

371
00:19:37,480 --> 00:19:41,920
ein Code Review ist, wo man ja 
so einen gesamten Change Set von

372
00:19:41,920 --> 00:19:44,560
so einem Pull Request durchgeht 
und die solche. 

373
00:19:46,040 --> 00:19:49,200
Also die Pro Request sind ja mal
kleiner, mal größer und sie 

374
00:19:49,200 --> 00:19:52,400
haben da auf Ihrer Webseite eine
Abschätzung für Ihren eigenen 

375
00:19:52,400 --> 00:19:56,720
Service, wo Sie sagen, so ein PR
Review kostet dann irgendwie 

376
00:19:56,720 --> 00:20:01,440
zwischen 15 und $25 je nachdem 
wie komplex der PR ist. 

377
00:20:01,680 --> 00:20:05,280
Sie verwenden da natürlich auch 
ihre mächtigsten Modelle, also 

378
00:20:05,280 --> 00:20:08,080
wahrscheinlich eine Kombination 
aus dem Cloud Sonet und Cloud 

379
00:20:08,080 --> 00:20:11,680
Opus Modell, weil da natürlich 
auch die Erwartungshaltung, dass

380
00:20:11,680 --> 00:20:13,280
bei so einem Code Review 
wirklich. 

381
00:20:13,880 --> 00:20:18,000
Qualitativ hochwertiges Feedback
kommt sehr groß ist, aber es 

382
00:20:18,000 --> 00:20:21,600
bedeutet natürlich auch, dass 
wenn ich dort in einer so eine 

383
00:20:21,600 --> 00:20:26,800
Aufgabe irgendwie so vielleicht 
ein 2000000 Tokens verarbeite. 

384
00:20:27,360 --> 00:20:30,720
Dass das dann natürlich auch 
wichtig ist, sich vorab zu 

385
00:20:30,720 --> 00:20:32,240
überlegen, welches Modell nehme 
ich? 

386
00:20:32,240 --> 00:20:34,560
Du hast gerade gesagt, da gibt 
es unterschiedliche Preise, aber

387
00:20:34,560 --> 00:20:37,280
da kommen wir gleich noch mal 
mehr im Detail dazu, von daher 

388
00:20:37,600 --> 00:20:40,160
würde ich sagen, man kann das 
gar nicht so pauschal 

389
00:20:40,400 --> 00:20:44,000
beantworten, was kostet so eine 
Aufgabe, weil das immer zum 

390
00:20:44,000 --> 00:20:47,280
einen von der Komplexität der 
Aufgabe abhängt, das hängt davon

391
00:20:47,280 --> 00:20:49,200
ab. 
Welches Large Language Model 

392
00:20:49,200 --> 00:20:52,040
verwende ich? 
Wie habe ich mein Repository 

393
00:20:52,040 --> 00:20:54,880
konfiguriert und was für eine 
Art von Repository ist das 

394
00:20:54,880 --> 00:20:57,200
eigentlich? 
Wie groß ist dieses Repository 

395
00:20:57,360 --> 00:21:01,360
und wieviel Kontext muss ich da 
auch überhaupt so einen Coding 

396
00:21:01,360 --> 00:21:05,680
Agent überhaupt erst mal 
zusammensuchen um die relevanten

397
00:21:05,680 --> 00:21:08,760
Informationen für die Erledigung
der Aufgabe zu finden? 

398
00:21:08,760 --> 00:21:13,680
Das ist so ein bisschen so die 
Frage wie ja wieviel kostet dich

399
00:21:13,680 --> 00:21:17,120
denn Benzin im Monat und dann 
kannst du mich zurückfragen ja 

400
00:21:17,440 --> 00:21:19,440
von dem. 
Bis hängt davon ab irgendwie 

401
00:21:19,840 --> 00:21:22,480
wieviel ich gerade in dem Monat 
unterwegs bin, ob ich in Urlaub 

402
00:21:22,480 --> 00:21:25,120
gefahren bin, ob ich viel 
Autobahn Stadt gefahren bin oder

403
00:21:25,120 --> 00:21:27,680
es hängt davon ab was für eine 
Art von Auto du fährst. 

404
00:21:27,680 --> 00:21:30,480
Neues Auto und altes Auto. 
Vielleicht fährst du auch nur 

405
00:21:30,480 --> 00:21:33,120
Sportwagen und nur Autobahn und 
hast dementsprechend irgendwie 

406
00:21:33,120 --> 00:21:35,880
einen Durchschnittsverbrauch von
irgendwie 25 Liter auf 100 

407
00:21:35,880 --> 00:21:39,400
Kilometer. 
Es hängt davon ab, aber man muss

408
00:21:39,400 --> 00:21:42,160
sich halt Bewusstsein, wenn man 
sich wirklich die Preise der 

409
00:21:42,160 --> 00:21:46,560
Preislisten anschaut, dass dann 
solche agentischen Aufgaben halt

410
00:21:46,560 --> 00:21:49,840
nicht irgendwie nur so ein paar 
Cent kosten, sondern teilweise 

411
00:21:49,840 --> 00:21:50,480
Euros. 
Genau. 

412
00:21:50,520 --> 00:21:52,000
Würde ich auch sagen. 
Also wir haben jetzt irgendwie 

413
00:21:52,000 --> 00:21:54,400
eine App erstellt, relativ 
simpel, ein Frontend, ein 

414
00:21:54,400 --> 00:21:58,320
Backend, irgendwie eine 
singlepage application 2323, 

415
00:21:58,320 --> 00:22:00,600
Unterseiten, vielleicht noch 
irgendwie eine kleine Datenbank 

416
00:22:00,600 --> 00:22:02,680
dabei, dann wenn man sich das 
jetzt einfach so auf einer 

417
00:22:02,680 --> 00:22:04,680
grünen Wiese zusammen prompte, 
dann ist man wahrscheinlich 

418
00:22:04,680 --> 00:22:08,000
unter dem Euro irgendwie dabei. 
In dem Moment, wo ich brownfield

419
00:22:08,000 --> 00:22:11,560
Applikationen bearbeiten lasse 
und viel Kontext sich 

420
00:22:11,560 --> 00:22:13,680
reingezogen wird, bin die kratze
ich wahrscheinlich schon eher an

421
00:22:13,680 --> 00:22:16,080
so einer Euro für eine längere 
Agent Session, die jetzt sage 

422
00:22:16,080 --> 00:22:18,680
ich mal vielleicht mit der ich 
jetzt vielleicht 1015 Minuten 

423
00:22:18,680 --> 00:22:21,080
irgendwie unterwegs bin mit so 
ein bisschen hin und her würde 

424
00:22:21,080 --> 00:22:24,080
ich sagen, kratze ich schon 
ungefähr wieso daran und da kann

425
00:22:24,080 --> 00:22:26,960
man sich vorstellen wenn ich 20€
im Monat bezahle, dass die 

426
00:22:27,280 --> 00:22:29,280
Anzahl von diesen Sessions, die 
ich da mache, limitiert ist. 

427
00:22:31,120 --> 00:22:33,280
Gut, das heißt, wir haben jetzt 
gelernt, wir haben irgendwie 

428
00:22:33,280 --> 00:22:37,920
Input, Output, Tokens, die den 
Kontext entsprechend ausmachen, 

429
00:22:37,920 --> 00:22:42,000
und diese werden bepreist und 
ich muss daher drauf achten, 

430
00:22:42,000 --> 00:22:45,360
dass ich an allen. 
Bereichen Optimiere also nicht 

431
00:22:45,360 --> 00:22:47,440
nur den Output reduziere, 
sondern auch den Input 

432
00:22:47,440 --> 00:22:49,680
reduziere. 
Aber dafür gibt es natürlich 

433
00:22:49,680 --> 00:22:52,800
auch verschiedene Wege, um das 
zu machen, und da gehen wir 

434
00:22:52,800 --> 00:22:55,760
jetzt mal ein bisschen ins 
Detail rein, also wie sollte ich

435
00:22:55,760 --> 00:22:59,560
jetzt konkret vorgehen, um halt 
zu verhindern, dass mir die 

436
00:22:59,560 --> 00:23:02,320
Kosten aus dem Ruder laufen? 
Ja, war es nochmal 1. 

437
00:23:02,560 --> 00:23:05,240
Wie immer wenn ich irgendwas 
messen oder optimieren will, ist

438
00:23:05,240 --> 00:23:07,200
überhaupt erstmal den Verbrauch 
sichtbar zu machen. 

439
00:23:07,200 --> 00:23:09,360
Also bevor man was optimieren 
kann muss man was messen. 

440
00:23:09,880 --> 00:23:11,760
Und was ich jetzt als Developer 
tun kann, ist erst mal gucken, 

441
00:23:11,760 --> 00:23:15,120
okay, was ist denn überhaupt 
mein Tokenverbrauch pro Session,

442
00:23:15,120 --> 00:23:17,320
weil ich muss gestehen, da hatte
ich am Anfang auch überhaupt 

443
00:23:17,320 --> 00:23:20,920
keinen Überblick drüber und 
spätestens das erste Mal, wenn 

444
00:23:20,920 --> 00:23:23,040
man in so ein Limit reinläuft, 
dann fragt man sich eigentlich, 

445
00:23:23,040 --> 00:23:25,520
ist das jetzt diese Limits 
eigentlich viel oder oder wenig,

446
00:23:26,320 --> 00:23:28,160
wie du gerade schon gesagt hast.
Davon muss man natürlich 

447
00:23:28,160 --> 00:23:31,040
eigentlich Input und Output 
Tokens getrennt betrachten, weil

448
00:23:31,040 --> 00:23:34,040
Input Tokens sind, die wo ich 
heute sage, da können wir 

449
00:23:34,040 --> 00:23:35,760
wahrscheinlich am meisten dran 
feilen. 

450
00:23:36,200 --> 00:23:38,880
Indem wir eben optimieren, was 
da reingeht. 

451
00:23:39,040 --> 00:23:42,320
Auf der anderen Seite sind Auto 
Tokens aber das teuerste, das 

452
00:23:42,320 --> 00:23:44,320
heißt, wir müssen eigentlich 
erst mal rausfinden, ja, wie 

453
00:23:44,320 --> 00:23:45,920
viele Tokens verbrauchen wir 
denn eigentlich in so einer 

454
00:23:45,920 --> 00:23:48,720
normalen Session, und da kann 
man sich in den Tools, die man 

455
00:23:48,720 --> 00:23:52,880
verwendet, so die die Token 
Usage oder die die Länge des 

456
00:23:52,880 --> 00:23:57,400
aktuell gefüllten Kontextes 
anzeigen lassen, und das geht 

457
00:23:57,400 --> 00:24:01,120
meistens mit Slash Usage oder 
Slash Session, je nachdem was 

458
00:24:01,120 --> 00:24:05,040
ich da verwende. 
Kann ich zum Beispiel in Cloud 

459
00:24:05,040 --> 00:24:09,640
Code und in Guitar, Copilot und 
Guitar Copilot CLI mir zumindest

460
00:24:09,640 --> 00:24:11,680
erstmal anzeigen lassen, wo 
stehe ich denn gerade am Anfang 

461
00:24:11,680 --> 00:24:14,080
meiner Session, weil auch da 
wird der Context schon, also 

462
00:24:14,080 --> 00:24:16,000
auch wenn ich eine leere Session
habe, ist der Context schon 

463
00:24:16,000 --> 00:24:19,600
befüllt mit dem System Prom mit 
vielleicht einer Agents MD mit 

464
00:24:19,600 --> 00:24:22,400
vielleicht irgendwelchen Tools 
die ich schon reingeladen habe 

465
00:24:22,400 --> 00:24:25,240
in den Agenten und aber viel 
spannender ist natürlich 

466
00:24:25,240 --> 00:24:27,800
eigentlich während der Session 
zu gucken okay ich bin jetzt 

467
00:24:27,800 --> 00:24:30,000
irgendwie auf dem halben Weg, 
wieviel habe ich denn verbraucht

468
00:24:30,160 --> 00:24:31,360
und? 
Aber das lohnt sich, dass man so

469
00:24:31,360 --> 00:24:33,640
ein bisschen einfach mal nicht 
über Nacht, aber über Zeit ein 

470
00:24:33,640 --> 00:24:35,680
Gefühl dafür bekommt. 
Was verbrauche ich denn 

471
00:24:35,680 --> 00:24:38,880
eigentlich an Tokens? 
Ja, ich hatte ja auch gerade 

472
00:24:38,880 --> 00:24:40,960
schon gesagt, das ist auch sehr 
individuell. 

473
00:24:40,960 --> 00:24:43,920
Also ich habe teilweise Aufgaben
gehabt, wo die. 

474
00:24:44,400 --> 00:24:48,080
Output Token nur irgendwie ein 
Zehntel von den Input Tokens am 

475
00:24:48,080 --> 00:24:50,920
Ende der Sessions waren. 
Ich hatte teilweise Faktor 

476
00:24:50,920 --> 00:24:55,920
irgendwie 12, also extrem breit 
gestreut und dementsprechend 

477
00:24:55,920 --> 00:24:59,840
hängt das von euren Aufgaben ab 
und auch wie ihr euer Repository

478
00:24:59,840 --> 00:25:04,880
vorbereitet habt. 
Und man hat irgendwie irgendwann

479
00:25:04,880 --> 00:25:07,600
mal gelernt, so context is King,
ich glaub wir hatten auch mal ne

480
00:25:07,600 --> 00:25:10,800
Folge zu context Engineering und
da hat man irgendwie den 

481
00:25:10,800 --> 00:25:14,160
Eindruck gewonnen, ich muss so 
viel in den Kontext reinwerfen 

482
00:25:14,480 --> 00:25:17,520
wie es geht, solange es nur 
irgendwie relevant sein kann. 

483
00:25:17,880 --> 00:25:21,880
Aber das führt am Ende natürlich
dazu, dass gerade meine Input 

484
00:25:21,880 --> 00:25:26,560
Tokens extrem stark nach oben 
gehen und das muss ich mir 

485
00:25:26,560 --> 00:25:29,200
visualisieren. 
Das kann ich in den üblichen 

486
00:25:29,200 --> 00:25:31,640
Coding Tools machen. 
Also ich habe irgendwie so einen

487
00:25:32,000 --> 00:25:36,160
Usage Command oder Session 
Command wo ich sehen kann, wie 

488
00:25:36,160 --> 00:25:38,880
sieht das denn für die aktuelle 
Session aus, aber auch über 

489
00:25:39,040 --> 00:25:42,040
Sessions hinweg kann ich das in 
der Regel bei meinem Tool 

490
00:25:42,040 --> 00:25:45,360
Anbieter, wenn er den Token 
basiert abrechnet sehen. 

491
00:25:45,920 --> 00:25:48,800
Gerade wenn ich mich direkt an 
die API ranhänge, kann ich das 

492
00:25:48,800 --> 00:25:51,000
natürlich auf der API Ebene 
sehen. 

493
00:25:51,000 --> 00:25:54,080
Also ich kann dann in mein Cloud
Portal reingehen und sehe dann 

494
00:25:54,320 --> 00:25:57,360
wie viele Input Output Tokens 
über die verschiedenen Model 

495
00:25:57,360 --> 00:26:00,120
dort abgerechnet wurden. 
Also es hängt so ein bisschen 

496
00:26:00,120 --> 00:26:03,040
von dem Tool ab was ihr benutzt,
aber immer wenn ihr ein Tool 

497
00:26:03,040 --> 00:26:06,400
habt was wirklich Token basiert 
abgerechnet wird, dann gibt es 

498
00:26:06,400 --> 00:26:09,240
da eine Möglichkeit sich die 
Informationen einmal für die 

499
00:26:09,240 --> 00:26:12,640
aktuelle Session aber auch 
übergreifend anzusehen. 

500
00:26:13,520 --> 00:26:15,200
Ja, da habe ich auch gelernt, 
irgendwie so ein bisschen an 

501
00:26:15,200 --> 00:26:17,040
eigener Erfahrung, was, was viel
verbraucht. 

502
00:26:17,040 --> 00:26:18,800
Ich habe ja schon mal erzählt, 
dass ich mit meinem Open Claw 

503
00:26:18,800 --> 00:26:20,640
immer wieder dran bin, dass das 
Ding irgendwann mal meine 

504
00:26:20,640 --> 00:26:24,160
Reisekostenabrechnung machen 
kann und was vor allem richtig 

505
00:26:24,160 --> 00:26:27,520
Tokens frisst, sind so 
wiederholte Agent Loops. 

506
00:26:27,760 --> 00:26:30,000
Also wenn ich also ich würde 
heute sagen, alles was ich schon

507
00:26:30,000 --> 00:26:33,040
vorher weiß, was dazu führen 
kann, dass mein Agent durch eine

508
00:26:33,040 --> 00:26:36,640
Schleife weniger geht, das spart
mir schon richtig kosten ein 

509
00:26:36,640 --> 00:26:37,920
und. 
Und ich habe vor allem dann 

510
00:26:37,920 --> 00:26:40,120
irgendwie gemerkt, dass wenn der
sich wirklich durch eine 

511
00:26:40,120 --> 00:26:42,680
Webseite, in meinem Fall jetzt 
navigiert, die er nicht kennt, 

512
00:26:42,680 --> 00:26:45,600
da Screenshots macht. 
Also Bilder sind generell sehr, 

513
00:26:45,600 --> 00:26:49,080
sehr, sehr tot und hungrig, wenn
ich die mit Reinschmeiße, auch 

514
00:26:49,080 --> 00:26:51,520
wenn ich den Browser 
automatisiere werden Screenshots

515
00:26:51,520 --> 00:26:53,720
gemacht. 
Wenn er dann auf Dinge klickt, 

516
00:26:53,720 --> 00:26:57,760
hinter denen nichts ist oder ur 
LS rät die nicht existieren und 

517
00:26:57,760 --> 00:26:59,840
dann immer wieder in diese 
Schleifen geht, da habe ich 

518
00:26:59,840 --> 00:27:02,080
schon richtig Geld verbrannt. 
Ich habe es ja glaube ich in 

519
00:27:02,080 --> 00:27:04,800
irgendeiner Folge mal erzählt, 
dass ich da mehrere 100€ an 

520
00:27:04,800 --> 00:27:08,080
Taugens verbrannt habe, alleine 
den Versuch meine 

521
00:27:08,080 --> 00:27:10,160
Reisekostenabrechnung zu 
automatisieren, ich bin immer 

522
00:27:10,160 --> 00:27:14,080
noch nicht 100% da also und weil
er sich einfach versucht hat 

523
00:27:14,080 --> 00:27:16,360
selber irgendwie beizubringen 
und da hätte ich sehr viel 

524
00:27:16,360 --> 00:27:18,840
Kosten sparen können, indem ich 
ihm zum Beispiel den ganz klaren

525
00:27:18,840 --> 00:27:21,120
Klickpfad direkt mitgegeben 
hätte. 

526
00:27:21,760 --> 00:27:25,360
So alles, was ich von vornherein
weiß und der Agent das nicht 

527
00:27:25,360 --> 00:27:28,160
selber herausfinden muss, das 
hält mich davon ab, dass der in 

528
00:27:28,160 --> 00:27:31,120
eine weitere Explorative Loop 
reingehen muss. 

529
00:27:31,120 --> 00:27:32,960
Das kann ich nicht immer 
vermeiden, gerade wenn ich ein 

530
00:27:32,960 --> 00:27:36,480
komplexes Problem habe, aber 
alles was ich weiß, wird in so 

531
00:27:36,480 --> 00:27:38,400
eine ebnis MB Datei 
reingeschrieben. 

532
00:27:39,080 --> 00:27:41,200
Um eben eine weitere Agent Loop 
zu vermeiden. 

533
00:27:41,440 --> 00:27:44,960
Das heißt, wenn du die Aufgaben 
eigentlich schon selber ganz gut

534
00:27:44,960 --> 00:27:48,240
überblicken kannst, dann ist es 
sinnvoll, diese genau zu 

535
00:27:48,240 --> 00:27:51,200
beschreiben und auch zu 
begrenzen und nicht sehr so 

536
00:27:51,200 --> 00:27:54,480
vagen Input zu geben. 
Wir kennen das ja irgendwie auch

537
00:27:54,720 --> 00:27:58,080
so aus diesem Specdriven 
Development Ansatz, wo man dann 

538
00:27:58,160 --> 00:28:02,080
genau spezifiziert, welches 
Ergebnis man haben will, damit 

539
00:28:02,080 --> 00:28:04,880
der Agent halt genau weiß was. 
Was muss ich tun? 

540
00:28:04,880 --> 00:28:08,200
Wo muss ich die Informationen 
einsammeln, um diese Aufgabe zu 

541
00:28:08,200 --> 00:28:10,320
erledigen? 
Weil immer, wenn es irgendwie 

542
00:28:10,400 --> 00:28:13,840
sehr vage und breit ist, dann 
muss natürlich mein Agent immer 

543
00:28:13,920 --> 00:28:18,000
das komplette Repository scannen
und scannen, heißt in dem Fall 

544
00:28:18,320 --> 00:28:22,640
alle Dateien lesen und die in 
den Kontext laden und diesen 

545
00:28:22,640 --> 00:28:27,120
Kontext an das Llm schicken, 
damit dieses Llm diesen Kontext.

546
00:28:27,360 --> 00:28:29,640
Versteht. 
Und wenn man sich vorstellt. 

547
00:28:29,640 --> 00:28:33,560
Ich habe so ein mittelgroßes 
Repository und mein Agent muss 

548
00:28:33,560 --> 00:28:37,480
erst mal irgendwie alle Dateien 
einlesen und vom Llm verarbeiten

549
00:28:37,480 --> 00:28:41,200
lassen, dann habe ich quasi 
schon in dieser ersten Iteration

550
00:28:41,280 --> 00:28:47,680
schon eigentlich irgendwie 100 
Tausende an Tokens verbrannt und

551
00:28:47,840 --> 00:28:50,160
das kann ich natürlich 
vermeiden, wenn ich schon vorher

552
00:28:50,160 --> 00:28:52,800
weiß wie. 
Das sind die relevanten Bereiche

553
00:28:52,800 --> 00:28:55,920
und das ist genau die Aufgabe. 
Das kann ich auch vermeiden, 

554
00:28:55,960 --> 00:28:59,080
indem ich quasi ja Aufgaben, wie
du es gerade beschrieben hast, 

555
00:28:59,080 --> 00:29:00,880
direkt schon auch ein bisschen 
kleiner Schneide. 

556
00:29:00,880 --> 00:29:03,040
Also dass ich vielleicht, ich 
kann ja auch, ich kann ja auch 

557
00:29:03,040 --> 00:29:06,720
mehrere Agenten Sessions 
parallel auch fahren lassen. 

558
00:29:07,160 --> 00:29:09,120
Aber ein schlechter. 
Prompt ist zum Beispiel baue mir

559
00:29:09,120 --> 00:29:12,080
dieses Feature ein und passe 
alle Tests an und refactor 

560
00:29:12,080 --> 00:29:14,800
nebenbei dann auch noch mal hier
irgendwie meine Architektur, das

561
00:29:14,800 --> 00:29:17,600
wird wahrscheinlich dazu führen,
dass ich sehr, sehr viel auch 

562
00:29:17,600 --> 00:29:20,320
aus verschiedenen Bereichen in 
meinen Kontext laden muss, das 

563
00:29:20,320 --> 00:29:22,160
macht es mir nachher schwerer, 
den Kontext noch mal zu 

564
00:29:22,160 --> 00:29:23,920
komprimieren, sprechen wir auch 
noch mal drüber. 

565
00:29:24,640 --> 00:29:26,960
Also der zweite Tipp wäre auf 
jeden Fall eine Aufgabe, wenn es

566
00:29:26,960 --> 00:29:30,800
eben geht, etwas atomarer zu 
betrachten, zu begrenzen und 

567
00:29:30,960 --> 00:29:34,400
idealerweise auch erst 
analysieren zu lassen und dann 

568
00:29:34,640 --> 00:29:36,480
den. 
Den Plan zu Reviewen und dann 

569
00:29:36,480 --> 00:29:39,000
erst Schritt für Schritt 
umzusetzen, das hilft mir 

570
00:29:39,000 --> 00:29:41,360
nämlich, insbesondere weil ich 
da a verschiedene Modelle für 

571
00:29:41,360 --> 00:29:43,200
verwenden kann, sprechen wir 
auch gleich noch mal drüber, 

572
00:29:43,200 --> 00:29:45,800
welches Modell ich eigentlich 
für was nehme, das hilft mir 

573
00:29:45,800 --> 00:29:48,160
aber auch, dass wenn ich zum 
Beispiel einen Plan mache, wie 

574
00:29:48,160 --> 00:29:50,720
eine bestimmte Aufgabe zu lösen 
ist, dann kann ich aus dem 

575
00:29:50,720 --> 00:29:53,000
Kontext danach alles andere 
wieder wegschmeißen, was nicht 

576
00:29:53,000 --> 00:29:56,640
Teil dieses Plans war. 
Und dann, wenn ich in die zweite

577
00:29:56,640 --> 00:29:58,480
Phase, vielleicht auch mit einem
neuen Agenten, nämlich in die 

578
00:29:58,480 --> 00:30:02,240
Implementierung und erstmal das 
Reviewen des Plans gehe, dann 

579
00:30:02,240 --> 00:30:04,160
brauche ich diese ganze 
Vorgeschichte, diese ganze Chat 

580
00:30:04,160 --> 00:30:05,640
Historie nicht mehr. 
Ich muss es nicht verstehen, 

581
00:30:05,640 --> 00:30:09,200
weil ich viel strukturierter an 
eine Aufgabe rangehe a weil die 

582
00:30:09,200 --> 00:30:11,640
Aufgabe ohnehin schon in einen 
kleinen Block eingeteilt ist und

583
00:30:11,640 --> 00:30:14,400
b weil ich erstmal eine Analyse 
mache, wie ich diese Aufgabe 

584
00:30:14,400 --> 00:30:17,720
angehe, danach kann ich alles, 
was bis zum bis zur finalen 

585
00:30:17,720 --> 00:30:20,200
Analyse gebraucht wurde, 
wegschmeißen, lasse dann 

586
00:30:20,200 --> 00:30:22,680
vielleicht sogar ein mächtigeres
Modell den Plan nochmal Review 

587
00:30:22,680 --> 00:30:24,760
und gucken ob alles stimmt. 
Kann dann wieder alles 

588
00:30:24,760 --> 00:30:28,160
wegschmeißen außer den finalen 
Planen und dann in die Umsetzung

589
00:30:28,160 --> 00:30:31,000
gehen und da kann ich irgendwie 
nach jedem Schritt quasi auch 

590
00:30:31,000 --> 00:30:34,200
wieder meinen Kontext lehren. 
Verbrauche bei den folgenden 

591
00:30:34,200 --> 00:30:37,520
Schritten deutlich weniger 
Tokens und habe a auch wenn ich 

592
00:30:37,520 --> 00:30:39,600
kleinere Aufgaben schneide, 
stand heute immer noch deutlich 

593
00:30:39,600 --> 00:30:41,680
bessere Ergebnisse mit den 
Modellen, weil die sind schon 

594
00:30:41,680 --> 00:30:45,520
sehr sehr sehr sehr gut, aber 
eben noch nicht so allmächtig, 

595
00:30:45,520 --> 00:30:48,080
dass ich ihnen wirklich mehrere 
Aufgaben auf einmal geben kann, 

596
00:30:48,240 --> 00:30:51,160
bei manchen geht das, die finden
ihren Weg, aber verbrauchen 

597
00:30:51,160 --> 00:30:53,200
dabei immer noch in der Regel 
deutlich mehr Tokens. 

598
00:30:54,320 --> 00:30:57,360
Und was man an dieser Stelle 
auch häufiger mal hört, ist, 

599
00:30:57,360 --> 00:31:01,040
dass man solche Agenten auch 
nicht völlig unbeaufsichtigt 

600
00:31:01,040 --> 00:31:04,080
laufen lassen sollte, 
insbesondere bei lang laufenden 

601
00:31:04,080 --> 00:31:07,400
Aufgaben, weil diese häufig ja 
auch mal irgendwie einen 

602
00:31:07,400 --> 00:31:10,880
falschen wegnehmen und dann halt
unnötige Schleifen nehmen, wo 

603
00:31:10,880 --> 00:31:14,320
ich tatsächlich als Mensch dann 
auch mal nachjustieren könnte. 

604
00:31:14,640 --> 00:31:16,680
Ja, das finde ich spannend, weil
ich würde eigentlich sagen okay,

605
00:31:16,680 --> 00:31:18,440
warum sollte ich die nicht in 
der langen Schleife laufen 

606
00:31:18,440 --> 00:31:20,160
lassen, das ist ja genau 
eigentlich die Idee, dass ich 

607
00:31:20,160 --> 00:31:22,560
dann. 
Über Nacht so einen Agenten 

608
00:31:22,800 --> 00:31:25,680
laufen lasse. 
Klar, wenn er in die falsche 

609
00:31:25,680 --> 00:31:27,760
Richtung rennt, während ich 
schlafe, dann wird der 

610
00:31:27,760 --> 00:31:30,160
wahrscheinlich auch während ich 
schlafe sehr viele Tokens 

611
00:31:30,160 --> 00:31:33,400
verbrennen, da muss man dann 
glaube ich überlegen, so was ist

612
00:31:33,400 --> 00:31:37,200
es mir wert, habe ich einen 
größeren Benefit da dadurch dass

613
00:31:37,440 --> 00:31:40,280
Arbeit erledigt wird, während 
ich gerade selber nicht vorm 

614
00:31:40,280 --> 00:31:42,320
Rechner sitze, also potenziere 
ich hier eigentlich nicht mein 

615
00:31:42,320 --> 00:31:45,560
eigenes Humankapital, meine 
eigene Arbeitszeit und. 

616
00:31:46,000 --> 00:31:47,880
Und das muss mir dann aber auch 
wert sein, dass der Agent 

617
00:31:47,880 --> 00:31:51,600
vielleicht dann über Nacht ein 
paar 100€ an Tokens verbrennt, 

618
00:31:52,000 --> 00:31:54,320
weil er, weil ich eben nicht 
davor saß und ihn wieder 

619
00:31:54,320 --> 00:31:56,960
einfangen konnte, weil ich ihn 
vielleicht auch im Yolo Mode 

620
00:31:56,960 --> 00:31:59,600
habe laufen lassen, weil ich 
konnte ja gar nicht ins Stearing

621
00:31:59,600 --> 00:32:01,320
gehen. 
Stearing ist, wenn man so quasi,

622
00:32:01,320 --> 00:32:03,760
wenn man schon merkt, der Agent 
geht in so eine falsche 

623
00:32:03,760 --> 00:32:06,160
Richtung, da kann ich immer so 
einen prompt noch so dazwischen 

624
00:32:06,160 --> 00:32:08,400
schieben, dann wird er beim 
nächsten Mal, wo der Agent 

625
00:32:08,400 --> 00:32:10,280
vielleicht irgendwie ein Tool 
Call ausgeführt hat, wird dieser

626
00:32:10,280 --> 00:32:13,840
prompt da so reingeschummelt und
ich kann ihn ja so in die 

627
00:32:13,840 --> 00:32:17,440
richtige Richtung schubsen und. 
Und dafür muss ich natürlich vom

628
00:32:17,440 --> 00:32:19,120
Rechner sein. 
Also ich glaube, da muss ich 

629
00:32:19,120 --> 00:32:21,680
dann so ein bisschen 
entscheiden, ist es mir das 

630
00:32:21,680 --> 00:32:23,920
wert, dass ich den Agenten 
Autonomen vielleicht über 

631
00:32:23,920 --> 00:32:26,080
Stunden hinweg laufen lasse, 
dann muss ich aber davon auch 

632
00:32:26,080 --> 00:32:28,400
davon ausgehen, dass er 
vielleicht deutlich unnötiger 

633
00:32:28,400 --> 00:32:30,480
Tokens verbrannt hat, das ist, 
glaube ich, ein Trade, auf dem 

634
00:32:30,480 --> 00:32:33,080
man den jeder dann für sich 
selber machen muss, aber 

635
00:32:33,080 --> 00:32:36,800
generell kann man sagen, 
unnötige Schleifen sorgen für 

636
00:32:36,800 --> 00:32:40,480
weniger oder dafür dafür sorgen,
dass ich weniger Kontextwachstum

637
00:32:40,480 --> 00:32:42,800
habe, was auch? 
Oder Maßnahmen, die dazu führen,

638
00:32:42,800 --> 00:32:46,240
dass ich weniger Fehlversuche 
habe oder wie du sagst, 

639
00:32:46,560 --> 00:32:48,920
vielleicht auch bessere, 
kontrollierbare Ergebnisse dann 

640
00:32:48,920 --> 00:32:51,840
bringe. 
Das bringt mich eigentlich dazu,

641
00:32:52,280 --> 00:32:55,760
erstmal überhaupt am Anfang zu 
sparen und je unklarer die 

642
00:32:55,760 --> 00:33:00,000
Aufgabe wird oder desto freier 
ich den Agenten drehen lasse, 

643
00:33:00,240 --> 00:33:02,840
desto teurer wird ja auch am 
Ende und da muss ich mir 

644
00:33:02,840 --> 00:33:05,120
überlegen, ob das ein Benefit 
ist, weil der vielleicht 

645
00:33:05,120 --> 00:33:07,680
unbeaufsichtigt arbeitet oder ob
es. 

646
00:33:08,040 --> 00:33:11,120
Was Negatives ist, weil er 
unnötig viel Tokens verbrennt. 

647
00:33:11,200 --> 00:33:14,320
Und damit gehen wir mal in den 
zweiten Bereich rein. 

648
00:33:14,320 --> 00:33:16,280
Wir hatten es ja gerade schon 
angeschnitten. 

649
00:33:16,280 --> 00:33:19,160
Es gibt bestimmte Dinge, die 
können wir direkt beeinflussen 

650
00:33:19,160 --> 00:33:23,280
und das ist vor allen Dingen im 
Bereich der Input Tokens und was

651
00:33:23,280 --> 00:33:27,760
wir da stark steuern können, ist
der sogenannte Kontext, und 

652
00:33:27,760 --> 00:33:30,640
diesen Kontext kann ich 
natürlich beeinflussen und am 

653
00:33:30,640 --> 00:33:33,600
Anfang. 
Dieser AI Tool Nutzung wo wir 

654
00:33:33,600 --> 00:33:36,400
nun einen einfachen Chat hatten 
war das so ein bisschen dieses 

655
00:33:36,400 --> 00:33:39,600
prompt Engineering was wir 
gemacht haben, aber mittlerweile

656
00:33:39,600 --> 00:33:42,400
ist da natürlich viel mehr 
daraus geworden. 

657
00:33:42,400 --> 00:33:45,520
Das heißt wir haben diese 
Agenten die selbstständig sich 

658
00:33:45,520 --> 00:33:48,160
Dateien suchen. 
Ich kann auch manuell noch auf 

659
00:33:48,160 --> 00:33:52,640
Dateien verweisen, wir haben auf
der anderen Seite solche Agents 

660
00:33:52,640 --> 00:33:57,280
MD oder Cloud MD Dateien die dem
Agenten Informationen geben. 

661
00:33:57,760 --> 00:34:01,760
Und dann haben wir noch diverse 
Tools, die auch natürlich 

662
00:34:01,760 --> 00:34:05,520
beschrieben werden und alle 
diese Dinge kann ich als 

663
00:34:05,520 --> 00:34:09,280
Developer direkt beeinflussen 
und kann damit einen extrem 

664
00:34:09,280 --> 00:34:14,560
großen Einfluss auf die ganze 
input Token Seite nehmen. 

665
00:34:14,719 --> 00:34:19,120
Und da muss ich mir natürlich. 
Zum einen mal Gedanken drüber 

666
00:34:19,120 --> 00:34:22,880
machen, wie möchte ich das ganze
strukturieren und kann damit 

667
00:34:22,880 --> 00:34:26,800
dann am Ende auch extrem viel 
Kosten reduzieren, insbesondere 

668
00:34:26,800 --> 00:34:30,400
wenn ich das Ganze so baue, dass
ich vielleicht auch von solchen 

669
00:34:30,560 --> 00:34:34,159
pokencashing Mechanismen auf 
Seiten der Anbieter profitieren 

670
00:34:34,159 --> 00:34:36,239
kann. 
Konkret kann das heißen, dass 

671
00:34:36,239 --> 00:34:39,880
wenn ich weiß in welchen Dateien
oder Ordnern die Änderung ist, 

672
00:34:39,880 --> 00:34:43,120
dass ich dem Agenten sagen kann,
Hey, konzentriere dich auf den 

673
00:34:43,120 --> 00:34:45,880
Bereich meines Projektes, 
ansonsten würde der Agent erst 

674
00:34:45,880 --> 00:34:47,239
mal irgendwie durch das 
komplette Projekt. 

675
00:34:47,320 --> 00:34:50,400
Projekt durchgehen und 
versuchen, die Dateien zu finden

676
00:34:50,400 --> 00:34:53,520
und würde dann vielleicht auch 
Fehlversuche machen und 

677
00:34:53,520 --> 00:34:57,280
gleichzeitig kann ich damit die 
Schleifen reduzieren und in 

678
00:34:57,280 --> 00:35:00,480
jeder dieser Schleifen wird 
natürlich wieder dieser gesamte 

679
00:35:00,480 --> 00:35:04,080
Kontext, den ich steuern kann, 
angehängt. 

680
00:35:04,240 --> 00:35:06,400
Das heißt, das Ganze 
multipliziert sich natürlich 

681
00:35:06,400 --> 00:35:07,640
hoch. 
Du hast gerade darüber 

682
00:35:07,640 --> 00:35:10,880
gesprochen, wie kann ich die 
Anzahl der Iterationen 

683
00:35:10,880 --> 00:35:13,600
reduzieren und jetzt das 
kombiniert mit. 

684
00:35:13,960 --> 00:35:18,320
Dem Fakt, dass ich steuern kann,
wieviel in dem Kontext ist, kann

685
00:35:18,320 --> 00:35:21,440
ich natürlich schon quasi so 
einen Multiplayer daraus 

686
00:35:21,440 --> 00:35:24,480
arbeiten und sagen okay wenn ich
den Kontext klein mache und die 

687
00:35:24,480 --> 00:35:28,720
Schleifen reduziere, dann habe 
ich am Ende heraus extrem viele 

688
00:35:28,960 --> 00:35:32,240
Tokens auch gespart und 
dementsprechend ich hänge jetzt 

689
00:35:32,240 --> 00:35:35,680
nicht immer quasi die gesamte 
Codebase an und sage immer Get 

690
00:35:35,680 --> 00:35:40,040
Up Codepided gab es mal dieses 
Pound sign codebase wo dann 

691
00:35:40,040 --> 00:35:42,960
irgendwie das. 
Die Idee versucht hat, irgendwie

692
00:35:42,960 --> 00:35:45,840
die relevanten Dateien zu 
finden, über die Suche, aber 

693
00:35:45,840 --> 00:35:47,880
dann natürlich auch wieder ganz 
viele Dateien gefunden hat, die 

694
00:35:47,880 --> 00:35:51,040
gar nicht relevant waren und ich
kann das natürlich, wenn ich es 

695
00:35:51,040 --> 00:35:54,120
als Developer schon weiß, genau 
steuern, das ist jetzt nicht 

696
00:35:54,120 --> 00:35:57,520
diese vipe Coding Welt, wo ich 
einfach nur irgendwie prompte 

697
00:35:57,520 --> 00:35:59,600
und eigentlich gar nicht mehr 
weiß, was in meinem Projekt 

698
00:35:59,600 --> 00:36:03,440
passiert, sondern es ist mehr so
die Welt, wo ich als Developer 

699
00:36:03,440 --> 00:36:07,920
auch so ein architekturelles 
Verständnis meines Projektes 

700
00:36:07,920 --> 00:36:10,640
weiterhin habe und dann 
vielleicht auch mehr. 

701
00:36:11,200 --> 00:36:13,800
Mich hier dementsprechend in 
dieser professionellen 

702
00:36:13,800 --> 00:36:15,480
Softwareentwicklung befinde, ja.
Das. 

703
00:36:15,680 --> 00:36:18,400
Ist dann vor allem relevant, 
wenn ich wie gesagt auch wieder 

704
00:36:18,400 --> 00:36:20,080
hier helfen kann. 
Dinge, die ich schon weiß, die 

705
00:36:20,080 --> 00:36:22,640
diese Loop vermeiden, ist 
natürlich auch so, dass diese 

706
00:36:22,640 --> 00:36:24,880
Code Agenten durchaus auch sehr 
gut in der Lage sind, sich 

707
00:36:24,880 --> 00:36:28,760
relevante Codestellen selber 
rauszusuchen, aber ich muss eben

708
00:36:28,760 --> 00:36:30,920
Bewusstsein, dass das Tokens 
kostet und dass das nicht nur 

709
00:36:30,920 --> 00:36:34,520
Geld kostet, sondern auch mein 
Kontext window füllt und man 

710
00:36:34,520 --> 00:36:37,360
kann sich das so vorstellen. 
Man ich habe einen whatsapp 

711
00:36:37,440 --> 00:36:40,760
Chatverlauf und jede neue. 
Jeder neue Iteration der neue 

712
00:36:40,760 --> 00:36:44,360
Agent Loop da kommt in komplett 
frischer Agentin, liest sich 

713
00:36:44,360 --> 00:36:46,360
einmal den kompletten 
Chatverlauf von der ersten 

714
00:36:46,360 --> 00:36:50,240
Nachricht hinweg durch und guckt
dann, ob er irgendwas hinzufügen

715
00:36:50,240 --> 00:36:53,360
kann und mit jeder Nachricht 
wird sich wieder alles von vorne

716
00:36:53,360 --> 00:36:56,200
durchgelesen und wenn ich halt 
irgendwie schon weiß, ey, das 

717
00:36:56,200 --> 00:36:58,800
wird sich in diesen 34 Dateien, 
dann kann ich es abspielen, dann

718
00:36:58,800 --> 00:37:00,360
kann ich es relativ cool, auch 
wenn ich irgendwie eine 

719
00:37:00,360 --> 00:37:02,960
Nachricht an Agenten tippe, zum 
Beispiel mit der at Taste direkt

720
00:37:02,960 --> 00:37:05,520
sagen die Datei, die Datei, die 
Datei und dann kann ich 

721
00:37:05,520 --> 00:37:06,600
ranhängen. 
Ich kann auch wenn ich es 

722
00:37:06,600 --> 00:37:09,280
irgendwie eine ide verwende. 
In Visual Studio Code kann ich 

723
00:37:09,280 --> 00:37:11,120
solche Pat Drag and Drop den 
ganzen Ordner irgendwie da 

724
00:37:11,120 --> 00:37:13,280
reinziehen. 
Das heißt oft nicht, dass er 

725
00:37:13,280 --> 00:37:15,720
sich nur in diesem Ordner 
umschaut, wird sich aber zuerst 

726
00:37:15,720 --> 00:37:17,760
in diesem Ordner umschauen oder 
zuerst in diesen Dateien und 

727
00:37:17,760 --> 00:37:20,000
vielleicht findet er da schon 
alles was er braucht und muss 

728
00:37:20,000 --> 00:37:22,480
dann keine weiteren Iterationen 
mehr angehen. 

729
00:37:22,920 --> 00:37:24,960
Man kann auch Dinge aus der 
History raus löschen zum 

730
00:37:24,960 --> 00:37:27,760
Beispiel, ich kann es mir sagen,
diese 3 Sachen finde ich jetzt 

731
00:37:27,760 --> 00:37:31,160
nicht mehr relevant, das ist 
natürlich dann auch wieder ein 

732
00:37:31,160 --> 00:37:33,080
bisschen manuelle Arbeit, da 
muss man hier auch wieder 

733
00:37:33,080 --> 00:37:36,640
abwägen, wie sehr möchte ich 
dieses Spiel optimieren. 

734
00:37:37,240 --> 00:37:39,440
Weil ich dann auch eben so ein 
bisschen von der Autonomität 

735
00:37:39,440 --> 00:37:42,800
natürlich verliere oder weil ich
dafür sehr viel Zeit am Anfang 

736
00:37:42,800 --> 00:37:44,960
rein investieren muss, um eine 
gute Beschreibung von dem 

737
00:37:44,960 --> 00:37:47,680
vorliegenden Task zu machen. 
Aber da kann ich auf jeden Fall 

738
00:37:48,400 --> 00:37:52,240
ganz gut optimieren, was ich da 
eigentlich reingebe Arbeits den 

739
00:37:52,240 --> 00:37:54,400
Kontext kleiner macht und wie, 
weil ich diese Iteration, diese 

740
00:37:54,400 --> 00:37:57,000
schleifen vermeide. 
Ja, ich glaube, zusammenfassend 

741
00:37:57,000 --> 00:38:00,720
kann man sagen, dass wir nicht 
möglichst viel Kontext brauchen,

742
00:38:00,720 --> 00:38:04,000
auch wenn wir jetzt mittlerweile
ganz große Kontextfenster haben,

743
00:38:04,160 --> 00:38:06,800
sondern wir brauchen den 
relevanten Kontext und alles, 

744
00:38:06,800 --> 00:38:10,880
was wir einmalig vorbereiten 
können und dann quasi per 

745
00:38:10,880 --> 00:38:14,040
Konfiguration in unserem Repo 
hinterlegen können, ist sofort 

746
00:38:14,040 --> 00:38:16,800
für alle Leute, die auf dem Repo
arbeiten, nutzbar. 

747
00:38:16,800 --> 00:38:18,480
Das heißt, es ist ein 
Investment, was sich dann am 

748
00:38:18,480 --> 00:38:23,280
Ende auch vielfach auszahlt und 
dann auch keine negativen 

749
00:38:23,280 --> 00:38:25,960
Auswirkungen auf die Autonomie 
nachher hat und ich? 

750
00:38:26,040 --> 00:38:28,720
Ich habe das einmal vorbereitet 
und brauche mich dann nachher 

751
00:38:28,960 --> 00:38:30,360
nicht mehr damit beschäftigen. 
Genau. 

752
00:38:30,560 --> 00:38:32,520
Habe ich eigentlich auch in 
jedem meiner Repos mittlerweile 

753
00:38:32,520 --> 00:38:33,800
drin. 
In meiner Agents MD ist auch 

754
00:38:33,800 --> 00:38:37,560
immer wieso ein Baum, wieso eine
Baumstruktur, die dem Agenten 

755
00:38:37,560 --> 00:38:40,440
ein bisschen hilft, wo finde ich
ja eigentlich was und da haben 

756
00:38:40,440 --> 00:38:43,640
natürlich dann alle was davon 
mit diesem Repro arbeiten jetzt 

757
00:38:43,640 --> 00:38:45,600
ist aber nicht alles, also klar 
kann ich jetzt so ein bisschen 

758
00:38:45,600 --> 00:38:47,680
irgendwie vorbereiten, aber 
jetzt gibt es natürlich auch das

759
00:38:47,680 --> 00:38:49,680
der Agent geht hin und arbeitet.
Der ist jetzt einfach. 

760
00:38:49,680 --> 00:38:51,360
Nur mal in seiner Loop. 
Wir können die am Anfang 

761
00:38:51,360 --> 00:38:53,440
versuchen, so ein bisschen zu 
minimieren. 

762
00:38:53,440 --> 00:38:56,320
Die Anzahl, die Anzahl der. 
Der Loop. 

763
00:38:56,320 --> 00:38:57,920
Runs nenne ich sie jetzt einfach
mal. 

764
00:38:58,480 --> 00:39:00,880
Aber er wird ja nicht drumherum 
kommen, das macht diese Dinger 

765
00:39:00,880 --> 00:39:02,880
ja eigentlich so mächtig. 
Deswegen können wir uns als 

766
00:39:02,880 --> 00:39:05,320
nächste Maßnahme jetzt mal 
angucken, wie ich innerhalb 

767
00:39:05,320 --> 00:39:08,320
dieser Loop Dinge optimieren 
kann und eine Sache, die da 

768
00:39:08,320 --> 00:39:11,520
extrem viele Tokens verbrauchen 
kann, sind Terminal Outputs 

769
00:39:11,760 --> 00:39:14,080
Agenten. 
Gerade im Coding sind deswegen 

770
00:39:14,080 --> 00:39:16,960
so mächtig, weil sie Befehle auf
der Kommandozeile ausführen. 

771
00:39:16,960 --> 00:39:19,120
Können. 
So typische Sachen. 

772
00:39:19,120 --> 00:39:22,320
Einen npm Test zum Beispiel hat 
oft eine extrem lange 

773
00:39:22,360 --> 00:39:24,800
outputquelle, weil der für jeden
einzelnen Test drun dann ein 

774
00:39:24,800 --> 00:39:26,640
Büro runterschreibt. 
Was ist denn da eigentlich 

775
00:39:26,640 --> 00:39:29,200
passiert oder stellt euch mal 
vor, ihr macht ein aufwendiges 

776
00:39:29,200 --> 00:39:33,040
Docker Bild, da sind jetzt 
wirklich tausende Zeilen 

777
00:39:33,040 --> 00:39:36,680
teilweise die das Terminal 
ausspuckt, die werden alle mit 

778
00:39:36,680 --> 00:39:39,840
in den Kontext geladen oder ich 
bin im Kubanitis. 

779
00:39:39,840 --> 00:39:42,400
Kontext lass mal Cube ctl logs 
laufen. 

780
00:39:42,960 --> 00:39:45,720
Die können extremst lang werden.
Ein guter Coding Agent sagt 

781
00:39:45,720 --> 00:39:48,200
vielleicht sogar Cube City L 
Loks, aber nur die letzten 20 

782
00:39:48,200 --> 00:39:51,240
oder nur die Loks in den letzten
5 Minuten, sonst musste man 

783
00:39:51,240 --> 00:39:54,280
sowas eigentlich auch mitgeben 
über auch wieder Custom 

784
00:39:54,280 --> 00:39:58,000
Instructions oder ich habe im 
Debug in ganze Stack traces oder

785
00:39:58,000 --> 00:40:00,320
Bild logs oder irgendwelche 
Linda Ausgaben wenn ich jetzt 

786
00:40:00,320 --> 00:40:03,440
wirklich irgendwie vergessen 
habe den den Linda zu 

787
00:40:03,440 --> 00:40:07,680
befriedigen und. 
Also das ist den. 

788
00:40:07,680 --> 00:40:10,480
Punkt, den ich machen will, ist.
Gerade wenn ich kommandozeilen 

789
00:40:10,480 --> 00:40:13,200
Tools ausführe, gerade solche, 
die die auch immer streamen. 

790
00:40:13,200 --> 00:40:16,320
Wieso Docker? 
Bild und sowas können mal eben 

791
00:40:16,560 --> 00:40:22,600
mir tausende Zeilen an Output in
den Kontext katapultieren und da

792
00:40:22,600 --> 00:40:25,480
gibt es ein paar, ja, da muss 
ich mir Bewusstsein, da gibt es 

793
00:40:25,480 --> 00:40:29,040
eben ein paar Möglichkeiten, wie
ich den den Output von Terminal 

794
00:40:29,600 --> 00:40:32,560
Tools minimieren kann. 
Ja, ich glaube, das kann ich. 

795
00:40:32,560 --> 00:40:35,480
Zum einen. 
Alpen manuell machen, das heißt,

796
00:40:35,480 --> 00:40:38,720
ich kann über meine Instructions
meinem Agent sagen, dass 

797
00:40:38,720 --> 00:40:41,120
bestimmte Dinge gekürzt werden 
sollen. 

798
00:40:41,440 --> 00:40:43,840
Das heißt, ich kann arbeiten 
damit, dass zum Beispiel per 

799
00:40:43,840 --> 00:40:47,120
Grab aus bestimmten Terminal 
Output nur bestimmte 

800
00:40:47,120 --> 00:40:50,280
Informationen rausgeholt werden,
das heißt, ich kann das 

801
00:40:50,280 --> 00:40:53,040
entsprechend filtern, bevor es 
dann zurückkommt, weil alles, du

802
00:40:53,040 --> 00:40:55,760
hast gerade gesagt, alles was 
auf dem Terminal landet, landet 

803
00:40:55,760 --> 00:40:59,040
automatisch in meinem. 
Kontext manchmal habe ich auch 

804
00:40:59,040 --> 00:41:01,960
die Möglichkeit, das selber zu 
beeinflussen, wenn ich zum 

805
00:41:01,960 --> 00:41:05,280
Beispiel ein Problem mit meiner 
Applikation habe und ich dieses 

806
00:41:05,280 --> 00:41:08,680
Problem mit Hilfe eines Coding 
Agents beheben will, dann sollte

807
00:41:08,680 --> 00:41:11,280
ich vielleicht nicht nur 
hingehen und sagen, ja, lass mal

808
00:41:11,360 --> 00:41:14,480
die Applikation laufen, guck mal
welche Fehler auftreten und 

809
00:41:14,720 --> 00:41:17,920
versuche die zu beheben, sondern
ich kann halt ganz gezielt auch 

810
00:41:17,920 --> 00:41:20,280
auf. 
Aus meiner eigenen, aus meinem 

811
00:41:20,280 --> 00:41:22,360
eigenen Terminal die 
Fehlermeldung rausholen und 

812
00:41:22,360 --> 00:41:24,640
sagen, Hey, ich habe folgendes 
gemacht, das ist der Fehler 

813
00:41:25,680 --> 00:41:28,240
Fixed dieses Problem statt 
erstmal den Agent selber 

814
00:41:28,240 --> 00:41:31,840
loslaufen zu lassen, der dann 
diverse Terminal Outputs 

815
00:41:31,840 --> 00:41:33,680
generiert und die erstmal 
einlesen muss. 

816
00:41:33,920 --> 00:41:37,440
Das heißt manche Dinge kann ich 
selber machen aber andere Dinge 

817
00:41:37,680 --> 00:41:41,640
müssen halt auch automatisch im 
Hintergrund laufen, dafür gibt 

818
00:41:41,640 --> 00:41:43,520
es entsprechende Tools. 
Kommen wir gleich auch noch im 

819
00:41:43,520 --> 00:41:46,480
Detail. 
Darauf, welche es da gibt. 

820
00:41:46,560 --> 00:41:49,440
Aber manche Dinge kann ich dann 
natürlich auch durch manuelle 

821
00:41:49,440 --> 00:41:53,400
Intervention dann reduzieren. 
Genau das geht natürlich nur, 

822
00:41:53,400 --> 00:41:55,360
wenn ich wirklich. 
Davor sitze, wenn das Ding jetzt

823
00:41:55,360 --> 00:41:57,760
6 Stunden im Hintergrund läuft, 
während ich schlafe, dann habe 

824
00:41:57,760 --> 00:42:00,200
ich daher keine Möglichkeit mehr
einzugreifen oder vielleicht 

825
00:42:00,200 --> 00:42:02,600
auch mal ein kommandozeilen Tool
anzupassen. 

826
00:42:02,600 --> 00:42:05,040
Ich habe mir das vielleicht 
vorher sehr aufwendig über 

827
00:42:05,040 --> 00:42:08,000
Custom Instructions gesagt, aber
wie heute schon gesagt hat, es 

828
00:42:08,000 --> 00:42:10,960
gibt ein Tool, das gerade so ein
bisschen in der Community gehypt

829
00:42:10,960 --> 00:42:14,720
wird. 
Das heißt rtk, also rtk. 

830
00:42:14,720 --> 00:42:18,720
Geschrieben, das steht für Rust 
Token Killer, und das ist ein 

831
00:42:18,720 --> 00:42:22,160
Tool, das kann ich quasi in die 
Hooks von meinem Coding Agenten 

832
00:42:22,160 --> 00:42:24,960
einhängen. 
Hooks heißt diese Coding 

833
00:42:24,960 --> 00:42:29,200
Agenten, die sagen dem System 
bei bestimmten Dingen Bescheid, 

834
00:42:29,200 --> 00:42:31,680
bevor jetzt zum Beispiel ein 
Kommando, also wenn in der 

835
00:42:31,680 --> 00:42:33,600
Kommandozeilen tun ausgeführt 
wurde bevor. 

836
00:42:34,200 --> 00:42:36,120
Der Output oder bevor dieses 
Tool eigentlich überhaupt 

837
00:42:36,120 --> 00:42:38,280
ausgeführt wird. 
Gibt es einen Hook und dann kann

838
00:42:38,280 --> 00:42:40,240
man eben Plugins oder 
Erweiterung schreiben, die dann 

839
00:42:40,240 --> 00:42:44,840
erstmal irgendwas machen bevor 
es weitergeht und einzelne Tools

840
00:42:44,840 --> 00:42:48,400
für diese Hooks benutzt, ist 
eben der Rust Token Killer rtk 

841
00:42:48,400 --> 00:42:50,520
geschrieben, verlinkt mir 
natürlich auch, wie alle Sachen 

842
00:42:50,520 --> 00:42:54,240
die wir besprechen in den 
Shownotes und der hängt sich 

843
00:42:54,240 --> 00:42:58,640
quasi vor CLI Kommandos und 
verdichtet den Output schon mal.

844
00:42:58,680 --> 00:43:00,240
Der heißt ja nicht umsonst Token
Killer. 

845
00:43:00,720 --> 00:43:04,960
Das heißt, du kriegst irgendwie 
rein so ein Git History und der 

846
00:43:04,960 --> 00:43:09,280
wandelt das um in. 
Rtk git history, das heißt das 

847
00:43:09,280 --> 00:43:12,560
Kommando 2 Tool wird ausgeführt.
Das Ergebnis wird vorgefiltert, 

848
00:43:12,560 --> 00:43:16,000
dass es nur noch die relevanten 
Dinge beinhaltet oder wenn ich 

849
00:43:16,000 --> 00:43:17,640
solche sage jetzt. 
Keine Ahnung. 

850
00:43:17,640 --> 00:43:19,800
Npm run Tests. 
Man kann das Ding vielleicht 

851
00:43:19,800 --> 00:43:21,200
irgendwie sagen. 
Jetzt kann ich ein bisschen 

852
00:43:21,200 --> 00:43:22,960
einstellen, wie aggressiv das 
sein soll. 

853
00:43:23,280 --> 00:43:25,360
Erfolgreiche Tests sind 
wahrscheinlich nicht wirklich 

854
00:43:25,360 --> 00:43:27,760
interessant und ich muss am Ende
wissen, wie viele Tests waren 

855
00:43:27,760 --> 00:43:30,640
insgesamt erfolgreich und welche
und die brauchen nur die Details

856
00:43:30,640 --> 00:43:33,280
von denen die fehlgeschlagen 
sind zum Beispiel, und das ist 

857
00:43:33,280 --> 00:43:35,840
ein Tool, das kann man sich 
reinhängen und das spart massiv 

858
00:43:35,840 --> 00:43:39,600
Tokens bei eben einer von diesen
großen Token Treibern, nämlich 

859
00:43:39,600 --> 00:43:44,960
diesem CLI Output, und sie haben
über 100 Supported Kommandos 

860
00:43:44,960 --> 00:43:49,560
schon quasi optimiert die Liste.
Wird da ständig erweitert, ist 

861
00:43:49,560 --> 00:43:51,600
ein Open Source Tool, kann man 
sich eben angucken und so für 

862
00:43:51,600 --> 00:43:53,760
die gängigen Sachen von 
irgendwelchen Package Managern 

863
00:43:53,760 --> 00:43:56,960
über Containergeschichten über 
Cloud Provider wie jetzt 

864
00:43:56,960 --> 00:44:01,280
irgendwie adbl US Digitap CLI, 
digit CLI selber aber auch das 

865
00:44:01,360 --> 00:44:05,400
Explorieren eines Repositories, 
da haben die eben Optimierungen 

866
00:44:05,400 --> 00:44:07,920
für geschrieben, weil sie eben 
schon wissen wie groß dieser 

867
00:44:08,240 --> 00:44:11,120
Output teilweise sein kann und 
bevor das dann überhaupt wieder 

868
00:44:11,120 --> 00:44:13,680
zurück an den Agenten geht und 
der sich das in seine. 

869
00:44:14,040 --> 00:44:16,840
In seinen Kontext reinlädt kürzt
dieses Tool quasi schon mal 

870
00:44:16,840 --> 00:44:19,760
runter und spart uns massiv 
Tokens ein. 

871
00:44:19,760 --> 00:44:21,840
Ja. 
Und man wundert sich so ein 

872
00:44:21,840 --> 00:44:25,760
bisschen, wie viele Tokens das 
letzten Endes auch bei solchen 

873
00:44:25,760 --> 00:44:29,800
Agenten sparen kann. 
Das war mir selber gar nicht so 

874
00:44:29,800 --> 00:44:31,200
bewusst. 
Die haben auf ihrer eigenen 

875
00:44:31,520 --> 00:44:33,840
Webseite so ein paar 
Statistiken, kann man sich 

876
00:44:33,840 --> 00:44:37,160
anschauen, aber es ist auf jeden
Fall ganz klar im zweistelligen 

877
00:44:37,160 --> 00:44:40,240
Bereich, wenn es um die Prozent 
der Einsparungen geht. 

878
00:44:40,560 --> 00:44:43,440
Und mir selber war es gar nicht 
bewusst, wieviel von dem Kontext

879
00:44:43,440 --> 00:44:46,160
allein solcher Terminal Output 
ist. 

880
00:44:46,320 --> 00:44:49,640
Und so ein Tool dann 
einzusetzen, was am Ende im 

881
00:44:49,640 --> 00:44:53,720
Hintergrund auch der Qualität 
nicht wirklich schadet ist 

882
00:44:53,720 --> 00:44:55,200
glaube ich ein ganz cleverer 
Weg. 

883
00:44:55,200 --> 00:44:58,400
Gerade wenn man jetzt hier diese
Tokens reduzieren muss. 

884
00:44:59,080 --> 00:45:01,920
Und der nächste Bereich, in den 
man mal reinschauen sollte ist, 

885
00:45:02,400 --> 00:45:05,440
würde ich jetzt unter context 
Cleanup zusammenfassen. 

886
00:45:05,600 --> 00:45:08,480
Wir hatten ja gerade ganz viel 
darüber gesprochen, was jetzt in

887
00:45:08,480 --> 00:45:13,560
diesem Kontext landet und gerade
bei langen Agent Sessions bleibt

888
00:45:13,560 --> 00:45:17,520
ja der Kontext erhalten, er muss
erhalten bleiben, damit der 

889
00:45:17,520 --> 00:45:21,720
Agent hier nicht unter irgendwie
Gedächtnisverlust leidet und 

890
00:45:21,720 --> 00:45:25,600
dementsprechend wird in langen 
Agent Sessions der Kontext immer

891
00:45:25,600 --> 00:45:29,280
größer und länger. 
Und dementsprechend die Kosten 

892
00:45:29,280 --> 00:45:32,080
auch höher. 
Und wir als Developer können das

893
00:45:32,080 --> 00:45:35,280
in gewisser Weise natürlich auch
selber einfach darüber 

894
00:45:35,280 --> 00:45:38,200
beeinflussen, dass wir die 
Aufgaben so klein schneiden, 

895
00:45:38,200 --> 00:45:42,000
dass wir einfach am Ende der 
Aufgabe eine neue Session 

896
00:45:42,000 --> 00:45:45,040
starten können und wir dann 
quasi mit einem sauberen 

897
00:45:45,040 --> 00:45:48,320
Kontextfenster beginnen. 
Und da können wir natürlich auch

898
00:45:48,320 --> 00:45:50,440
die KI zu fragen. 
Also wir hatten es ja gerade 

899
00:45:50,440 --> 00:45:52,240
schon mal gesagt, es ist vor 
allem dann sinnvoll, wenn ich 

900
00:45:52,240 --> 00:45:55,320
meine Aufgaben eh unterteilt 
habe in eine Planungsphase, oder

901
00:45:55,320 --> 00:45:57,080
ich bin jetzt fertig, bitte eine
Aufgabe, möchte aber 

902
00:45:57,080 --> 00:45:59,640
Erkenntnisse mit in die zweite 
nehmen, ich kann ja einfach 

903
00:45:59,640 --> 00:46:03,600
sagen, Aki zum Beispiel, prompt 
wäre, ich wechsle in einen Chat,

904
00:46:03,600 --> 00:46:05,920
gebt mir bitte einen Befehl, mit
dem ich die Sitzung neu starten 

905
00:46:05,920 --> 00:46:08,000
kann, ohne dass der Kontext 
Unterhaltung hier unserer 

906
00:46:08,000 --> 00:46:09,520
Unterhaltung verloren geht, 
bitte. 

907
00:46:10,240 --> 00:46:12,560
Sorge dafür, dass wir folgende 
wichtige Dinge, die wir 

908
00:46:12,560 --> 00:46:15,240
besprochen haben, 
zwischenspeichern, die ich damit

909
00:46:15,240 --> 00:46:18,560
in einen neuen Chat nehmen kann.
Blablabla, und das kann ich eben

910
00:46:18,560 --> 00:46:21,440
tun, und das ist auch durchaus 
sinnvoll, wenn ich nämlich erst 

911
00:46:21,440 --> 00:46:24,920
in dieses Planning gehe, dann. 
Und dann habe ich ja wie gesagt,

912
00:46:24,920 --> 00:46:28,440
dass den Vorteil, dass ich zum 
Beispiel eine lange Session 

913
00:46:28,440 --> 00:46:30,640
machen kann, wo ich dem Code 
sagen sage, ey, du fasst jetzt 

914
00:46:30,760 --> 00:46:33,000
überhaupt keinen Code an, wir 
erstellen es wirklich erstmal 

915
00:46:33,000 --> 00:46:35,360
nur einen Plan, das kann ich 
mich auch mit einem recht 

916
00:46:35,360 --> 00:46:38,320
kleinen Model machen und da 
würde es für mich auch viel Zeit

917
00:46:38,320 --> 00:46:40,480
rein rein verbringen. 
Also selbst wenn ich irgendwie 

918
00:46:40,480 --> 00:46:42,520
sage, ey, ich möchte das Ding 
jetzt irgendwie 6 Stunden 

919
00:46:42,520 --> 00:46:44,280
autonom laufen lassen, da würde 
ich es vielleicht zumindest 

920
00:46:44,280 --> 00:46:47,800
vorher mal eine halbe Stunde mit
dem Ding ins Planning gehen, 

921
00:46:47,800 --> 00:46:49,720
damit ich eben weiß, dass diese 
6 Stunden auch möglichst 

922
00:46:49,720 --> 00:46:52,400
effizient sind. 
Um das dann vielleicht auch mit 

923
00:46:52,400 --> 00:46:55,360
einem anderen Model zu machen. 
Albert Einstein hat mal gesagt, 

924
00:46:55,600 --> 00:46:58,480
wenn er, ich glaube, ich weiß 
nicht, ob ich das Zitat 100% 

925
00:46:58,480 --> 00:47:01,160
jetzt hier originalgetreu 
zusammen bekomme, ich habe hier 

926
00:47:01,160 --> 00:47:03,480
nur in den Notizen 
aufgeschrieben, Albert Einstein,

927
00:47:03,480 --> 00:47:05,880
Zitat Albert Einstein hat 
irgendwie mal sowas in die 

928
00:47:05,880 --> 00:47:08,520
Richtung gesagt, wenn ich eine 
Stunde Zeit hätte ein Problem zu

929
00:47:08,520 --> 00:47:11,440
lösen, ich würde 55 Minuten über
die Lösung nachdenken und es 

930
00:47:11,440 --> 00:47:15,040
dann in 5 Minuten versuchen zu 
lösen und genauso würde ich mit 

931
00:47:15,200 --> 00:47:17,800
mit KI arbeiten und daran gehen.
Jetzt ist natürlich in meinem 

932
00:47:17,800 --> 00:47:20,640
Beispiel nicht. 
Die halbe Stunde und die 6 

933
00:47:20,640 --> 00:47:22,800
Stunden danach autonom coden, 
nicht in dem gleichen 

934
00:47:22,800 --> 00:47:24,960
Verhältnis, aber ich glaube, ihr
wisst, was ich sagen will. 

935
00:47:24,960 --> 00:47:26,640
Es lohnt sich durchaus erst mal 
zu sagen, ey, ich gehe eine 

936
00:47:26,640 --> 00:47:29,680
halbe Stunde hin und danach 
räume ich alles auf und nehme 

937
00:47:29,680 --> 00:47:33,760
die Erkenntnisse davon rüber in 
eine komplett neue Session und 

938
00:47:34,000 --> 00:47:36,400
genau lasse die dann quasi 
runter coden. 

939
00:47:37,200 --> 00:47:39,400
Weil wenn so eine Session, wenn 
wenn ich es nicht tue und da 

940
00:47:39,400 --> 00:47:41,840
keine neue Session aufmache, 
dann wird das Ding irgendwann zu

941
00:47:41,840 --> 00:47:43,760
lang, dann wird das Kontext 
window irgendwann voll. 

942
00:47:43,760 --> 00:47:46,120
Diese ganzen Modelle, die haben 
einen Kontext window, das heißt 

943
00:47:46,120 --> 00:47:48,880
die hören also jeder Token, der 
da reinkommt kostet eh Geld, 

944
00:47:48,880 --> 00:47:51,360
aber irgendwann so mehr als 
1000000 Tokens kann ich ihnen 

945
00:47:51,360 --> 00:47:54,400
selbst die größten Modelle gar 
nicht rein quetschen, da geht 

946
00:47:54,400 --> 00:47:56,960
dann einfach nicht mehr rein, 
selbst wenn ich bezahlen würde, 

947
00:47:57,520 --> 00:47:59,600
heißt dann aber auch wenn diese 
1000000 Kontext window voll ist,

948
00:47:59,600 --> 00:48:01,440
zahle ich für jeden prompt 
eigentlich. 

949
00:48:01,440 --> 00:48:06,280
Die in dem Fall 5€. 
Nicht mehr von von Opus 47 was 

950
00:48:06,280 --> 00:48:08,320
passiert aber, wenn ich dann 
doch mal in dieses Limit komme, 

951
00:48:08,320 --> 00:48:11,040
dass der Agent kann da nicht 
mehr weiterarbeiten, das heißt, 

952
00:48:11,040 --> 00:48:14,520
er macht ein sogenanntes 
Compacting, er nimmt eigentlich 

953
00:48:14,520 --> 00:48:18,240
die bestehende Chat Historie und
fasst die zusammen und da geht 

954
00:48:18,240 --> 00:48:20,040
auch Qualität verloren und da 
sind natürlich aber auch 

955
00:48:20,040 --> 00:48:22,200
wichtige Dinge drin, das heißt 
er geht eigentlich hin und sagt 

956
00:48:22,200 --> 00:48:25,440
selber so, ich schreibe mir 
jetzt eine Zusammenfassung 

957
00:48:25,440 --> 00:48:28,040
überall das was in der letzten 
vielleicht Stunde passiert ist 

958
00:48:28,320 --> 00:48:30,680
und nur noch diese 
Zusammenfassung ist dann meine 

959
00:48:30,680 --> 00:48:32,560
Historie. 
Und damit das nicht an einem 

960
00:48:32,560 --> 00:48:35,920
Punkt passiert, der ungünstig 
ist, kann ich das als Developer 

961
00:48:35,920 --> 00:48:38,160
selber steuern und einfach, wenn
ich sage, Boah, jetzt ist 

962
00:48:38,160 --> 00:48:41,120
eigentlich ein guter Punkt, wo 
ich in ein neues Kapitel von 

963
00:48:41,120 --> 00:48:43,840
dieser Aufgabe übergehe, kann 
ich zum Beispiel einfach mit 

964
00:48:44,080 --> 00:48:47,280
Compact, ist es bei den meisten 
Tools mir selber so eine 

965
00:48:47,280 --> 00:48:50,160
Zusammenfassung erzeugen lassen,
dann eben hingehen und sagen, 

966
00:48:50,400 --> 00:48:53,240
so, jetzt ist gerade ein Punkt, 
wo wir eigentlich eine neue 

967
00:48:53,240 --> 00:48:56,320
Aufgabe anfangen, jetzt kannst 
du eigentlich gut das vorherige 

968
00:48:56,320 --> 00:48:58,800
zusammenfassen. 
Ja, und da, du hattest gerade 

969
00:48:58,800 --> 00:49:01,840
gesagt, es ist wichtig, dass 
bestimmte Informationen nicht 

970
00:49:01,840 --> 00:49:05,040
verloren gehen und um das 
sicherzustellen, dass zum 

971
00:49:05,040 --> 00:49:07,920
Beispiel meine Architektur 
Entscheidungen oder bestimmte 

972
00:49:07,920 --> 00:49:12,000
Security regeln, die der Agent 
immer präsent haben muss, nicht 

973
00:49:12,000 --> 00:49:15,280
verloren gehen sollte, die 
natürlich außerhalb dieser. 

974
00:49:15,920 --> 00:49:18,640
Quasi Agent Session History 
aufbewahren. 

975
00:49:18,840 --> 00:49:20,920
Wir hatten gerade schon darüber 
gesprochen, wir haben so eine 

976
00:49:20,920 --> 00:49:24,320
Agent MD file, eine Cloud MD 
file, also da kann ich natürlich

977
00:49:24,320 --> 00:49:28,760
solche Guidelines reinlegen oder
solche Regeln die immer präsent 

978
00:49:28,760 --> 00:49:31,920
sein sollen, weil ansonsten 
könnte es nämlich passieren. 

979
00:49:31,920 --> 00:49:35,840
Ich habe dem Agent am Anfang 
erklärt nach welchen Prinzipien 

980
00:49:36,000 --> 00:49:39,120
er entwickeln soll und 
irgendwann findet ein Compacting

981
00:49:39,120 --> 00:49:41,600
statt und dann geht ein Teil 
dieser Instruktion einfach 

982
00:49:41,600 --> 00:49:45,280
irgendwie verloren und dann baut
der Agent nachher Code der nicht

983
00:49:45,280 --> 00:49:47,320
meinen eigenen. 
Anforderungen entspricht und 

984
00:49:47,320 --> 00:49:49,200
dementsprechend sollte ich mir 
genau überlegen, wie kann ich 

985
00:49:49,200 --> 00:49:53,600
das ganze konsistent und 
persistent halten und 

986
00:49:53,600 --> 00:49:57,600
gleichzeitig auf der anderen 
Seite Token sparen über dieses 

987
00:49:57,600 --> 00:50:00,480
Compacting, was ich entweder 
selber durchführe oder was im 

988
00:50:00,480 --> 00:50:03,360
Zweifelsfall natürlich auch das 
Tool für mich im Hintergrund 

989
00:50:03,360 --> 00:50:05,040
macht, ja. 
Und das kann ich natürlich auch 

990
00:50:05,040 --> 00:50:07,200
Customizen die sind mittlerweile
relativ gut da drin, aber die 

991
00:50:07,200 --> 00:50:09,200
malte sagt, wenn ich ganz 
sicherstellen will, dass ich da 

992
00:50:09,200 --> 00:50:12,000
Dinge übernehmen will, dann 
gehören die wahrscheinlich. 

993
00:50:12,600 --> 00:50:15,480
Ohnehin in so eine Agents MD 
Datei, weil die wahrscheinlich 

994
00:50:15,480 --> 00:50:19,600
dann E Projekt für das ganze 
Projekt relevant sind. 

995
00:50:20,160 --> 00:50:23,160
Ich kann natürlich auch immer 
diese Zusammenfassungen prüfen, 

996
00:50:23,160 --> 00:50:25,320
also wenn ich so einen Slash 
Compact mache, dann das ist ja 

997
00:50:25,320 --> 00:50:27,520
transparent für mich, ich sehe 
da schon was da zusammengefasst 

998
00:50:27,520 --> 00:50:29,840
wird, das ist auch oft ein 
bisschen länger wenn ich jetzt 

999
00:50:30,120 --> 00:50:33,280
wirklich eine Session habe wo 
ich wo ich ja merke es geht 

1000
00:50:33,280 --> 00:50:34,880
danach nicht mehr in die 
richtige Richtung, dann würde 

1001
00:50:34,880 --> 00:50:36,720
ich vielleicht mir noch mal 
diese diese. 

1002
00:50:36,800 --> 00:50:39,040
Diese Zusammenfassung eben 
durchlesen und eventuell noch 

1003
00:50:39,040 --> 00:50:41,680
mal selber ergänzen. 
Ich glaube, zusammenfassend kann

1004
00:50:41,680 --> 00:50:45,600
man sagen, also eine neue 
Session ist auf jeden Fall 

1005
00:50:45,600 --> 00:50:48,640
günstiger als und auch besser 
von der Qualität als ein immer 

1006
00:50:48,640 --> 00:50:53,200
follower Kontext und gerade so 
rauschen darf durchaus 

1007
00:50:53,200 --> 00:50:56,640
komprimiert werden, das ist ja 
zum zum einen der Grund warum 

1008
00:50:56,640 --> 00:51:00,800
man subagenten teilweise 
einsetzt, weil ich dann sage 

1009
00:51:00,800 --> 00:51:03,680
alles was ein Subagent gemacht 
hat wird nicht mehr Teil von 

1010
00:51:03,680 --> 00:51:06,800
meinem Kontext, sondern der ist 
für sich eigenständig und 

1011
00:51:06,800 --> 00:51:08,520
besser. 
Wenn ich aber dieses Rauschen 

1012
00:51:08,520 --> 00:51:12,000
komprimiere, dann müssen meine 
Anforderungen aber stabil 

1013
00:51:12,000 --> 00:51:13,880
bleiben und auch wieder 
mitgetragen werden. 

1014
00:51:13,880 --> 00:51:16,520
Das heißt, es lohnt sich da auch
mal rein zu gucken, vielleicht 

1015
00:51:16,520 --> 00:51:18,440
noch kurz einen Satz zu diesen 
Subagenten und ich finde, das 

1016
00:51:18,440 --> 00:51:21,920
passt so ein bisschen hier in 
diese, in diese Sektion, manche 

1017
00:51:21,920 --> 00:51:24,400
fragen sich ja, warum ich, wenn 
ich eine größere App baue, warum

1018
00:51:24,400 --> 00:51:26,560
soll ich das unterteilen in 
einen Frontend Agent, einen 

1019
00:51:26,560 --> 00:51:29,120
Backend Agent und einen 
Infrastruktur Agent zum Beispiel

1020
00:51:29,120 --> 00:51:31,200
und? 
Und das ist genau dieses. 

1021
00:51:31,200 --> 00:51:34,760
Das ist genau dasselbe Thema. 
Die A können die dann parallel 

1022
00:51:34,760 --> 00:51:39,440
laufen und an ihren ihren 
Bereichen arbeiten und b wird 

1023
00:51:39,440 --> 00:51:41,360
dann in diesen oberen 
übergeordneten 

1024
00:51:41,360 --> 00:51:45,040
Orchestrierungsagent nicht diese
gesamte Chat History, die diese 

1025
00:51:45,040 --> 00:51:49,200
kleinen Subagenten unter sich 
ausmachen, mit in die größere 

1026
00:51:49,200 --> 00:51:51,760
Chat Historie mit eingepflegt, 
sondern wenn so ein Agent wenn 

1027
00:51:51,760 --> 00:51:54,160
da vorne ein Agent hat solche 
fertig ist, dann werden nur die 

1028
00:51:54,160 --> 00:51:57,800
Ergebnisse davon dann passiert 
da quasi ein Compacting und nur 

1029
00:51:57,800 --> 00:51:59,800
die Ergebnisse davon werden dann
quasi in übergeordneten. 

1030
00:51:59,880 --> 00:52:02,680
Agenten gemeldet und der kann 
von da aus dann länger weiter 

1031
00:52:02,680 --> 00:52:05,200
arbeiten, ohne dass er ein 
Compacting machen muss. 

1032
00:52:05,200 --> 00:52:07,640
Denn wenn er das irgendwann 
machen muss, dann leidet er oft 

1033
00:52:07,640 --> 00:52:10,520
die Qualität runter und das noch
mal so als Einschub ist oft der 

1034
00:52:10,520 --> 00:52:12,320
Grund warum man so Agenten 
verwendet. 

1035
00:52:12,720 --> 00:52:15,280
Ja, und zudem habe ich dann die 
Möglichkeit, auch so eigene 

1036
00:52:15,280 --> 00:52:18,960
Instruktionen zu hinterlegen für
diese spezialisierten Agenten. 

1037
00:52:18,960 --> 00:52:22,480
Weil warum soll mein Backend 
Agent sich jetzt sich jetzt im 

1038
00:52:22,480 --> 00:52:25,440
Detail mit meinem Frontend 
Framework und mit meinem. 

1039
00:52:26,160 --> 00:52:29,560
Design Framework irgendwie 
auskennen weil am Ende schreibt 

1040
00:52:29,560 --> 00:52:32,760
der Backend Agent irgendwie nur 
mein Backend Code und diese 

1041
00:52:32,760 --> 00:52:35,760
Informationen, die würden dann 
ansonsten nur quasi zu einer 

1042
00:52:35,760 --> 00:52:40,320
Vergrößerung meines Kontextes 
führen und völlig irrelevante 

1043
00:52:40,320 --> 00:52:42,440
Informationen enthalten. 
Das heißt ich kann natürlich 

1044
00:52:42,440 --> 00:52:45,520
über diese Agent sehr gut auch 
trennen, welche Informationen 

1045
00:52:45,520 --> 00:52:49,680
gehören wohin und kann sie dann 
wirklich nur bei Bedarf auch 

1046
00:52:50,160 --> 00:52:54,720
abrufen und vielleicht an der 
Stelle auch zum Thema bei Bedarf

1047
00:52:54,720 --> 00:52:57,600
abrufen und. 
Da gibt es natürlich auch andere

1048
00:52:57,600 --> 00:53:01,040
Möglichkeiten, Informationen nur
bei Bedarf abzurufen. 

1049
00:53:01,280 --> 00:53:03,560
Und vielleicht sollten wir da 
noch mal ganz kurz so ein 

1050
00:53:03,560 --> 00:53:05,600
bisschen über das Thema Skills 
sprechen. 

1051
00:53:05,840 --> 00:53:08,400
Ja, was meinst du damit so ein 
bisschen mit diesen bei Bedarf 

1052
00:53:08,400 --> 00:53:12,040
abrufen ist. 
Ich habe so ein bisschen, also 

1053
00:53:12,040 --> 00:53:14,640
ein bisschen das. 
Problem gerade im im KI Coding, 

1054
00:53:14,640 --> 00:53:18,720
dass durch diesen ganzen Hype 
von MCP Servern, wo ich ja dem 

1055
00:53:18,720 --> 00:53:23,240
Agenten eine eine Risikoanzahl 
an verschiedenen Tools 

1056
00:53:23,280 --> 00:53:25,760
bereitstellen kann. 
Mein Kontext schon von 

1057
00:53:25,760 --> 00:53:28,400
vornherein relativ voll ist, 
weil jeder dieser MCP Server 

1058
00:53:28,400 --> 00:53:31,440
bringt Tools und jede von diesen
Tools hat eine Toolbeschreibung 

1059
00:53:31,440 --> 00:53:34,080
und auch eine Beschreibung von 
allen Parametern mit drin und 

1060
00:53:34,080 --> 00:53:37,040
wenn ich das alles einlade, dann
sind das schon tausende Tokens, 

1061
00:53:37,040 --> 00:53:39,800
die in meinem Kontext stehen und
Agent muss sich dann selber 

1062
00:53:39,800 --> 00:53:42,320
irgendwie raussuchen. 
Für welche Aufgabe möchte er 

1063
00:53:42,320 --> 00:53:46,080
denn welche von diesen MCP 
Servern zum Beispiel laden oder 

1064
00:53:46,080 --> 00:53:50,880
ich habe bestimmte Instruktionen
oder meine meine meine Agents MD

1065
00:53:50,880 --> 00:53:53,200
file oder meine Custom 
instructing Dateien werden so 

1066
00:53:53,200 --> 00:53:55,760
lang weil ich. 
Fast alle Eventualitäten, die so

1067
00:53:55,840 --> 00:53:59,200
in die so ein Agent reinlaufen, 
kann da ausführlich beschreibe 

1068
00:53:59,760 --> 00:54:03,120
und um beide Probleme eigentlich
anzugehen, gibt es schon seit 

1069
00:54:03,120 --> 00:54:05,440
längerem jetzt das Konzept von 
sogenannten Skills. 

1070
00:54:05,760 --> 00:54:08,600
Skills sind eigentlich ein 
Unterordner mit einer oft nur 

1071
00:54:08,600 --> 00:54:11,040
einer markdown Datei, manchmal 
so ein paar unterstützenden 

1072
00:54:11,040 --> 00:54:14,240
Skripten, die bestimmte 
Szenarien zum Beispiel 

1073
00:54:14,240 --> 00:54:17,120
beschreiben, also weniger als 
ein Subagent, aber ein Skill 

1074
00:54:17,120 --> 00:54:20,000
kannst du euch sagen wie man die
Tests ausführt und dann. 

1075
00:54:20,640 --> 00:54:24,320
Steht da genau drin für welches 
Framework, also welches 

1076
00:54:24,320 --> 00:54:26,880
Framework wir hier für Testing 
benutzen und welchen Kommandos 

1077
00:54:26,880 --> 00:54:29,000
ich das ausführe. 
Und vielleicht sind noch 2 MCP 

1078
00:54:29,000 --> 00:54:31,840
Server mit dabei, der eine ist 
ein Context 7 Server wo schon 

1079
00:54:31,840 --> 00:54:34,920
drin steht was was denn die ID 
von unserem Testing Framework 

1080
00:54:34,920 --> 00:54:35,800
ist. 
Der andere ist vielleicht 

1081
00:54:35,800 --> 00:54:39,280
irgendwie was was die Test 
Coverage der letzten Test Runs 

1082
00:54:39,280 --> 00:54:42,760
abfragen kann und mit einer 
gemeinsamen Beschreibung und der

1083
00:54:42,760 --> 00:54:45,520
Vorteil von Skills ist, dass. 
Dem Agenten wird zwar gesagt, 

1084
00:54:45,520 --> 00:54:48,160
dass diese Skills existieren, 
weil da wird beim Starten einmal

1085
00:54:48,160 --> 00:54:51,200
das Verzeichnis gescannt, wo 
diese Skills drin liegen, die 

1086
00:54:51,200 --> 00:54:53,360
werden aber erst dann in den 
Kontext geladen, wenn der Agent 

1087
00:54:53,360 --> 00:54:55,520
sich dazu entscheidet, dass er 
jetzt was mit in unserem 

1088
00:54:55,520 --> 00:54:59,040
Beispiel Tests machen möchte. 
Das heißt, diese ganze 

1089
00:54:59,040 --> 00:55:01,240
Information, wie führe ich 
eigentlich Tests aus, die liegt 

1090
00:55:01,240 --> 00:55:04,240
nicht von vornherein im Kontext,
sondern die liegt in diesem 

1091
00:55:04,240 --> 00:55:06,160
Skill und der Skill wird erst 
dann geladen, wenn Tests 

1092
00:55:06,160 --> 00:55:08,720
ausgeführt werden und auch der 
MCP Server, den ich dafür 

1093
00:55:08,720 --> 00:55:10,880
brauche, mit den Tool 
Beschreibungen wird auch erst 

1094
00:55:10,880 --> 00:55:13,720
dann herangezogen und dem Agent 
wird sogar gesagt, dass er den 

1095
00:55:13,720 --> 00:55:17,120
jetzt bitte verwenden soll und 
gerade bei größeren Projekten 

1096
00:55:17,120 --> 00:55:19,120
gar nicht mehr nur im Coding, 
sondern vielleicht auch jetzt 

1097
00:55:19,120 --> 00:55:21,320
irgendwie bei Open Claw oder 
wenn ich generellere Sachen 

1098
00:55:21,320 --> 00:55:23,240
mache oder wenn ich an einem 
sehr großen Coding Projekt 

1099
00:55:23,240 --> 00:55:25,840
arbeite, wo es sehr viele 
verschiedene Aufgaben gibt. 

1100
00:55:26,120 --> 00:55:27,600
Dann macht das durchaus Sinn, 
dass ich nicht alle 

1101
00:55:27,600 --> 00:55:30,640
Möglichkeiten und alle möglichen
Aufgaben, die jemals anfallen 

1102
00:55:30,640 --> 00:55:33,960
können, von vornherein in den 
Kontext mit Reinschieße, sondern

1103
00:55:33,960 --> 00:55:36,080
das eben in diese einzelnen 
Skills auslagere. 

1104
00:55:36,880 --> 00:55:39,520
Das heißt, wenn ich diesen einen
Agenten habe, kann er dann bei 

1105
00:55:39,520 --> 00:55:42,120
Bedarf auf einen bestimmten 
Skill zugreifen und die 

1106
00:55:42,120 --> 00:55:45,360
Informationen dazu werden auch 
nur bei Bedarf in den Kontext 

1107
00:55:45,360 --> 00:55:48,160
geladen und das ist dann auch 
eine Alternative zu diesen 

1108
00:55:48,160 --> 00:55:51,440
spezialisierten Agents, die wir 
gerade kurz angesprochen hatten.

1109
00:55:51,600 --> 00:55:55,040
Je nachdem in welche Richtung 
ich dort entwickle, ist es 

1110
00:55:55,040 --> 00:55:58,560
teilweise überlappend, teilweise
unterschiedlich, muss man sich 

1111
00:55:58,560 --> 00:56:00,960
entscheiden, was ich da 
verwende, der Vollständigkeit 

1112
00:56:00,960 --> 00:56:03,840
halber kurz erwähnt. 
Ich die Tool Anbieter. 

1113
00:56:03,840 --> 00:56:07,440
Also wenn ich jetzt tools sage 
meine ich diese Agent Tool 

1114
00:56:07,440 --> 00:56:10,400
Anbieter arbeiten auch an 
Strategien wie man das Ganze mit

1115
00:56:10,400 --> 00:56:14,240
den MCP Tools noch verbessern 
kann und diese auch nur bei 

1116
00:56:14,240 --> 00:56:16,240
Bedarf lädt. 
Das heißt wir haben so eine High

1117
00:56:16,240 --> 00:56:20,240
Level Beschreibung für einen 
bestimmten MCP damit der Agent 

1118
00:56:20,240 --> 00:56:22,040
weiß okay wenn ich eine 
bestimmte Aufgabe habe. 

1119
00:56:22,040 --> 00:56:25,360
Ich muss zum Beispiel ein JIRA 
Ticket lesen, nur dann lade ich 

1120
00:56:25,360 --> 00:56:30,160
die ganzen Tool Beschreibungen 
die mir der JIRA MCP gibt und 

1121
00:56:30,160 --> 00:56:33,880
kann dann auf das entsprechende.
Tool zurückgreifen oder den 

1122
00:56:33,880 --> 00:56:37,040
entsprechenden Tool Call um halt
mir das Ticket zu laden. 

1123
00:56:37,200 --> 00:56:39,360
Das heißt ich muss nicht immer 
alles reinladen, aber das ist 

1124
00:56:39,360 --> 00:56:42,360
auch ein Feld, das sich gerade 
noch entwickelt und ich glaube 

1125
00:56:42,360 --> 00:56:44,720
bei den Skills haben wir das als
Erstes gesehen. 

1126
00:56:44,720 --> 00:56:48,080
Dieses Prinzip des Lazy loadings
Wir haben mittlerweile an 

1127
00:56:48,080 --> 00:56:51,520
einigen Stellen wirklich diese 
überlappenden Technologien und 

1128
00:56:51,520 --> 00:56:54,720
da kann man sich dann teilweise 
Nachgeschmack oder halt wirklich

1129
00:56:54,720 --> 00:56:57,520
nach Nuancen überlegen, was 
gerade für mich das Beste ist. 

1130
00:56:58,040 --> 00:56:59,880
Ich hatte das letztens bei getap
Coop Halt gesehen. 

1131
00:56:59,880 --> 00:57:02,160
Habe ich eine Aufgabe gegeben 
und dann ist erst mal lange 

1132
00:57:02,160 --> 00:57:04,200
nichts passiert und ich habe 
mich gewundert, hä, was ist los?

1133
00:57:04,200 --> 00:57:06,640
Und dann habe ich unten gesehen,
dass er gerade dass das 

1134
00:57:06,640 --> 00:57:10,640
irgendwie Tool selection wird 
optimiert oder so was heißt er 

1135
00:57:10,640 --> 00:57:13,560
geht erstmal hin und guckt was 
steht denn eigentlich ein Tool 

1136
00:57:13,560 --> 00:57:15,840
zur Verfügung und welche lade 
ich denn jetzt wirklich im 

1137
00:57:15,840 --> 00:57:18,280
Detail in diese Session 
basierend auf dem prompt den ich

1138
00:57:18,280 --> 00:57:20,000
Ihnen gegeben habe, fand ich 
eigentlich ganz ganz cool 

1139
00:57:20,000 --> 00:57:22,080
gemacht und da haben wir schon 
gesehen okay jetzt wird auf 

1140
00:57:22,080 --> 00:57:24,960
jeden Fall auch erstmal 
Optimierung Optimierung 

1141
00:57:24,960 --> 00:57:26,800
vorgenommen bevor es eigentlich 
überhaupt losgeht. 

1142
00:57:27,720 --> 00:57:30,720
Jetzt haben wir ganz lange über 
das Thema Input gesprochen, aber

1143
00:57:30,720 --> 00:57:33,440
jetzt lass uns noch mal ein 
bisschen über die Output Tokens 

1144
00:57:33,440 --> 00:57:35,200
sprechen. 
Du hast ja gerade am Anfang, 

1145
00:57:35,600 --> 00:57:38,880
genau du hast gerade am Anfang 
gesagt, das kostet teilweise das

1146
00:57:38,880 --> 00:57:43,120
fünffache pro 1000000 Tokens und
dementsprechend können wir da 

1147
00:57:43,120 --> 00:57:46,960
natürlich auch, obwohl meiner 
Erfahrung nach natürlich immer 

1148
00:57:47,040 --> 00:57:49,800
mehr Input anfällt. 
Als Output können wir natürlich 

1149
00:57:49,800 --> 00:57:54,000
durch den höheren Kostenfaktor 
auch beim Output einiges an Geld

1150
00:57:54,000 --> 00:57:55,600
sparen. 
Ja, ich habe ein Glück, dass 

1151
00:57:55,600 --> 00:57:57,640
unser Podcast hier nicht nach 
Output Tokens. 

1152
00:57:57,760 --> 00:57:59,920
Bemessen wird, und ich glaube, 
wir sind schon relativ lange 

1153
00:57:59,920 --> 00:58:02,560
hier in der Folge drin, aber ich
glaube, das ist noch mal 

1154
00:58:02,560 --> 00:58:06,800
ziemlich nützlich, denn klar, 
ich kann dem Agenten von 

1155
00:58:06,800 --> 00:58:10,240
vornherein sagen, ey, du fasst 
dich bitte kurz in der Antwort 

1156
00:58:10,240 --> 00:58:13,440
oder gib mir vielleicht nur die 
allerrelevantesten Sachen, mach 

1157
00:58:13,440 --> 00:58:17,440
keine Einleitung, gib mir nur 
den einen fix raus oder antworte

1158
00:58:17,440 --> 00:58:22,160
maximal in 5 Bullet points oder 
du musst mir nichts erklären, 

1159
00:58:22,160 --> 00:58:24,880
erst wenn ich Nachfrage. 
Aber ganz ehrlich, das sind so 

1160
00:58:24,880 --> 00:58:27,720
Techniken, da spare ich dann ein
paar 100 Tokens vielleicht am 

1161
00:58:27,720 --> 00:58:31,400
Ende trotzdem. 
Die Großteil von diesen Output 

1162
00:58:31,400 --> 00:58:34,080
Tokens geht ja auch schon in 
dieser Agent Loop verloren, also

1163
00:58:34,080 --> 00:58:37,080
in diesem der Agent quasi 
plappert ja eigentlich vor sich 

1164
00:58:37,080 --> 00:58:40,080
hin in dieser Agent Loop 
produziert Zwischenergebnisse, 

1165
00:58:40,240 --> 00:58:43,360
die dann in der nächsten Loop 
wieder aufgefasst werden, wie 

1166
00:58:43,360 --> 00:58:45,800
wir Tool Outputs reduzieren, 
haben wir gerade eben schon mit 

1167
00:58:45,800 --> 00:58:48,720
diesem RTK Tool rausgefunden, 
aber es gibt auch noch eine ganz

1168
00:58:48,720 --> 00:58:51,800
coole Möglichkeit wie ich den 
eigentlichen Output von so einem

1169
00:58:51,800 --> 00:58:53,880
Agenten auch in dieser zwischen 
in diesem. 

1170
00:58:53,960 --> 00:58:56,400
Und diesem Zwischengeplapper 
reduzieren kann. 

1171
00:58:56,480 --> 00:59:00,320
Da gibt es jetzt den Cave man 
Mode, also der sorgt dafür, dass

1172
00:59:00,320 --> 00:59:03,240
der KI wieder Name sagt, so 
spricht wie Höhlenmenschen, die 

1173
00:59:03,240 --> 00:59:05,880
waren nämlich noch nicht so 
eloquent und haben stundenlange 

1174
00:59:05,880 --> 00:59:08,000
Podcasts aufgenommen, sondern 
die haben wirklich nur das 

1175
00:59:08,000 --> 00:59:12,200
Nötigste kommuniziert, so bildet
man das hier zumindest ein, und 

1176
00:59:12,200 --> 00:59:14,320
das ist ein Tool, das heißt doch
wirklich cave man. 

1177
00:59:14,680 --> 00:59:18,800
Und das sorgt wohl dafür, dass 
wirklich nur das absolute 

1178
00:59:18,800 --> 00:59:21,600
Minimum an natürlicher Sprache 
ausgegeben wird. 

1179
00:59:21,600 --> 00:59:26,560
Und sie sagen selber, dass Sie 
da im Schnitt bis zu 75% Output 

1180
00:59:26,560 --> 00:59:31,040
Tokens mit sparen können, ohne 
an Genauigkeit zu verlieren und 

1181
00:59:31,040 --> 00:59:33,000
zu sagen, irgendwie so ein 
Beispiel haben sie gesagt, Hey, 

1182
00:59:33,000 --> 00:59:37,120
eine normale Ausgabe von Cloud 
könnte irgendwie so aussehen. 

1183
00:59:37,560 --> 00:59:40,640
Sind irgendwo ey. 
Klar, ich freue mich, dass ich 

1184
00:59:40,640 --> 00:59:44,200
dir helfen kann, den Fehler, den
du hier vorliegen hast, der ist 

1185
00:59:44,200 --> 00:59:46,720
wahrscheinlich blablabla und die
Middleware und da gibt es auch 

1186
00:59:46,720 --> 00:59:50,240
die Token Expiry lass mich doch 
mal kurz drauf gucken, da kann 

1187
00:59:50,240 --> 00:59:52,600
ich dir, die kann ich dir 
bestimmt mithelfen, das kennt 

1188
00:59:52,600 --> 00:59:54,080
man ja vielleicht so ein 
bisschen, wenn man mit KI 

1189
00:59:54,080 --> 00:59:56,520
arbeitet und mit diesem Caveman 
Move sagt das Ding dann einfach 

1190
00:59:56,520 --> 01:00:00,960
nur Bug in Authentication 
Middleware Token Expiry nicht 

1191
01:00:00,960 --> 01:00:05,040
gut, muss kleiner sein, ist 
kleiner gleich fixen. 

1192
01:00:05,920 --> 01:00:11,040
Versucht hat so ein bisschen auf
ja, wieso ein Höhlenmensch zu 

1193
01:00:11,040 --> 01:00:12,640
sprechen? 
Da kommt das so, also eigentlich

1194
01:00:13,480 --> 01:00:18,320
eigentlich sehr humorvoll, aber 
extrem effizient und der 

1195
01:00:18,320 --> 01:00:19,920
praktisch nutzt jetzt nicht, 
dass KI immer wieso ein 

1196
01:00:19,920 --> 01:00:21,680
Höhlenmensch sprechen soll, aber
dass man sich jetzt halt als 

1197
01:00:21,680 --> 01:00:23,680
Developer entscheiden kann und 
man kann in diesem Tool auch ein

1198
01:00:23,680 --> 01:00:26,920
bisschen einstellen, wie sehr 
oder wie wie stark er quasi 

1199
01:00:26,960 --> 01:00:31,840
diesen Modus fahren soll, aber 
es ist nicht nur lustig, sondern

1200
01:00:31,840 --> 01:00:33,520
es scheint auch extrem gut zu 
funktionieren. 

1201
01:00:33,600 --> 01:00:35,520
Lustig wird es dann, wenn man 
es. 

1202
01:00:36,000 --> 01:00:37,720
Wenn das Ding immer noch 
aktiviert ist, wenn es zum 

1203
01:00:37,720 --> 01:00:39,760
Beispiel einen Poly Quest 
aufmacht, dann Poly Quest 

1204
01:00:39,760 --> 01:00:41,920
Beschreibungen für eine 
generiert oder wie auf einen 

1205
01:00:41,920 --> 01:00:44,240
issue antwortet, dann macht es 
nämlich weiterhin in dieser 

1206
01:00:44,240 --> 01:00:46,800
caveman Ausgabe, aber vor allem 
für diesen Agent Loop. 

1207
01:00:46,800 --> 01:00:49,760
Für diese Zwischenausgabe reicht
das, was wir gerade im zweiten 

1208
01:00:49,760 --> 01:00:52,680
Beispiel gehört haben, ja völlig
aus und kann wie gesagt bis zu 

1209
01:00:52,680 --> 01:00:54,800
75% Output Token sparen, das 
spart. 

1210
01:00:54,800 --> 01:00:57,520
Richtig, richtig Geld. 
Ja, ich glaube, man kann sagen, 

1211
01:00:57,520 --> 01:01:01,200
wenn der Agent am Ende mir 
irgendwas erklärt, ist es 

1212
01:01:01,200 --> 01:01:03,480
vielleicht gut, das ein bisschen
ausführlicher zu machen, damit 

1213
01:01:03,480 --> 01:01:06,160
ich es auch verstehe. 
Wenn er mit sich selber redet, 

1214
01:01:06,160 --> 01:01:09,520
dann kann er das so machen, dass
nur er das versteht und ich im 

1215
01:01:09,520 --> 01:01:13,120
Zweifelsfall, wenn ich in die 
Details gucke, das dann auch 

1216
01:01:13,120 --> 01:01:15,280
irgendwie noch nachvollziehen 
kann. 

1217
01:01:15,440 --> 01:01:18,800
Aber ich glaube, das 
funktioniert tatsächlich sehr 

1218
01:01:18,800 --> 01:01:23,040
gut, wenn ich jetzt nicht diesen
caveman Mode in mein Tool 

1219
01:01:23,040 --> 01:01:25,120
nachinstallieren möchte, kann 
ich das natürlich auch ganz 

1220
01:01:25,120 --> 01:01:28,640
einfach über meine eigenen 
Instructions machen und dort 

1221
01:01:28,640 --> 01:01:32,560
auch schon dafür sorgen, dass 
Antworten immer kurz und knapp 

1222
01:01:32,560 --> 01:01:35,960
sind, aber die. 
Dieser Modus treibt es natürlich

1223
01:01:35,960 --> 01:01:38,240
so ein bisschen auf die Spitze 
und ich glaube, der ist deshalb 

1224
01:01:38,240 --> 01:01:40,560
so populär, weil es auch so ein 
bisschen lustig ist. 

1225
01:01:40,960 --> 01:01:43,000
Ja, die nächste Optimierung, die
liegt eigentlich so ein bisschen

1226
01:01:43,000 --> 01:01:44,600
aus der Hand, haben wir aber 
jetzt gerade noch mal so ein 

1227
01:01:44,600 --> 01:01:46,520
bisschen aus den Augen 
eigentlich verloren, und das 

1228
01:01:46,520 --> 01:01:49,560
ist, dass man natürlich erst mal
oben nicht unbedingt Tokens, 

1229
01:01:49,560 --> 01:01:52,480
aber auf jeden Fall, um Kosten 
zu optimieren, das passende 

1230
01:01:52,480 --> 01:01:55,520
Modell wählen sollte, das Glaube
ich, also ich sehe das immer 

1231
01:01:55,520 --> 01:01:58,360
noch sehr, sehr, sehr, sehr oft,
dass einfach quasi das Default 

1232
01:01:58,360 --> 01:02:00,640
Modell, was irgendwie 
eingestellt wurde verwendet wird

1233
01:02:00,960 --> 01:02:03,000
und. 
Und das ist in Cloud Code 

1234
01:02:03,000 --> 01:02:06,080
wahrscheinlich im Moment opus 
47, aber opus 47 für alles zu 

1235
01:02:06,080 --> 01:02:08,080
verwenden ist reine 
Verschwendung, vor allem 

1236
01:02:08,080 --> 01:02:10,960
Geldverschwendung, weil für ich 
würde fast schon so weit gehen, 

1237
01:02:10,960 --> 01:02:15,600
sagen 90% der Aufgaben kannst du
andere Modelle benutzen, die 

1238
01:02:15,600 --> 01:02:19,040
wahrscheinlich auch ein Viertel 
der Kosten haben, wenn überhaupt

1239
01:02:19,200 --> 01:02:22,840
und bei den restlichen 10%, da 
kann ich mich dann auf Opus 

1240
01:02:22,840 --> 01:02:25,680
verlassen und das. 
Damit kann ich halt bis zu 90% 

1241
01:02:25,680 --> 01:02:27,920
der Kosten teilweise einsparen, 
nämlich zum Beispiel wenn ich 

1242
01:02:27,920 --> 01:02:30,880
jetzt in dieser Cloud Welt 
einfach mal neben das IQ Modell 

1243
01:02:30,880 --> 01:02:36,560
zum Beispiel nehme für relativ 
simple Sachen, also einfach 

1244
01:02:36,560 --> 01:02:40,240
irgendwas zusammenfassen oder 
einfach irgendwie eine Webseite 

1245
01:02:40,240 --> 01:02:44,280
zu scraten oder aus irgendeiner 
aus irgendeinem Konsolen Output 

1246
01:02:44,280 --> 01:02:47,280
oder aus irgendeiner json Datei 
Daten zu extrahieren. 

1247
01:02:47,840 --> 01:02:50,760
Irgendwelche question und answer
Sachen über Dokumente zu machen,

1248
01:02:51,200 --> 01:02:53,680
zu formatieren, also einen 
reinen Formatierungs oder 

1249
01:02:53,760 --> 01:02:57,280
Linterfehler aufzuräumen, ein 
kurzes reines Brainstorming zu 

1250
01:02:57,280 --> 01:02:58,920
machen, irgendwie so Batch 
Processing, das sind alles 

1251
01:02:58,920 --> 01:03:00,320
Sachen, die kann ich mit Heiko 
machen. 

1252
01:03:00,760 --> 01:03:03,360
Ein Heiko kostet zum Beispiel 
nur 0,25€ Pro 1000000 Input und 

1253
01:03:03,360 --> 01:03:06,880
$1,25 Pro 1000000 Output Tokens 
im Gegensatz zu den $25 die er 

1254
01:03:06,880 --> 01:03:09,520
opus haben will, da kann ich 
immer noch einen Schritt 

1255
01:03:09,920 --> 01:03:12,320
weitergehen und zum Beispiel 
Sonet verwenden, das ist so mein

1256
01:03:12,320 --> 01:03:14,160
Standardmodell, da habe ich die 
besten Ergebnisse mit. 

1257
01:03:17,840 --> 01:03:22,000
Das aktuelle Sonic Modell kostet
zum Beispiel $15 Pro 1000000 

1258
01:03:22,000 --> 01:03:27,320
Output Tokens und nicht die 25. 
Die Opus kostet also immer noch 

1259
01:03:27,320 --> 01:03:30,240
mal deutlich günstiger und damit
mache ich dann so meine ersten 

1260
01:03:30,240 --> 01:03:32,400
Drafs für irgendwelche 
Strategien oder wenn ich halt 

1261
01:03:32,400 --> 01:03:33,760
ganz normal einfach Texte 
schreiben muss. 

1262
01:03:33,760 --> 01:03:35,520
Also wenn ich vielleicht gar 
nicht unbedingt. 

1263
01:03:35,640 --> 01:03:38,160
Code aber auch so so. 
Reasoning Task über mehrere 

1264
01:03:38,160 --> 01:03:43,040
Schritte Analysen. 
Vom vorliegenden Code oder auch 

1265
01:03:43,040 --> 01:03:45,960
normales Coding in einzelnen 
Dateien oder die beiden dafür 

1266
01:03:45,960 --> 01:03:48,160
ist es wirklich mehr als 
ausreichend. 

1267
01:03:48,320 --> 01:03:50,720
Kann extrem gut auch Tools 
ausführen, diese Agentischen 

1268
01:03:50,720 --> 01:03:53,920
Multi step Workflows machen und 
Opus ist dann eigentlich eher so

1269
01:03:53,920 --> 01:03:56,240
mein Eskalationspfad. 
Also wenn ich jetzt wirklich 

1270
01:03:56,560 --> 01:04:00,040
sage alles klar, ich nehme das 
teuerste Opus Modell, ich gehe 

1271
01:04:00,040 --> 01:04:03,360
hin und mache entweder das 
letzte Review von dem Plan den 

1272
01:04:03,360 --> 01:04:05,280
die vorherigen Modelle erstellt 
haben oder. 

1273
01:04:05,840 --> 01:04:08,240
Oder muss wirklich irgendwas 
sehr, sehr, sehr komplexes 

1274
01:04:08,240 --> 01:04:11,640
finden oder die Wagen wo die 
anderen Modelle vorher quasi 

1275
01:04:11,640 --> 01:04:15,200
fehlgeschlagen sind? 
Dafür nehme ich dann opus und 

1276
01:04:15,200 --> 01:04:17,880
ich kann einfach 90% meiner 
Arbeit mit den deutlich 

1277
01:04:17,880 --> 01:04:20,840
günstigeren Modellen machen und 
da würde ich sagen, das ist 

1278
01:04:20,840 --> 01:04:24,280
eigentlich das Killer Feature in
der Kostenoptimierung, das ist 

1279
01:04:24,280 --> 01:04:26,320
das was ich am Manuellsten 
machen muss, was ich auch am 

1280
01:04:26,320 --> 01:04:30,000
schwierigsten während eines 
längeren Agent Runs beeinflussen

1281
01:04:30,000 --> 01:04:32,680
kann, weil ich auch da wenn ich 
6 Stunden das Ding laufen lasse 

1282
01:04:32,680 --> 01:04:34,840
während ich schlafe das nicht 
umswitchen kann, aber. 

1283
01:04:34,840 --> 01:04:36,480
Aber all die Sachen, die wir 
gerade gezeigt haben, sind 

1284
01:04:36,480 --> 01:04:39,040
wahrscheinlich lächerlich im 
Vergleich zu einfach ein 

1285
01:04:39,040 --> 01:04:41,120
deutlich günstigeres Modell zu 
verwenden. 

1286
01:04:41,120 --> 01:04:43,720
Und ihr seid wahrscheinlich 
überrascht, wie viele der 

1287
01:04:43,720 --> 01:04:46,400
Aufgaben mindestens genauso gut 
von den günstigeren Modellen 

1288
01:04:46,400 --> 01:04:49,120
erledigt werden können. 
Nicht alles braucht die pro 

1289
01:04:49,120 --> 01:04:54,000
Modelle von Open AI oder das 
allerneueste Opus 47 oder was 

1290
01:04:54,000 --> 01:04:56,000
auch immer gerade die 
aktuellsten und mächtigsten 

1291
01:04:56,000 --> 01:04:58,640
Modelle sind, da kann man schon 
eine ganze Menge Kosten sparen, 

1292
01:04:58,640 --> 01:05:00,720
die man einfach ein kleineres 
Modell verwendet. 

1293
01:05:01,440 --> 01:05:04,360
Und auch von den Modellanbietern
selber gibt es mittlerweile so 

1294
01:05:04,360 --> 01:05:08,200
ein bisschen Handreichung. 
Zum Beispiel gibt es in cloudian

1295
01:05:08,200 --> 01:05:11,360
Modus, wo du die detaillierte 
Implementierungsplanung erst mit

1296
01:05:11,360 --> 01:05:14,080
Opus machst und dann die 
Implementierung selber mit mit 

1297
01:05:14,080 --> 01:05:17,360
Sonet auch das was du sagst, das
Brainstorming über die 

1298
01:05:17,360 --> 01:05:20,160
leichtgewichtigen Modelle ist 
auch etwas, was ich eigentlich 

1299
01:05:20,160 --> 01:05:22,880
immer mit günstigen Modellen 
mache und wenn ich jetzt ein 

1300
01:05:22,880 --> 01:05:27,080
Tool verwende, was halt mehrere 
Modelanbieter unterstützt, ist 

1301
01:05:27,080 --> 01:05:29,920
das tatsächlich auch noch mal 
einen Gedanken wert zu schauen. 

1302
01:05:30,480 --> 01:05:33,200
Was ist eigentlich die 
Preistabelle im Vergleich 

1303
01:05:33,200 --> 01:05:36,320
zwischen Open Ai, Google und 
Anthropic? 

1304
01:05:36,480 --> 01:05:38,000
Und ich habe mich jetzt 
vielleicht daran gewöhnt, 

1305
01:05:38,000 --> 01:05:40,880
irgendwie immer die anthropic 
Modelle zu verwenden, aber wenn 

1306
01:05:40,880 --> 01:05:43,280
ich jetzt in die Preistabelle 
reinschaue und sehe, ich kriege 

1307
01:05:43,280 --> 01:05:47,120
jetzt hier ein GPT 54 Modell 
irgendwie zu einem günstigeren 

1308
01:05:47,120 --> 01:05:49,920
Preis als die. 
Cloud sonet Modelle zum Beispiel

1309
01:05:49,920 --> 01:05:53,520
oder die Google Modelle sind 
noch günstiger als die Opi 

1310
01:05:53,520 --> 01:05:55,200
Modelle. 
Warum nicht einfach mal ein 

1311
01:05:55,200 --> 01:05:57,880
bisschen rumspielen und auch 
wirklich diese Freiheit, die man

1312
01:05:57,880 --> 01:06:01,000
in manchen Tools hat auch zu 
nutzen, auch um die Kosten zu 

1313
01:06:01,000 --> 01:06:02,880
optimieren? 
Es hängt natürlich immer das ein

1314
01:06:02,960 --> 01:06:05,120
bisschen davon ab welches Tool 
ich jetzt verwende, wenn ich 

1315
01:06:05,120 --> 01:06:07,840
jetzt allein Codecs verwende 
habe ich nur die Opi Modelle, 

1316
01:06:07,840 --> 01:06:10,720
bei Cloud habe ich halt nur die 
anthropic Modelle aber in 

1317
01:06:10,720 --> 01:06:13,040
anderen Modellen in anderen 
Tools kann ich da natürlich 

1318
01:06:13,040 --> 01:06:16,160
auch. 
Auswählen und ich glaube, man 

1319
01:06:16,160 --> 01:06:19,200
sollte sich tatsächlich einmal 
zumindest einen groben Überblick

1320
01:06:19,200 --> 01:06:20,600
verschaffen. 
Wir können jetzt nicht alle 

1321
01:06:20,600 --> 01:06:24,560
Preise hier im Podcast nennen, 
aber die verändern sich auch im 

1322
01:06:24,560 --> 01:06:26,600
Laufe der Zeit, aber einfach mal
reinschauen, sich die 

1323
01:06:26,600 --> 01:06:30,160
Preistabelle anzuschauen, um ein
Grundgefühl dafür zu kriegen, 

1324
01:06:30,880 --> 01:06:33,840
welches Modell eigentlich für 
welche Aufgabe geeignet ist und 

1325
01:06:33,840 --> 01:06:36,000
welche Kosten auch damit 
verbunden sind. 

1326
01:06:36,600 --> 01:06:37,560
Um. 
Was man auf jeden Fall auch bei 

1327
01:06:37,560 --> 01:06:39,600
diesem Modell machen kann. 
Mittlerweile sind unterscheiden 

1328
01:06:39,600 --> 01:06:41,840
wir ja fast in dem links 
Modellen nur noch zwischen 

1329
01:06:41,840 --> 01:06:46,120
diesen Thinking Modellen und 
quasi direkt allen gpd Modellen,

1330
01:06:46,120 --> 01:06:48,880
die da sich sofort antworten. 
Man kann häufig diesen Thinking 

1331
01:06:48,880 --> 01:06:53,120
Mode ein oder ausschalten oder 
man kann auch den den bei wenn 

1332
01:06:53,120 --> 01:06:55,240
ich zum Beispiel eine Desktop 
Anwendung bei Cloud unterwegs 

1333
01:06:55,240 --> 01:06:59,200
bin, kann ich natürlich sagen. 
Wie ausschweifend oder was ein 

1334
01:06:59,200 --> 01:07:02,280
Antwortstil eigentlich ist, das 
kann ich auch alles immer 

1335
01:07:02,280 --> 01:07:04,480
aktivieren und deaktivieren. 
Also wenn ich jetzt in task wo 

1336
01:07:04,480 --> 01:07:06,600
ich weiß, du musst jetzt nicht 
lange drüber nachdenken sollst, 

1337
01:07:06,600 --> 01:07:09,120
kannst du sofort loslegen, das 
kann ich ja teilweise auch bei 

1338
01:07:09,120 --> 01:07:10,400
Chat. 
Gpt oder bei der. 

1339
01:07:10,400 --> 01:07:12,000
Cloud, Deskta, Web und sowas 
machen. 

1340
01:07:12,160 --> 01:07:13,520
Dann kann ich mir auch 
überlegen, ob ich diesen 

1341
01:07:13,520 --> 01:07:15,920
Thinking Mode nicht einfach 
deaktiviere für bestimmte 

1342
01:07:15,920 --> 01:07:17,480
Aufgaben. 
Das spart mir auch noch mal 

1343
01:07:17,480 --> 01:07:20,200
ordentlich Tokens ein. 
Ja, und bei manchen Tools. 

1344
01:07:20,200 --> 01:07:22,720
Ich kenne es jetzt selber von 
github co Pilot habe ich auch 

1345
01:07:22,720 --> 01:07:26,080
noch so ein Auto Model Selection
Mode der dann versucht zu 

1346
01:07:26,080 --> 01:07:29,680
erkennen wie komplex meine 
Aufgabe ist und dann auf der 

1347
01:07:29,680 --> 01:07:33,280
Clientseite. 
Das passende Modell aus den 

1348
01:07:33,280 --> 01:07:37,760
verfügbaren Auswählen und auch 
auf der Serverseite kann ich das

1349
01:07:37,840 --> 01:07:40,480
machen. 
Da gibt es ein Angebot von Open 

1350
01:07:40,480 --> 01:07:44,080
Router, die haben diverse AI 
Modelle über eine 

1351
01:07:44,080 --> 01:07:48,560
standardisierte API im Angebot 
und über diesen Auto Routing 

1352
01:07:48,560 --> 01:07:53,440
Modus versuchen sie mein Intent 
zu erkennen, die Komplexität 

1353
01:07:53,440 --> 01:07:56,920
festzustellen und routen dann zu
einem der. 

1354
01:07:57,000 --> 01:08:00,840
Der Komplexität angemessenen 
Modell die unterstützen in 

1355
01:08:00,840 --> 01:08:03,760
diesem Auto Modus aktuell nicht 
die neuesten Modelle. 

1356
01:08:03,760 --> 01:08:07,920
Also ich habe da jetzt nicht das
Opus 447 Modell, sondern 

1357
01:08:07,920 --> 01:08:10,480
vielleicht nur das 406, das 
heißt ich bin da so ein bisschen

1358
01:08:10,480 --> 01:08:13,520
auch etwas älteren Modellen, 
kann dann aber auch auf der 

1359
01:08:13,520 --> 01:08:16,640
Serverseite mich routen lassen, 
sofern ich open Router direkt 

1360
01:08:16,640 --> 01:08:18,880
einbinden kann. 
Das geht natürlich nicht in 

1361
01:08:18,880 --> 01:08:22,479
jedem Coding Tool und ich muss 
natürlich auch bedenken, dass 

1362
01:08:22,479 --> 01:08:25,279
ich bei Open Router dann 
zusätzlich zu den. 

1363
01:08:26,399 --> 01:08:29,439
Model kosten also den Token, 
kosten dann noch so eine kleine 

1364
01:08:29,439 --> 01:08:31,920
Phi on top. 
Habe die Open Router noch nimmt 

1365
01:08:31,920 --> 01:08:35,600
dafür dass ich dann ihren 
Service verwende, aber kann dann

1366
01:08:35,600 --> 01:08:38,640
dementsprechend auch falls mein 
AI Tool vielleicht kein 

1367
01:08:38,640 --> 01:08:41,600
Kleinseitiges Routing 
unterstützt, kann ich dann auf 

1368
01:08:41,600 --> 01:08:45,760
der Server Seite vielleicht auch
das Ganze dort implementieren? 

1369
01:08:45,840 --> 01:08:47,920
Packen wir euch auch noch mal 
den Link in die Show Notes. 

1370
01:08:48,279 --> 01:08:49,840
Das haben wir eigentlich schon 
recht umfassendes Bild, 

1371
01:08:49,840 --> 01:08:51,680
eigentlich gezeichnet von dem, 
was man machen kann. 

1372
01:08:51,680 --> 01:08:54,520
Unter der Haube passiert aber 
oft noch deutlich mehr, das sind

1373
01:08:54,520 --> 01:08:57,000
dann oft Dinge, die die Coding 
Tools und die Agenten selber 

1374
01:08:57,000 --> 01:08:59,600
machen, um die wir uns gar nicht
so sehr kümmern müssen, aber 

1375
01:08:59,600 --> 01:09:01,439
vielleicht der Vollständigkeit 
halber kann man schon noch 

1376
01:09:01,439 --> 01:09:03,439
erwähnen, dass da auch noch viel
passiert. 

1377
01:09:03,439 --> 01:09:06,800
Es gibt sowas wie prompt Cashing
zum Beispiel, da werden dann zum

1378
01:09:06,800 --> 01:09:10,479
Beispiel System Prompts oder 
Tool Definitionen Gecasht manche

1379
01:09:10,479 --> 01:09:13,160
Modelle unterscheiden sogar in 
ihrem Pricing zwischen Input, 

1380
01:09:13,160 --> 01:09:16,640
Tokens, Output Tokens und 
Gecashten Tokens, da müssen wir 

1381
01:09:16,640 --> 01:09:19,680
uns jetzt nicht darum kümmern. 
Über Auto compaction haben wir 

1382
01:09:19,680 --> 01:09:23,000
auch schon gesprochen. 
Oft werden oft versuchen die 

1383
01:09:23,000 --> 01:09:24,960
Anbieter teilweise auch mit sehr
günstigen Tools dann zu 

1384
01:09:24,960 --> 01:09:27,359
erkennen, was sind denn 
vielleicht Chat Nachrichten, die

1385
01:09:27,359 --> 01:09:29,800
wir gar nicht weiterführen 
müssen in der Chat Historie die 

1386
01:09:29,800 --> 01:09:32,640
wir direkt rauskicken können, 
muss ich vielleicht von jedem 

1387
01:09:32,960 --> 01:09:36,160
Tool Run der fehlgeschlagen ist 
überhaupt noch den Output 

1388
01:09:36,319 --> 01:09:39,520
mittreiben, da passiert also 
auch viel auf der Tools und 

1389
01:09:39,520 --> 01:09:42,960
Anbieterseite genauso viel so 
Kontextmanagement und Memory. 

1390
01:09:43,399 --> 01:09:45,200
Also dass man irgendwie sagt, 
Hey, der Agent kann sich auch 

1391
01:09:45,200 --> 01:09:47,439
Dinge einfach regelmäßig 
automatisch merken oder kann 

1392
01:09:47,439 --> 01:09:50,240
erkennen, wenn ich irgendwas in 
jedem dritten prompt extra 

1393
01:09:50,240 --> 01:09:51,479
erwähne. 
Vielleicht schreiben wir das mal

1394
01:09:51,479 --> 01:09:54,720
in die Agents MMD Datei oder ich
habe so einen Rack Mechanismus, 

1395
01:09:54,720 --> 01:09:58,160
wo relevante Dinge und ad hoc 
geladen werden müssen, Model 

1396
01:09:58,160 --> 01:10:02,320
Routing das ja gesagt Auto Modus
von github copil Tool Filter 

1397
01:10:02,400 --> 01:10:04,560
also es passiert auch wahnsinnig
viel. 

1398
01:10:05,120 --> 01:10:07,680
Unter der Haube, wo wir uns gar 
nicht darum kümmern müssen, wo 

1399
01:10:07,680 --> 01:10:09,520
die Hersteller selber daran 
interessiert sind, dass wir 

1400
01:10:09,520 --> 01:10:12,240
Tokens sparen. 
Warum klingt ja erstmal Counter 

1401
01:10:12,240 --> 01:10:14,280
intuitiv, die wollen ja, dass 
wir Geld ausgeben, aber wir 

1402
01:10:14,280 --> 01:10:16,680
sehen, dass wir natürlich 
trotzdem in diese Limits gerade 

1403
01:10:16,680 --> 01:10:18,520
reinlaufen. 
Wir haben einfach ein 

1404
01:10:18,520 --> 01:10:21,800
infrastrukturproblem, Ich glaube
an Shopping ist jetzt auch nicht

1405
01:10:21,840 --> 01:10:24,560
glücklich mit der Situation, 
dass auch wenn man $200 im Monat

1406
01:10:24,560 --> 01:10:26,680
bezahlt, man manchmal in diese 
Limits reinläuft, weil einfach 

1407
01:10:26,680 --> 01:10:29,760
deren Hardware voll ist gerade 
und sie nicht mehr skalieren 

1408
01:10:29,760 --> 01:10:32,440
können und deswegen versuchen 
die Tool Anbieter natürlich. 

1409
01:10:32,440 --> 01:10:35,440
Unter der Haube auch. 
Kosten und Tokens zu sparen, vor

1410
01:10:35,440 --> 01:10:37,680
allem auch, weil sie dann selber
natürlich weniger Aufwendungen 

1411
01:10:37,680 --> 01:10:39,920
auf ihrer Seite haben und 
weniger Infrastruktur 

1412
01:10:40,080 --> 01:10:42,640
bereitstellen müssen, um uns 
vielleicht den gleichen $20 Plan

1413
01:10:42,640 --> 01:10:44,960
anzubieten. 
Von daher ist es eigentlich auch

1414
01:10:44,960 --> 01:10:46,040
ganz spannend, sich diese Seite 
anzugucken. 

1415
01:10:46,040 --> 01:10:49,120
Würde ich jetzt hier in der 
Folge auch, weil wir schon sehr 

1416
01:10:49,120 --> 01:10:50,400
lange drin sind, jetzt ein 
bisschen ausklammern. 

1417
01:10:51,720 --> 01:10:53,600
Weil wie gesagt, das das ist, 
was wir gar nicht unter unserer 

1418
01:10:53,600 --> 01:10:55,600
eigenen Kontrolle haben. 
Aber ich finde es trotzdem 

1419
01:10:55,600 --> 01:10:58,160
wichtig, dass man darauf auch 
mal schaut und sucht. 

1420
01:10:58,160 --> 01:11:00,280
Es kann einfach sein, dass der 
gleiche prompt in einem anderen 

1421
01:11:00,280 --> 01:11:02,880
Tool zum gleichen Ergebnis führt
und dabei weniger Tokens 

1422
01:11:02,880 --> 01:11:05,320
verbraucht, weil das Tool 
vielleicht schon selber eine 

1423
01:11:05,320 --> 01:11:08,640
Optimierung vorgenommen hat. 
Ja, und wir sind ja am Anfang in

1424
01:11:08,640 --> 01:11:13,280
diese Diskussion gestartet, so 
mit der Frage, ist AI Coding 

1425
01:11:13,360 --> 01:11:16,800
mittlerweile unbezahlbar und ich
glaube nachdem. 

1426
01:11:17,160 --> 01:11:20,200
Wir uns jetzt eine Stunde 
darüber unterhalten haben, haben

1427
01:11:20,200 --> 01:11:23,840
wir glaube ich festgestellt. 
Ja, es ist teurer geworden, weil

1428
01:11:23,840 --> 01:11:26,560
die Aufgaben sich verändert 
haben, die Tools, die wir 

1429
01:11:26,560 --> 01:11:29,280
verwenden, haben sich verändert,
wir haben uns bewegt von 

1430
01:11:29,280 --> 01:11:32,640
irgendwie einem Code compleation
Tool zu einem Chat zu agents, 

1431
01:11:32,640 --> 01:11:36,080
die autonom im Hintergrund über 
einen sehr langen Zeitraum 

1432
01:11:36,240 --> 01:11:38,880
laufen, wir haben teilweise KI 
Modelle, die. 

1433
01:11:39,320 --> 01:11:43,360
Die Dinge können die wir uns 
doch vor ein 2 Jahren haben, 

1434
01:11:43,360 --> 01:11:46,400
nicht ausmalen können. 
Und natürlich müssen solche 

1435
01:11:46,400 --> 01:11:48,000
Dinge bezahlt werden. 
Wir haben über die 

1436
01:11:48,000 --> 01:11:51,160
Rechenzentrumsinvestitionen 
gesprochen und dementsprechend 

1437
01:11:51,160 --> 01:11:53,760
wird es teuer, aber wir sind 
nicht machtlos, das heißt, wir 

1438
01:11:53,760 --> 01:11:58,040
können selber als Developer auch
etwas tun, damit die Kosten 

1439
01:11:58,040 --> 01:11:59,760
nicht aus dem Ruder laufen und 
wir. 

1440
01:12:00,760 --> 01:12:03,520
Am besten auch ein gewisses 
Gefühl dafür entwickeln. 

1441
01:12:03,680 --> 01:12:07,440
Was kostet eigentlich das diese 
Aufgabe an den Agenten zu 

1442
01:12:07,440 --> 01:12:10,480
übergeben und was sind 
vielleicht Aufgaben, die man auf

1443
01:12:10,480 --> 01:12:13,280
einfachere Art und Weise lösen 
kann oder vielleicht am Ende 

1444
01:12:13,280 --> 01:12:16,480
auch selber erledigt? 
Habt ihr noch coole Tools oder 

1445
01:12:16,480 --> 01:12:19,640
Tricks oder promp Praktiken im 
Angebot, wie Ihr vielleicht 

1446
01:12:19,640 --> 01:12:21,120
Tokens spart? 
Dann lasst uns das doch einfach 

1447
01:12:21,120 --> 01:12:23,920
gerne in den Kommentaren wissen.
Wenn da jetzt noch irgendwie ein

1448
01:12:23,920 --> 01:12:26,400
mega cooler Tipp oder irgendwas 
auftaucht oder ein Tool, was wir

1449
01:12:26,400 --> 01:12:28,880
hier gar nicht beleuchtet haben.
Dann können wir das gerne in der

1450
01:12:28,880 --> 01:12:32,000
nächsten Folge mit der ganzen 
Community teilen und sonst lasst

1451
01:12:32,000 --> 01:12:35,600
uns auch gerne mal entweder über
einen Kommentar oder über eine e

1452
01:12:35,600 --> 01:12:37,520
Mail wissen. 
Findet auch in meiner E Mail 

1453
01:12:37,520 --> 01:12:39,280
Adresse in der Beschreibung, 
wenn ihr das nicht öffentlich 

1454
01:12:39,280 --> 01:12:41,880
teilen wollt, wie ihr gerade 
damit umgeht, bei euch im 

1455
01:12:41,880 --> 01:12:46,320
Unternehmen mit immer häufiger 
mit dem immer häufigeren 

1456
01:12:46,320 --> 01:12:49,400
Anstoßen an diese Limits, seien 
es Token Limits oder seien es 

1457
01:12:49,400 --> 01:12:51,040
Usage Limits, da muss man ja 
eigentlich auch noch mal 

1458
01:12:51,040 --> 01:12:54,240
zwischen unterscheiden und 
welches Coding Tool bei euch? 

1459
01:12:54,920 --> 01:12:57,560
Gerade die meisten Tokens 
verbrennt das finde ich immer 

1460
01:12:57,560 --> 01:12:58,640
spannend. 
Wenn wir das so ein bisschen in 

1461
01:12:58,640 --> 01:13:00,160
der Community diskutieren 
können. 

1462
01:13:00,480 --> 01:13:03,200
Und da wir heute ja 
offensichtlich ganz klar das 

1463
01:13:03,200 --> 01:13:07,600
Output Limit dieses Podcast 
Format gesprengt haben, lasst 

1464
01:13:07,600 --> 01:13:09,560
uns auch gerne wissen, was ihr 
dazu sagt. 

1465
01:13:09,560 --> 01:13:11,600
Also darf es auch mal ein 
bisschen länger sein. 

1466
01:13:11,600 --> 01:13:14,480
Ich glaube, wir hatten heute 
viel zu erzählen, ich hoffe es 

1467
01:13:14,480 --> 01:13:19,040
war für euch sehr nützlich und 
nicht zu lang, schreibt uns dazu

1468
01:13:19,040 --> 01:13:22,720
gerne auf Spotify oder einfach 
eine E Mail, die Kontaktdaten 

1469
01:13:22,720 --> 01:13:25,280
findet ihr in den Shownotes. 
Ansonsten freuen wir uns 

1470
01:13:25,280 --> 01:13:27,120
natürlich auch, wenn euch die 
Folge gefallen hat, wenn ihr 

1471
01:13:27,120 --> 01:13:29,440
eure Sternchen Däumchen, was 
auch immer dalasst oder wenn ihr

1472
01:13:29,440 --> 01:13:32,240
uns einen Kaffee ausgebt, findet
ihr auch die Links unten. 

1473
01:13:32,480 --> 01:13:35,000
Am meisten freuen wir uns aber, 
wenn ihr nächste Woche wieder 

1474
01:13:35,000 --> 01:13:37,800
mit dabei seid, der To do Cast 
erscheint jede Woche, jeden 

1475
01:13:37,800 --> 01:13:40,480
Montag, immer abwechselnd in 
einer Themenfolge wie dieser 

1476
01:13:40,480 --> 01:13:42,880
hier oder in einer News Folge, 
wo wir die Tec und Developer 

1477
01:13:42,880 --> 01:13:45,440
News der vergangenen 2 Wochen 
zusammenfassen. 

1478
01:13:45,680 --> 01:13:48,280
Abonniert also, wenn ihr es noch
nicht getan habt und hört auch 

1479
01:13:48,280 --> 01:13:50,240
beim nächsten Mal wieder rein 
wir sind am Montag wieder am 

1480
01:13:50,240 --> 01:13:50,640
Start.
