Specjalnie dla rządu i ministry zdrowia Claude wydłużył dostępność modelu Fable 5, aby przy jego pomocy stworzyć jeszcze lepszy plan naprawczy ochrony zdrowia w PL. @donaldtusk do dzieła!
1/5 Korzystając z @ollama mamy możliwość ustawienia kilku parametrów. Dwa z nich mocno wpływają na wydajność (szczególnie gdy mamy ograniczenia sprzętowe - u mnie to 64GB) zapraszam na wątek👇
5/5 Znaczenie ma oczywiście też wielkość modelu. W moim przypadku dwa modele 32b zajmują 44GB, co jest już przy granicy. Na oko wychodzi, że "się zmieści" i faktycznie - mieści się. Ustawiłem wartość na 1, dlatego że drugi model (llava:34b) jest uruchamiany sporadzycznie.
To mój pierwszy wpis na ten temat. Od ponad 17 lat zajmuję się programowaniem. Jeżeli interesują Cię takie treści, to zaobserwuj mój profil. Niedługo dodam kolejne moje doświadczenia :)
Jak zmniejszyłem czas generowania treści AI z ~35s do ~8s! (4,5x szybciej) - w całości lokalnie, na własnym Macu, bez $$$ za API.
Wątek o tym, jak dobierałem model do polskich treści i na czym się przejechałem 🧵
4 lekcje:
1. Sprawdzaj na SWOICH danych i w swoim języku
2. Patrz na p90, nie tylko na medianę
3. „Structured output" zweryfikuj sam
4. Upewnij się, że MLX jest włączony (na macu launchctl setenv OLLAMA_USE_MLX 1)