Techsy
Kontakt
Rozpocznij
Powrót do bloga
ai-machine-learning

Wymagania VRAM dla LLM: Tabela mistrzowska 2026 (Każdy model, każda kwantyzacja)

Napisane przez Mert Batur Gürbüz
Zaktualizowano Jul 17, 2026
11 min
Spis treści
Wymagania VRAM dla LLM: Tabela mistrzowska 2026 (Każdy model, każda kwantyzacja)

Wymagania VRAM dla LLM: Tabela mistrzowska 2026 (Każdy model, każda kwantyzacja)

Oto liczba, która zawsze zaskakuje: DeepSeek-V3.2 ma 671 miliardów parametrów, ale przy każdym tokenie aktywnych jest tylko 37 miliardów. Ile pamięci VRAM więc naprawdę potrzebuje? Wszystkich 671 miliardów, co przy kwantyzacji Q4 daje około 382 GB. Wymagania VRAM dla LLM rzadko idą w parze z intuicją, a przepaść między „aktywnymi parametrami” a tym, co musisz załadować do pamięci, to właśnie miejsce, gdzie budżety na sprzęt wybuchają. Ten przewodnik dostarcza Ci tabelę mistrzowską (każdy główny model open-source, każdy poziom kwantyzacji, wartość w GB oraz GPU, który to obsłuży) plus wzór, dzięki któremu obliczysz zapotrzebowanie dla dowolnego modelu w około dziesięć sekund.

Kluczowe wnioski

  • VRAM na wagi ≈ parametry × bajty-na-parametr: FP16 = 2,0, Q8 = 1,0, Q5_K_M ≈ 0,68, Q4_K_M ≈ 0,57. Do tego dodaj cache KV i około 15-20% narzutu.
  • Modele Mixture-of-Experts (DeepSeek, GLM-5.2, Qwen3-235B) muszą załadować każdego eksperta do VRAM. „Aktywne parametry” dają prędkość, nie oszczędność pamięci.
  • Cache KV to ukryty koszt. Llama 3.3 70B potrzebuje około 2,6 GB cache przy kontekście 8K i roughly 41 GB przy 128K, dodatkowo do wag.
  • Q4_K_M to rozsądny domyślny wybór: jakość bliska pełnej przy około ćwierci footprintu FP16.
  • Model 12B, taki jak Gemma 4, zmieści się na karcie 8 GB przy Q4. Gęsty model 70B potrzebuje około 40 GB. Czołowy model MoE 671B wymaga małego serwera.

Wymagania VRAM dla LLM według modelu: Tabela mistrzowska

Krótka odpowiedź: przy Q4_K_M małe modele (poniżej 14B) mieszczą się na konsumenckich kartach 8-12 GB, modele średniej wielkości (24-32B) chcą 16-24 GB, gęsty model 70B potrzebuje około 40 GB, a czołowe modele MoE skaczą w setki gigabajtów, ponieważ każdy ekspert musi być rezydentny w pamięci. Oto pełny obraz w jednym miejscu. Wszystkie wartości dotyczą samej pamięci na wagi, obliczone na podstawie liczby parametrów każdego modelu i zweryfikowane z oficjalnymi kartami modeli od Meta AI, Qwen oraz Hugging Face.

ModelParametry (łącznie / aktywne)FP16Q8Q5_K_MQ4_K_MMin. GPU przy Q4
Qwen3-0.6B0.6B gęsty1.2 GB0.6 GB0.4 GB0.4 GBDowolna karta 2 GB / telefon
Qwen3-4B4B gęsty8 GB4 GB2.7 GB2.3 GB4 GB (GTX 1650)
Qwen3-8B8B gęsty16 GB8 GB5.4 GB4.6 GB6-8 GB (RTX 3060)
Gemma 4 12B11.95B gęsty24 GB12 GB8.1 GB6.8 GB8 GB (RTX 4060)
Qwen3-14B14B gęsty28 GB14 GB9.5 GB8.0 GB12 GB (RTX 3060 12GB)
Mistral Small 3.2 24B24B gęsty48 GB24 GB16.3 GB13.7 GB16 GB (RTX 4080)
Qwen3-30B-A3B30B / 3B MoE60 GB30 GB20.4 GB17.1 GB24 GB (RTX 3090/4090)
Qwen3-32B32B gęsty64 GB32 GB21.8 GB18.2 GB24 GB (RTX 4090)
Llama 3.3 70B70B gęsty140 GB70 GB47.6 GB39.9 GB48 GB (2x 3090 / A6000)
Llama 4 Scout109B / 17B MoE218 GB109 GB74.1 GB62.1 GB80 GB (H100 / A100)
Qwen3-235B-A22B235B / 22B MoE470 GB235 GB160 GB134 GB2x 80 GB lub Mac 192 GB
Llama 4 Maverick400B / 17B MoE800 GB400 GB272 GB228 GB4x 80 GB
DeepSeek-V3.2671B / 37B MoE1342 GB671 GB456 GB382 GBWęzeł 8x 80 GB
GLM-5.2744B / 40B MoE1488 GB744 GB506 GB424 GB8x 80 GB+ / multi-węzeł

Dwie rzeczy wynikające z tej tabeli. Po pierwsze, kwantyzacja to największy dźwignia, jaką masz: przejście z FP16 do Q4 redukuje footprint około 4-krotnie przy ledwo zauważalnym spadku jakości. Po drugie, wiersze MoE wyglądają brutalnie, bo takie są. Qwen3-30B-A3B aktywuje tylko 3 miliardy parametrów na token, więc działa z prędkością maleńkiego modelu, ale nadal musisz trzymać wszystkie 30 miliardów w pamięci, aby mieć gotowych każdego eksperta. Chcesz szczegółów model po modelu stojących za tymi liczbami? Nasz dogłębny artykuł o Gemma 4 12B oraz podsumowanie najlepszych open-source'owych LLM w 2026 roku omawiają benchmarki i licencje.

"VRAM for the weights at Q4_K_M (GB)"

Tabela danych
"VRAM for the weights at Q4_K_M (GB)"
"VRAM (GB)""Q4_K_M VRAM"
"Qwen3-8B"4.6
"Gemma 4 12B"6.8
"Mistral 24B"13.7
"Qwen3-32B"18.2
"Llama 3.3 70B"39.9
"Llama 4 Scout 109B"62.1
"Qwen3-235B"134
"DeepSeek-V3.2 671B"382

Wzór na VRAM: Oblicz sam dla dowolnego modelu

Aby oszacować zapotrzebowanie dowolnego modelu, pomnóż liczbę jego parametrów przez liczbę bajtów na parametr dla wybranej kwantyzacji, a następnie dodaj trochę na cache KV i narzut runtime’owy. To wszystko. Wagi to dominujący składnik, a arytmetyka jest na tyle prosta, że można ją zrobić na odwrocie serwetki.

Podstawowe równanie dla wag:

text
VRAM_weights (GB) = parameters (billions) × bits_per_weight ÷ 8

Wartości bitów na wagę, których potrzebujesz (są to efektywne rates dla plików GGUF k-quant, które niosą ze sobą nieco metadanych bloków ponad nominalną głębią bitową):

KwantyzacjaBity na wagęBajty na parametrJakość
FP16 / BF16162.0Pełna precyzja, punkt odniesienia
Q8_081.0Praktycznie bezstratna
Q6_K~6.50.81Bliska pełnej, rzadko warta zachodu wobec Q5
Q5_K_M~5.50.68Nieco lepsza niż Q4, ciut cięższa
Q4_K_M~4.50.57Złoty środek dla większości osób

Przykład dla Gemma 4 12B przy Q4_K_M: 11,95 × 4,5 ÷ 8 = około 6,7 GB na wagi. To zgadza się z roughly 6,6 GB podanymi w oficjalnej karcie modelu i wyjaśnia, dlaczego mieści się on na karcie 8 GB z zapasem na umiarkowany kontekst. Wykonaj te same obliczenia dla modelu 70B przy Q4, a otrzymasz 70 × 4,5 ÷ 8 = 39,4 GB, co wyjaśnia, dlaczego „potrzebujesz dwóch kart 24 GB lub jednej 48 GB dla modelu 70B” to zasada powtarzana przez wszystkich.

Pełny obraz dodaje dwa kolejne składniki: całkowite VRAM ≈ wagi + cache KV + ~15-20% narzutu. Narzut pokrywa bufory aktywacji, kontekst CUDA i fragmentację pamięci, a Twój GPU rezerwuje też około pół gigabajta dla sterownika, więc nigdy nie planuj wykorzystania 100% deklarowanej pamięci VRAM.

Dlaczego cache KV to liczba, która Cię ugryzie

Cache KV przechowuje klucze i wartości attention dla każdego tokena już znajdującego się w kontekście i rośnie liniowo wraz z długością kontekstu. Przy krótkich promptach to błąd zaokrąglenia. Przy długim kontekście może rywalizować z wagami lub nawet je przewyższyć. To najczęstszy powód, dla którego model, który „powinien się zmieścić”, wyrzuca błąd out-of-memory w trakcie generowania.

Wzór, na token:

text
KV_cache_per_token (bytes) = num_layers × 2 × kv_dim × precision_bytes
kv_dim = num_kv_heads × head_dim   (grouped-query attention shrinks this)

Weźmy Llama 3.3 70B: 80 warstw, 8 głow KV, wymiar głowy 128, więc kv_dim wynosi 1024. Przy FP16 daje to 80 × 2 × 1024 × 2 = 327 680 bajtów na token, czyli około 0,31 MB. Pomnóż przez długość kontekstu, a historia pisze się sama: przy 8K tokenów cache ma około 2,6 GB, przy 32K około 10 GB, a przy 128K puchnie do około 41 GB. Ta ostatnia wartość jest dodatkowo do 40 GB wag, więc „model 40 GB” cicho staje się problemem 80 GB w momencie wypełnienia okna kontekstowego.

Dwa praktyczne wyjścia. Grouped-query attention (którego używa każdy najnowszy model) już teraz drastycznie redukuje kv_dim w porównaniu do starego designu multi-head, więc nowoczesne modele są pod tym względem znacznie łagodniejsze niż Llama 2. Ponadto większość silników inferencji potrafi kwantyzować cache KV do 8-bitów lub 4-bitów, redukując jego rozmiar o połowę lub ćwierć kosztem niewielkiej utraty jakości. Jeśli obsługujesz długie konteksty w produkcji, porównanie vLLM vs SGLang pokazuje, który backend zarządza tą pamięcią najefektywniej dzięki paged attention.

Modele MoE: Dlaczego „Aktywne Parametry” Nie Oszczędzają VRAM

To pułapka, która kosztuje ludzi najwięcej pieniędzy. Model Mixture-of-Experts, taki jak DeepSeek-V3.2 (671B łącznie, 37B aktywnych, dzielący architekturę V3) lub GLM-5.2 (744B łącznie, 40B aktywnych), kieruje każdy token przez mały podzbiór swoich ekspertów. Marketing opiera się na liczbie aktywnej, bo opisuje ona prędkość: płacisz tylko za obliczenia równe 37 miliardom parametrów na token, więc wnioskowanie jest szybkie jak na rozmiar modelu. Ale każdy ekspert musi siedzieć w pamięci, gotowy do wyboru, co oznacza, że Twój budżet VRAM jest określony przez całkowitą liczbę parametrów, a nie aktywną.

Tak więc uczciwa interpretacja powyższej tabeli: GLM-5.2 działa z prędkością modelu 40B, ale zajmuje pamięć modelu 744B. Dlatego te czołowe modele open-source potrzebują serwera z 8 GPU lub dużej maszyny z jednolitą pamięcią, mimo że pojedyncze przejście forward jest tanie. Qwen3-235B-A22B ma tę samą strukturę w mniejszej skali – szybki na token, ciężki do hostowania.

Zaleta MoE pojawia się na sprzęcie z jednolitą pamięcią. Mac Studio z 512 GB jednolitej pamięci może pomieścić model 671B przy Q4 i nadal uruchamiać go z użyteczną prędkością, właśnie dlatego, że aktywuje się tylko 37B, więc zapotrzebowanie na przepustowość pamięci na token pozostaje rozsądne. Jeśli dopiero zaczynasz uruchamiać je lokalnie, zacznij od naszego przewodnika po konfiguracji lokalnych LLM, zanim wydasz pieniądze na sprzęt.

Jaką Kwantyzację Powinieneś Wybrać?

Dla prawie wszystkich Q4_K_M to właściwy domyślny wybór: utrzymuje jakość bliską pełnej, tnąc footprint FP16 około 4-krotnie. Przejdź na Q5_K_M lub Q8 tylko, jeśli masz zapas VRAM i zadanie wrażliwe na jakość, a sięgnij po FP16 tylko, gdy fine-tunujesz lub benchmarkujesz względem punktu odniesienia. Poniżej Q4 degradacja jakości staje się szybko zauważalna, więc Q3 i niżej to ostateczność, by wcisnąć model na kartę, która jest genuinnie za mała.

Jeśli maszWybierzDlaczego
Napięty budżet VRAMQ4_K_MNajlepsza jakość na gigabajt, standard społeczności
Trochę luzuQ5_K_MNieco ostrzejszy przy trudnych promptach, ciut cięższy
2x wagi w VRAMQ8_0Praktycznie bezstratny, wart zachodu tylko, jeśli łatwo się mieści
Zadanie fine-tuningowe lub ewaluacyjneFP16 / BF16Pełna precyzja, uczciwy punkt odniesienia

Jedno zastrzeżenie: jakość kwantyzacji nie jest identyczna across models. Bardzo małe modele (poniżej 4B) bardziej odczuwają Q4 niż duże, ponieważ mają mniej redundancji do stracenia. W modelu 70B różnica między Q4 a Q8 jest trudna do wychwycenia w większości zadań. W modelu 1.7B luka jest realna.

Jakiego GPU Naprawdę Potrzebujesz?

Dopasuj kolumnę Q4 z tabeli mistrzowskiej do karty z niewielkim zapasem na cache KV. Oto praktyczne mapowanie od budżetowego sprzętu konsumenckiego po data center, z tierem modeli, który każda klasa komfortowo obsługuje przy Q4.

SprzętVRAMKomfortowo uruchamia przy Q4
RTX 4060 / 3060 (8-12 GB)8-12 GBDo ~14B gęste (Gemma 4 12B, Qwen3-14B)
RTX 4080 / 4070 Ti Super (16 GB)16 GBDo ~24B gęste (Mistral Small 3.2 24B)
RTX 4090 / 3090 (24 GB)24 GBDo ~32B gęste, lub Qwen3-30B-A3B
RTX 6000 Ada / A6000 (48 GB)48 GB70B gęste (Llama 3.3 70B)
H100 / A100 (80 GB)80 GB~109B MoE (Llama 4 Scout)
Węzeł 8x H100640 GB671-744B czołowe MoE (DeepSeek, GLM-5.2)
Mac Studio seria M (unified)64-512 GBSkaluje się z RAM; 512 GB pomieści MoE 671B przy Q4

Apple Silicon zasługuje na specjalne wspomnienie, ponieważ jednolita pamięć zmienia rachubę. Mac nie dzieli VRAM od RAM systemowego, więc maszyna M-series ze 128 GB może załadować modele, które wymagałyby wielu dyskretnych GPU, zamieniając szczytową przepustowość na możliwość zmieszczenia ogromnych wag na jednym desktopie. Dla backendów, które wyciskają najwięcej z którejkolwiek z tych kart, nasze podsumowanie najlepszych narzędzi do uruchamiania LLM lokalnie benchmarkuje rzeczywiste różnice w prędkości.

Jak My Szacujemy VRAM dla Wdrożeń Klientów

W Techsy wdrażamy modele open-source dla klientów wystarczająco często, że szacowanie VRAM to pierwsza rozmowa, przed wyborem modelu, przed promptami, przed czymkolwiek. Nasza metoda jest nudna celowo, ponieważ tryb awarii (OOM w produkcji pod realnym obciążeniem kontekstem) jest drogi. Oto proces, który faktycznie stosujemy.

Zaczynamy od matematyki z tabeli, a potem mierzymy. Po załadowaniu modelu sprawdzamy rzeczywisty footprint rezydentny, zamiast ufać estymacie:

bash
# What the GPU is actually holding
nvidia-smi --query-gpu=memory.used,memory.total --format=csv

# For an Ollama-served model, its real memory + how much sits on GPU vs CPU
ollama ps

# llama.cpp: control the split explicitly and cap context to bound KV cache
llama-server -m model-Q4_K_M.gguf --n-gpu-layers 999 --ctx-size 8192

Lekcja, która ciągle się powtarza: zespoły szacują tylko wagi i zapominają o cache KV, a potem dziwią się, dlaczego model, który załadował się poprawnie, pada po trzech długich requestach podczas demo. Szacujemy wagi plus cache KV przy maksymalnym kontekście, jakiego aplikacja będzie naprawdę używać, plus zapas, i limitujemy --ctx-size, aby zbuntowany request nie wyłożył maszyny OOM-em. Dla wszystkiego zwróconego do klienta wolimy uruchomić skwantyzowany model 32B, który nigdy nie padnie, niż FP16 70B, który dostanie OOM pod obciążeniem.

Jeśli ważysz, czy hostować model open-source samodzielnie, czy zostać przy hostowanym API, ta wymiana (koszt sprzętu i obciążenie ops versus cena za token i kontrola) to dokładnie to, co nasz zespół scope’uje podczas engagementu integracji AI. Jeśli pomogłoby Ci, gdyby ktoś przeliczył liczby pod Twoje rzeczywiste obciążenie, umów bezpłatną konsultację, a my wspólnie to oszacujemy.

O Autorze

Mert Batur Gurbuz jest Współzałożycielem Techsy.io, gdzie zespół dostarcza agentów AI, systemy automatyzacji oraz pipeline’y voice/SDR dla klientów B2B. Studiuje na University of Birmingham i pisze o stacku narzędziowym LLM, z którego zespół Techsy faktycznie korzysta w produkcji.

Kredyty: Współzałożyciel, Techsy.io, University of Birmingham. Połącz się na LinkedIn.

Często Zadawane Pytania

Ile VRAM potrzebuję, aby uruchomić model 70B?

Gęsty model 70B, taki jak Llama 3.3 70B, potrzebuje około 40 GB VRAM na wagi przy Q4_K_M, więc planuj kartę 48 GB (RTX 6000 Ada) lub dwie karty 24 GB. Dodaj kilka dodatkowych gigabajtów na cache KV, jeśli używasz długiego kontekstu, co przesuwa praktyczne wymagania w stronę 48 GB lub więcej.

Ile VRAM potrzebują Llama, Qwen lub DeepSeek?

To zależy całkowicie od wariantu. Llama 4 Scout potrzebuje około 62 GB przy Q4, Qwen3-32B około 18 GB, a Qwen3-8B poniżej 5 GB. DeepSeek-V3.2, MoE 671B, potrzebuje roughly 382 GB, ponieważ każdy ekspert musi zostać załadowany. Zawsze sprawdzaj całkowitą liczbę parametrów, a nie aktywną, w przypadku modeli MoE.

Czy mogę uruchomić LLM na GPU 8GB?

Tak, komfortowo. Karta 8 GB, taka jak RTX 4060, obsłuży modele do około 12 miliardów parametrów przy Q4_K_M. Gemma 4 12B mieści się w roughly 6,8 GB, zostawiając miejsce na umiarkowany kontekst. Dla czegoś większego musisz albo kwantyzować mocniej, utrzymywać krótki kontekst, lub przejść na większą kartę.

Co obsłuży GPU 24GB, takie jak RTX 4090?

Karta 24 GB radzi sobie z gęstymi modelami do około 32B przy Q4_K_M z zapasem na rozsądny kontekst, więc Qwen3-32B i Mistral Small 3.2 24B są komfortowe. Uruchamia również MoE Qwen3-30B-A3B, który ładuje 30B wag, ale generuje z prędkością modelu 3B dzięki rzadkiej aktywacji.

Czy kwantyzacja psuje jakość modelu?

Przy Q4_K_M i wyżej, utrata jakości jest mała i często niezauważalna w realnych zadaniach, szczególnie dla modeli powyżej 13B. Luka rośnie, gdy schodzisz niżej i gdy modele są mniejsze, więc Q4 na modelu 70B jest niemal darmowe, podczas gdy Q4 na modelu 1.7B jest zauważalne. Q8 jest praktycznie bezstratny, jeśli masz pamięć.

Czy modele MoE potrzebują mniej VRAM niż modele gęste?

Nie, i to najczęstsze nieporozumienie. Model Mixture-of-Experts musi trzymać każdego eksperta w VRAM, więc jego pamięć jest określona przez całkowitą liczbę parametrów. Liczba aktywnych parametrów opisuje tylko prędkość inferencji. GLM-5.2 działa z prędkością modelu 40B, ale potrzebuje pamięci modelu 744B.

Czy jednolita pamięć to to samo co VRAM?

Funkcjonalnie, dla ładowania modeli, tak. Apple Silicon i niektóre inne systemy dzielą jedną pulę pamięci między CPU i GPU, więc Mac ze 128 GB może załadować modele, które w innym wypadku wymagałyby wielu dyskretnych GPU. Kompromisem jest przepustowość: jednolita pamięć zazwyczaj dostarcza niższą szczytową przepustowość niż wysokiej klasy GPU z data center, więc tokens-per-second jest niższe.

Czy mogę offloadować część modelu do RAM systemowego lub CPU?

Tak. Silniki takie jak llama.cpp i Ollama pozwalają trzymać niektóre warstwy na GPU, a resztę w RAM systemowym za pomocą flagi takiej jak --n-gpu-layers. Pozwala to uruchomić model zbyt duży dla Twojego VRAM, ale każda warstwa na CPU drastycznie spowalnia generowanie, więc używaj tego, aby uczynić model możliwym do uruchomienia, a nie szybkim.

Jak obliczyć VRAM dla modelu, którego nie ma w tabeli?

Pomnóż liczbę parametrów w miliardach przez bity-na-wagę dla swojej kwantyzacji, a następnie podziel przez 8. Dla Q4_K_M użyj około 4.5 bita, więc model 40B potrzebuje 40 × 4.5 ÷ 8 = około 22.5 GB na wagi. Dodaj roughly 15-20% narzutu plus Twój cache KV dla rzeczywistego zapotrzebowania.

Tagi

wymagania vram llmpamięć gpukwantyzacjacache kvlokalny llm

Udostępnij artykuł

Powiązane artykuły

Więcej w ai-machine-learning

ai-machine-learning
Jul 24, 2026

Claude Opus 5 już jest: inteligencja bliska Fable 5 za połowę ceny

Anthropic wydał Claude Opus 5 24 lipca 2026. Model ponad dwukrotnie przebija Opus 4.8 w Frontier-Bench i utrzymuje cenę Opus, ale przegrywa kilka testów z Fable 5 i Mythos 5. Oto tabela benchmarków, ceny i rekomendacja: przejść, poczekać czy zostać.

10 min read min
Czytaj
ai-machine-learning
Jul 20, 2026

8 najlepszych API do scrapingu AI w 2026 (przetestowane na naszym stacku agentów)

Przetestowaliśmy 8 API do scrapingu AI z realnymi cenami z 2026 roku, pobranymi przez nasz własny stack agentów. Firecrawl, Bright Data, ScrapingBee i 5 innych — ranking pod kątem wyjścia gotowego dla LLM, omijania antybotów i obsługi MCP.

9 min read min
Czytaj
ai-machine-learning
Jul 20, 2026

Inżynieria promptów dla programistów: 7 wzorców, których używamy codziennie w Claude Code i Cursor (2026)

Większość artykułów o „promptach do kodowania z AI” serwuje 50 szablonów do skopiowania. Ten uczy 7 wzorców, których używamy każdego dnia do obsługi potoku 16 agentów Claude Code, z rzeczywistymi przykładami „przed i po” oraz informacją, gdzie każdy wzorzec stosować w Claude Code, Cursor i Copilot w 2026 roku.

11 min read min
Czytaj
Zobacz wszystkie artykuły
Rozpocznij swój projekt

Gotowi, by zbudować coś co Cię wyróżnia?

Zamieńmy Twoją wizję w rzeczywistość. Nasz zespół jest gotowy, by pomóc Ci stworzyć oprogramowanie, które robi różnicę.

Umów 30-minutowe spotkanie wstępneZobacz nasze realizacje

Z naszej biblioteki

Umiejętności Claude

Zobacz wszystkie
  • New Post

    Full SEO blog pipeline: research, brief, write, validate, image, translate, publish to Sanity. Autonomous from start to finish.

  • Content Refresh

    Audit a stale post, find decay drivers, and ship a SERP-aligned refresh without losing existing rankings.

  • SEO Audit

    Site-wide SEO audit with prioritized fix list: technical, on-page, and EEAT signals.

Automatyzacje AI

Zobacz wszystkie
  • Security Auditor

    Weekly SCA + IaC scan with prioritized fix PRs.

  • Cold Email Writer

    Generates first-touch emails grounded in one specific public detail.

  • Lead Research Agent

    Enrich an email into a profile, score fit, alert in Slack.

Z naszej biblioteki

Umiejętności Claude

Zobacz wszystkie
  • New Post

    Full SEO blog pipeline: research, brief, write, validate, image, translate, publish to Sanity. Autonomous from start to finish.

  • Content Refresh

    Audit a stale post, find decay drivers, and ship a SERP-aligned refresh without losing existing rankings.

  • SEO Audit

    Site-wide SEO audit with prioritized fix list: technical, on-page, and EEAT signals.

Automatyzacje AI

Zobacz wszystkie
  • Security Auditor

    Weekly SCA + IaC scan with prioritized fix PRs.

  • Cold Email Writer

    Generates first-touch emails grounded in one specific public detail.

  • Lead Research Agent

    Enrich an email into a profile, score fit, alert in Slack.

Usługi

  • Rozwiązania Enterprise
  • Aplikacje mobilne
  • Aplikacje webowe

Rozwiązania

  • Systemy CRM
  • Integracja AI
  • Rozwiązania ERP
  • Agenci głosowi
  • Automatyzacja procesów
  • Cyberbezpieczeństwo

Biblioteka

  • Blog
  • Portfel realizacji

Społeczność

  • Automatyzacje AI
  • Umiejętności Claude

Narzędzia

  • Kalkulator kosztów aplikacji mobilnej
  • Kalkulator kosztów API OpenAI / LLM
  • Kalkulator kosztów MVP
  • Kalkulator kosztów agenta Voice AI

Firma

  • O nas
  • Partnerzy
  • Kontakt

Prawne

  • Polityka prywatności
  • Regulamin
  • Polityka cookies

Usługi

  • Rozwiązania Enterprise
  • Aplikacje mobilne
  • Aplikacje webowe

Rozwiązania

  • Systemy CRM
  • Integracja AI
  • Rozwiązania ERP
  • Agenci głosowi
  • Automatyzacja procesów
  • Cyberbezpieczeństwo

Biblioteka

  • Blog
  • Portfel realizacji

Społeczność

  • Automatyzacje AI
  • Umiejętności Claude

Narzędzia

  • Kalkulator kosztów aplikacji mobilnej
  • Kalkulator kosztów API OpenAI / LLM
  • Kalkulator kosztów MVP
  • Kalkulator kosztów agenta Voice AI

Firma

  • O nas
  • Partnerzy
  • Kontakt
PrawnePolityka prywatnościRegulaminPolityka cookies
TECHSY
© 2026 Techsy. Wszystkie prawa zastrzeżone.