Techsy
Kontak
Mulai Sekarang
Kembali ke Blog
ai-machine-learning

Kebutuhan VRAM LLM: Tabel Utama 2026 (Setiap Model, Setiap Kuantisasi)

Ditulis oleh Mert Batur Gürbüz
Diperbarui Jul 17, 2026
11 baca
Daftar Isi
Kebutuhan VRAM LLM: Tabel Utama 2026 (Setiap Model, Setiap Kuantisasi)

Kebutuhan VRAM LLM: Tabel Utama 2026 (Setiap Model, Setiap Kuantisasi)

Inilah angka yang sering mengejutkan semua orang: DeepSeek-V3.2 memiliki 671 miliar parameter, tetapi hanya 37 miliar yang aktif pada token tertentu. Jadi, berapa banyak VRAM yang sebenarnya dibutuhkannya? Semua 671 miliar nilai tersebut, sekitar 382 GB pada kuantisasi Q4. Kebutuhan VRAM LLM jarang mengikuti intuisi, dan kesenjangan antara "parameter aktif" dan "apa yang harus Anda muat" adalah tepat di mana anggaran perangkat keras membengkak. Panduan ini memberikan Anda tabel utama (setiap model open-source besar, setiap tingkat kuantisasi, angka GB, dan GPU yang menjalankannya) serta rumus untuk menghitung ukuran model sendiri dalam sekitar sepuluh detik.

Poin-Poin Penting

  • VRAM untuk bobot ≈ parameter × byte-per-param: FP16 = 2,0, Q8 = 1,0, Q5_K_M ≈ 0,68, Q4_K_M ≈ 0,57. Tambahkan cache KV dan overhead ~15-20% di atasnya.
  • Model Mixture-of-Experts (DeepSeek, GLM-5.2, Qwen3-235B) harus memuat setiap pakar ke dalam VRAM. "Parameter aktif" memberi Anda kecepatan, bukan penghematan memori.
  • Cache KV adalah biaya tersembunyi. Llama 3.3 70B membutuhkan sekitar 2,6 GB cache pada konteks 8K dan sekitar 41 GB pada 128K, di atas bobot model.
  • Q4_K_M adalah default yang masuk akal: kualitas hampir penuh dengan footprint sekitar seperempat dari FP16.
  • Model 12B seperti Gemma 4 muat di kartu 8 GB pada Q4. Model padat 70B membutuhkan sekitar 40 GB. Model MoE frontier 671B membutuhkan server kecil.

Kebutuhan VRAM LLM per Model: Tabel Utama

Jawaban singkatnya: pada Q4_K_M, model kecil (di bawah 14B) muat di kartu konsumen 8-12 GB, model menengah (24-32B) menginginkan 16-24 GB, model padat 70B membutuhkan sekitar 40 GB, dan model MoE frontier melonjak ke ratusan gigabyte karena setiap pakar harus berada di memori. Berikut adalah gambaran lengkapnya dalam satu tempat. Semua angka adalah memori untuk bobot saja, dihitung dari jumlah parameter setiap model dan diverifikasi silang terhadap kartu model resmi dari Meta AI, Qwen, dan Hugging Face.

ModelParameter (total / aktif)FP16Q8Q5_K_MQ4_K_MMin GPU pada Q4
Qwen3-0.6B0.6B padat1.2 GB0.6 GB0.4 GB0.4 GBKartu 2 GB apa saja / ponsel
Qwen3-4B4B padat8 GB4 GB2.7 GB2.3 GB4 GB (GTX 1650)
Qwen3-8B8B padat16 GB8 GB5.4 GB4.6 GB6-8 GB (RTX 3060)
Gemma 4 12B11.95B padat24 GB12 GB8.1 GB6.8 GB8 GB (RTX 4060)
Qwen3-14B14B padat28 GB14 GB9.5 GB8.0 GB12 GB (RTX 3060 12GB)
Mistral Small 3.2 24B24B padat48 GB24 GB16.3 GB13.7 GB16 GB (RTX 4080)
Qwen3-30B-A3B30B / 3B MoE60 GB30 GB20.4 GB17.1 GB24 GB (RTX 3090/4090)
Qwen3-32B32B padat64 GB32 GB21.8 GB18.2 GB24 GB (RTX 4090)
Llama 3.3 70B70B padat140 GB70 GB47.6 GB39.9 GB48 GB (2x 3090 / A6000)
Llama 4 Scout109B / 17B MoE218 GB109 GB74.1 GB62.1 GB80 GB (H100 / A100)
Qwen3-235B-A22B235B / 22B MoE470 GB235 GB160 GB134 GB2x 80 GB atau Mac 192 GB
Llama 4 Maverick400B / 17B MoE800 GB400 GB272 GB228 GB4x 80 GB
DeepSeek-V3.2671B / 37B MoE1342 GB671 GB456 GB382 GBNode 8x 80 GB
GLM-5.2744B / 40B MoE1488 GB744 GB506 GB424 GB8x 80 GB+ / multi-node

Ada dua hal yang bisa dibaca dari tabel ini. Pertama, kuantisasi adalah tuas terbesar yang Anda miliki: turun dari FP16 ke Q4 mengurangi footprint sekitar 4x dengan penurunan kualitas yang hampir tidak terasa. Kedua, baris MoE terlihat mengerikan karena memang demikian. Qwen3-30B-A3B hanya mengaktifkan 3B parameter per token, sehingga berjalan secepat model kecil, tetapi Anda tetap perlu memegang semua 30B di memori agar setiap pakar siap digunakan. Ingin detail per model di balik angka-angka ini? Ulasan mendalam Gemma 4 12B kami dan rangkuman LLM open-source terbaik tahun 2026 membahas benchmark dan lisensi.

"VRAM for the weights at Q4_K_M (GB)"

Tabel data
"VRAM for the weights at Q4_K_M (GB)"
"VRAM (GB)""Q4_K_M VRAM"
"Qwen3-8B"4.6
"Gemma 4 12B"6.8
"Mistral 24B"13.7
"Qwen3-32B"18.2
"Llama 3.3 70B"39.9
"Llama 4 Scout 109B"62.1
"Qwen3-235B"134
"DeepSeek-V3.2 671B"382

Rumus VRAM: Hitung Sendiri Ukuran Model Apa Pun

Untuk mengukur ukuran model apa pun, kalikan jumlah parameternya dengan byte-per-parameter untuk kuantisasi Anda, lalu tambahkan sedikit untuk cache KV dan overhead runtime. Itu saja. Bobot adalah istilah dominan, dan aritmatikanya cukup sederhana untuk dilakukan di belakang amplop.

Persamaan inti untuk bobot:

text
VRAM_weights (GB) = parameters (billions) × bits_per_weight ÷ 8

Nilai bit-per-weight yang Anda butuhkan (ini adalah tingkat efektif untuk file GGUF k-quant, yang membawa sedikit metadata blok di atas kedalaman bit nominal):

KuantisasiBit per weightByte per paramKualitas
FP16 / BF16162.0Presisi penuh, referensi
Q8_081.0Efektif tanpa loss
Q6_K~6.50.81Hampir penuh, jarang sepadan dibanding Q5
Q5_K_M~5.50.68Sedikit lebih baik dari Q4, sedikit lebih berat
Q4_K_M~4.50.57Titik optimal bagi kebanyakan orang

Contoh pengerjaan, Gemma 4 12B pada Q4_K_M: 11,95 × 4,5 ÷ 8 = sekitar 6,7 GB untuk bobot. Ini sejalan dengan kutipan sekitar 6,6 GB dari kartu model resmi dan menjelaskan mengapa model ini muat di kartu 8 GB dengan ruang untuk konteks yang moderat. Jalankan matematika yang sama untuk model 70B pada Q4 dan Anda mendapatkan 70 × 4,5 ÷ 8 = 39,4 GB, yang merupakan alasan mengapa "Anda memerlukan dua kartu 24 GB atau satu kartu 48 GB untuk model 70B" menjadi aturan umum yang selalu diulang orang.

Gambaran lengkapnya menambahkan dua istilah lagi: total VRAM ≈ bobot + cache KV + overhead ~15-20%. Overhead mencakup buffer aktivasi, konteks CUDA, dan fragmentasi memori, dan GPU Anda juga memesan sekitar setengah gigabyte untuk driver, jadi jangan pernah merencanakan untuk menggunakan 100% dari VRAM yang tertera.

Mengapa Cache KV Adalah Angka yang Menjerat Anda

Cache KV menyimpan kunci dan nilai perhatian (attention keys and values) untuk setiap token yang sudah ada dalam konteks, dan tumbuh secara linear dengan panjang konteks. Pada prompt pendek, ini hanyalah kesalahan pembulatan. Dorong menuju konteks panjang dan itu bisa menyaingi atau bahkan melebihi bobot itu sendiri. Ini adalah alasan paling umum mengapa model yang "seharusnya muat" melemparkan error out-of-memory di tengah generasi.

Rumusnya, per token:

text
KV_cache_per_token (bytes) = num_layers × 2 × kv_dim × precision_bytes
kv_dim = num_kv_heads × head_dim   (grouped-query attention shrinks this)

Ambil contoh Llama 3.3 70B: 80 lapisan, 8 kepala KV, dimensi kepala 128, jadi kv_dim adalah 1024. Pada FP16 itu berarti 80 × 2 × 1024 × 2 = 327.680 byte per token, sekitar 0,31 MB. Kalikan dengan panjang konteks dan ceritanya menjadi jelas: pada 8K token cache sekitar 2,6 GB, pada 32K sekitar 10 GB, dan pada 128K membengkak menjadi sekitar 41 GB. Angka terakhir itu di atas 40 GB bobot, jadi "model 40 GB" secara diam-diam menjadi masalah 80 GB begitu Anda mengisi jendela konteks.

Dua jalan keluar praktis. Grouped-query attention (yang digunakan setiap model terbaru) sudah memotong kv_dim dibandingkan desain multi-head lama, sehingga model modern jauh lebih ramah di sini daripada Llama 2. Dan sebagian besar mesin inferensi dapat mengkuantisasi cache KV ke 8-bit atau 4-bit, mengurangi ukurannya menjadi setengah atau seperempat dengan biaya kualitas kecil. Jika Anda melayani konteks panjang dalam produksi, perbandingan vLLM vs SGLang membahas backend mana yang mengelola memori ini paling efisien dengan paged attention.

Model MoE: Mengapa "Parameter Aktif" Tidak Menghemat VRAM

Ini adalah jebakan yang paling banyak menghabiskan uang orang. Model Mixture-of-Experts seperti DeepSeek-V3.2 (671B total, 37B aktif, berbagi arsitektur V3) atau GLM-5.2 (744B total, 40B aktif) merutekan setiap token melalui subset kecil dari pakarnya. Pemasaran mengandalkan angka aktif karena menggambarkan kecepatan: Anda hanya membayar komputasi senilai 37B parameter per token, sehingga inferensi cepat untuk ukuran modelnya. Tetapi setiap pakar harus duduk di memori, siap untuk dipilih, yang berarti anggaran VRAM Anda ditentukan oleh jumlah parameter total, bukan yang aktif.

Jadi pembacaan jujur dari tabel di atas: GLM-5.2 berjalan secepat model 40B tetapi menempati memori sebesar model 744B. Itulah sebabnya model open-source frontier ini membutuhkan server 8-GPU atau mesin unified-memory besar, meskipun satu forward pass murah. Qwen3-235B-A22B memiliki bentuk yang sama dalam skala lebih kecil, cepat per token, tetapi berat untuk di-hosting.

Sisi positif MoE muncul pada perangkat keras unified-memory. Mac Studio dengan 512 GB unified memory dapat menampung model 671B pada Q4 dan tetap menjalankannya dengan kecepatan yang dapat digunakan justru karena hanya 37B yang aktif, sehingga permintaan bandwidth memori per token tetap wajar. Jika Anda baru menjalankan ini secara lokal, mulailah dengan panduan penyiapan LLM lokal kami sebelum Anda membelanjakan uang untuk perangkat keras.

Kuantisasi Mana yang Harus Anda Pilih?

Bagi hampir semua orang, Q4_K_M adalah default yang tepat: ia mempertahankan kualitas hampir penuh sambil memotong footprint FP16 sekitar 4x. Naik ke Q5_K_M atau Q8 hanya jika Anda memiliki VRAM sisa dan tugas yang sensitif terhadap kualitas, dan gunakan FP16 hanya ketika Anda melakukan fine-tuning atau benchmarking terhadap referensi. Di bawah Q4, degradasi kualitas menjadi terlihat dengan cepat, jadi Q3 dan lebih rendah adalah upaya terakhir untuk memaksakan model masuk ke kartu yang benar-benar terlalu kecil.

Jika Anda memilikiPilihMengapa
Anggaran VRAM ketatQ4_K_MKualitas terbaik per gigabyte, default komunitas
Sedikit ruang napasQ5_K_MSedikit lebih tajam pada prompt sulit, sedikit lebih berat
2x bobot di VRAMQ8_0Efektif tanpa loss, hanya sepadan jika muat dengan mudah
Pekerjaan fine-tuning atau evalFP16 / BF16Presisi penuh, titik referensi yang jujur

Satu catatan: kualitas kuantisasi tidak identik di seluruh model. Model yang sangat kecil (di bawah 4B) merasakan dampak Q4 lebih daripada model besar, karena mereka memiliki redundansi yang lebih sedikit untuk dikorbankan. Pada model 70B, perbedaan Q4 versus Q8 sulit dibedakan pada sebagian besar tugas. Pada model 1.7B, kesenjangan itu nyata.

GPU Apa yang Sebenarnya Anda Butuhkan?

Cocokkan kolom Q4 dari tabel utama dengan kartu yang memiliki sedikit ruang napas untuk cache KV. Berikut adalah pemetaan praktis dari perangkat keras konsumen beranggaran terbatas hingga pusat data, dengan tingkatan model yang masing-masing kelas jalankan dengan nyaman pada Q4.

Perangkat KerasVRAMBerjalan nyaman pada Q4
RTX 4060 / 3060 (8-12 GB)8-12 GBHingga ~14B padat (Gemma 4 12B, Qwen3-14B)
RTX 4080 / 4070 Ti Super (16 GB)16 GBHingga ~24B padat (Mistral Small 3.2 24B)
RTX 4090 / 3090 (24 GB)24 GBHingga ~32B padat, atau Qwen3-30B-A3B
RTX 6000 Ada / A6000 (48 GB)48 GB70B padat (Llama 3.3 70B)
H100 / A100 (80 GB)80 GB~109B MoE (Llama 4 Scout)
Node 8x H100640 GB671-744B MoE frontier (DeepSeek, GLM-5.2)
Mac Studio M-series (unified)64-512 GBSkala dengan RAM; 512 GB menampung MoE 671B pada Q4

Apple Silicon pantas mendapat sebutan khusus karena unified memory mengubah perhitungan. Mac tidak membagi VRAM dari RAM sistem, sehingga mesin M-series 128 GB dapat memuat model yang biasanya membutuhkan beberapa GPU diskrit, menukar throughput puncak dengan kemampuan untuk menampung bobot besar pada satu desktop. Untuk backend yang memeras performa maksimal dari kartu-kartu ini, rangkuman kami tentang alat terbaik untuk menjalankan LLM secara lokal menguji perbedaan kecepatan dunia nyata.

Bagaimana Kami Mengukur VRAM untuk Implementasi Klien

Di Techsy, kami sering menerapkan model open-source untuk klien sehingga pengukuran VRAM adalah percakapan pertama, sebelum pemilihan model, sebelum prompt, sebelum apa pun. Metode kami sengaja membosankan, karena mode kegagalan (OOM di produksi di bawah beban konteks nyata) mahal. Berikut adalah proses yang benar-benar kami jalankan.

Kami mulai dari matematika tabel, lalu mengukur. Setelah memuat model, kami memeriksa footprint residen nyata daripada mempercayai estimasi:

bash
# What the GPU is actually holding
nvidia-smi --query-gpu=memory.used,memory.total --format=csv

# For an Ollama-served model, its real memory + how much sits on GPU vs CPU
ollama ps

# llama.cpp: control the split explicitly and cap context to bound KV cache
llama-server -m model-Q4_K_M.gguf --n-gpu-layers 999 --ctx-size 8192

Pelajaran yang terus berulang: tim mengukur ukuran untuk bobot dan melupakan cache KV, kemudian bertanya-tanya mengapa model yang dimuat dengan baik mati setelah tiga permintaan panjang dalam demo. Kami mengukur ukuran untuk bobot plus cache KV pada konteks maksimum yang benar-benar akan digunakan aplikasi, plus ruang napas, dan kami membatasi --ctx-size sehingga permintaan yang tidak terkendali tidak dapat membuat kotak OOM. Untuk apa pun yang面向 pelanggan, kami lebih memilih menjalankan model 32B terkuantisasi yang tidak pernah jatuh daripada model 70B FP16 yang OOM di bawah beban.

Jika Anda menimbang apakah akan meng-host sendiri model open-source atau tetap menggunakan API yang dihosting, pertukaran itu (biaya perangkat keras dan beban operasional versus harga per-token dan kontrol) adalah tepat apa yang ditim kami cakup selama engagement integrasi AI. Jika akan membantu memiliki seseorang yang menjalankan angka-angka terhadap beban kerja aktual Anda, dapatkan konsultasi gratis dan kami akan mengukurnya bersama Anda.

Tentang Penulis

Mert Batur Gurbuz adalah Co-Founder Techsy.io, di mana timnya mengirimkan agen AI, sistem otomasi, dan pipeline voice/SDR untuk klien B2B. Ia belajar di University of Birmingham dan menulis tentang tumpukan alat LLM yang benar-benar digunakan tim Techsy dalam produksi.

Kredensial: Co-Founder, Techsy.io, University of Birmingham. Terhubung di LinkedIn.

Pertanyaan yang Sering Diajukan

Berapa banyak VRAM yang saya butuhkan untuk menjalankan model 70B?

Model padat 70B seperti Llama 3.3 70B membutuhkan sekitar 40 GB VRAM untuk bobot pada Q4_K_M, jadi rencanakan untuk kartu 48 GB (RTX 6000 Ada) atau dua kartu 24 GB. Tambahkan beberapa gigabyte lagi untuk cache KV jika Anda menggunakan konteks panjang, yang mendorong persyaratan praktis menuju 48 GB atau lebih.

Berapa banyak VRAM yang dibutuhkan Llama, Qwen, atau DeepSeek?

Itu sepenuhnya tergantung pada variannya. Llama 4 Scout membutuhkan sekitar 62 GB pada Q4, Qwen3-32B sekitar 18 GB, dan Qwen3-8B di bawah 5 GB. DeepSeek-V3.2, sebuah MoE 671B, membutuhkan sekitar 382 GB karena setiap pakar harus dimuat. Selalu periksa jumlah parameter total, bukan yang aktif, untuk model MoE.

Bisakah saya menjalankan LLM pada GPU 8GB?

Ya, dengan nyaman. Kartu 8 GB seperti RTX 4060 menjalankan model hingga sekitar 12B parameter pada Q4_K_M. Gemma 4 12B muat dalam sekitar 6,8 GB, menyisakan ruang untuk konteks yang moderat. Untuk apa pun yang lebih besar, Anda harus mengkuantisasi lebih keras, menjaga konteks tetap pendek, atau beralih ke kartu yang lebih besar.

Apa yang bisa dijalankan oleh GPU 24GB seperti RTX 4090?

Kartu 24 GB menangani model padat hingga sekitar 32B pada Q4_K_M dengan ruang napas untuk konteks yang wajar, jadi Qwen3-32B dan Mistral Small 3.2 24B berjalan dengan nyaman. Ini juga menjalankan MoE Qwen3-30B-A3B, yang memuat 30B bobot tetapi menghasilkan output secepat model 3B berkat aktivasi sparse.

Apakah kuantisasi merusak kualitas model?

Pada Q4_K_M dan di atasnya, kehilangan kualitas kecil dan sering kali tidak terlihat pada tugas nyata, terutama untuk model di atas 13B. Kesenjangan melebar saat Anda turun lebih rendah dan saat model menjadi lebih kecil, jadi Q4 pada model 70B hampir gratis sementara Q4 pada model 1.7B terlihat dampaknya. Q8 secara efektif tanpa loss jika Anda memiliki memori.

Apakah model MoE membutuhkan VRAM lebih sedikit daripada model padat?

Tidak, dan ini adalah kesalahpahaman paling umum. Model Mixture-of-Experts harus memegang setiap pakar di VRAM, sehingga memorinya ditentukan oleh jumlah parameter total. Angka parameter aktif hanya menggambarkan kecepatan inferensi. GLM-5.2 berjalan secepat model 40B tetapi membutuhkan memori sebesar model 744B.

Apakah unified memory sama dengan VRAM?

Secara fungsional, untuk memuat model, ya. Apple Silicon dan beberapa sistem lain berbagi satu pool memori antara CPU dan GPU, sehingga Mac 128 GB dapat memuat model yang biasanya membutuhkan beberapa GPU diskrit. Pertukarannya adalah bandwidth: unified memory biasanya memberikan throughput puncak lebih rendah daripada GPU pusat data kelas atas, sehingga token-per-detik lebih rendah.

Bisakah saya offload sebagian model ke RAM sistem atau CPU?

Ya. Mesin seperti llama.cpp dan Ollama memungkinkan Anda menjaga beberapa lapisan di GPU dan sisanya di RAM sistem dengan flag seperti --n-gpu-layers. Ini memungkinkan Anda menjalankan model yang terlalu besar untuk VRAM Anda, tetapi setiap lapisan di CPU memperlambat generasi secara tajam, jadi gunakan ini untuk membuat model mungkin dijalankan, bukan cepat.

Bagaimana cara menghitung VRAM untuk model yang tidak ada di tabel?

Kalikan jumlah parameter dalam miliaran dengan bits-per-weight untuk kuantisasi Anda, lalu bagi dengan 8. Untuk Q4_K_M gunakan sekitar 4,5 bit, jadi model 40B membutuhkan 40 × 4,5 ÷ 8 = sekitar 22,5 GB untuk bobot. Tambahkan overhead sekitar 15-20% plus cache KV Anda untuk persyaratan nyata.

Tag

kebutuhan vram llmmemori gpukuantisasicache kvllm lokal

Bagikan artikel ini

Artikel Terkait

Lebih lanjut di ai-machine-learning

ai-machine-learning
Jul 24, 2026

Claude Opus 5 Resmi Hadir: Kecerdasan Setara Fable 5 dengan Harga Separuhnya

Anthropic merilis Claude Opus 5 pada 24 Juli 2026. Model ini menggandakan skor Opus 4.8 di Frontier-Bench dan mempertahankan harga Opus, tetapi kalah di beberapa uji dari Fable 5 dan Mythos 5. Berikut tabel benchmark, harga, dan rekomendasi ganti/tunggu/tetap.

10 min read baca
Baca
ai-machine-learning
Jul 20, 2026

8 API Web Scraping AI Terbaik 2026 (Diuji di Stack Agent Kami Sendiri)

Kami menguji 8 API web scraping AI dengan harga asli 2026 yang ditarik lewat stack agent kami sendiri. Firecrawl, Bright Data, ScrapingBee dan 5 lainnya, diranking untuk output siap-LLM, anti-bot, dan dukungan MCP.

9 min read baca
Baca
ai-machine-learning
Jul 20, 2026

Prompt Engineering untuk Coding: 7 Pola yang Kami Gunakan Setiap Hari di Claude Code dan Cursor (2026)

Sebagian besar artikel 'prompt coding AI' hanya memberi Anda 50 templat untuk disalin. Artikel ini mengajarkan 7 pola yang kami gunakan setiap hari untuk menjalankan pipeline Claude Code dengan 16 agen, lengkap dengan contoh sebelum dan sesudah yang nyata, serta penjelasan di mana setiap pola diterapkan di Claude Code, Cursor, dan Copilot pada tahun 2026.

11 min read baca
Baca
Lihat Semua Postingan
Mulai Proyek Anda

Siap membangun sesuatu lu biasa?

Mari wujudkan visi Anda menjadi kenyataan. Tim kami siap membantu Anda menciptakan software yang benar-benar berdampak.

Jadwalkan panggilan scoping 30 menitLihat Karya Kami

Terbaru dari library

Skill Claude

Lihat semua
  • New Post

    Full SEO blog pipeline: research, brief, write, validate, image, translate, publish to Sanity. Autonomous from start to finish.

  • Content Refresh

    Audit a stale post, find decay drivers, and ship a SERP-aligned refresh without losing existing rankings.

  • SEO Audit

    Site-wide SEO audit with prioritized fix list: technical, on-page, and EEAT signals.

Otomatisasi AI

Lihat semua
  • Security Auditor

    Weekly SCA + IaC scan with prioritized fix PRs.

  • Cold Email Writer

    Generates first-touch emails grounded in one specific public detail.

  • Lead Research Agent

    Enrich an email into a profile, score fit, alert in Slack.

Terbaru dari library

Skill Claude

Lihat semua
  • New Post

    Full SEO blog pipeline: research, brief, write, validate, image, translate, publish to Sanity. Autonomous from start to finish.

  • Content Refresh

    Audit a stale post, find decay drivers, and ship a SERP-aligned refresh without losing existing rankings.

  • SEO Audit

    Site-wide SEO audit with prioritized fix list: technical, on-page, and EEAT signals.

Otomatisasi AI

Lihat semua
  • Security Auditor

    Weekly SCA + IaC scan with prioritized fix PRs.

  • Cold Email Writer

    Generates first-touch emails grounded in one specific public detail.

  • Lead Research Agent

    Enrich an email into a profile, score fit, alert in Slack.

Layanan

  • Solusi Enterprise
  • Aplikasi Mobile
  • Aplikasi Web

Solusi

  • Sistem CRM
  • Integrasi AI
  • Solusi ERP
  • Agen Suara
  • Otomasi Proses
  • Keamanan Siber

Perpustakaan

  • Blog
  • Portofolio

Komunitas

  • Otomatisasi AI
  • Skill Claude

Alat

  • Kalkulator Biaya Aplikasi Mobile
  • Kalkulator Biaya API OpenAI / LLM
  • Kalkulator Biaya MVP
  • Kalkulator Biaya Voice AI Agent

Perusahaan

  • Tentang
  • Mitra
  • Kontak

Hukum

  • Kebijakan Privasi
  • Syarat Layanan
  • Kebijakan Kuki

Layanan

  • Solusi Enterprise
  • Aplikasi Mobile
  • Aplikasi Web

Solusi

  • Sistem CRM
  • Integrasi AI
  • Solusi ERP
  • Agen Suara
  • Otomasi Proses
  • Keamanan Siber

Perpustakaan

  • Blog
  • Portofolio

Komunitas

  • Otomatisasi AI
  • Skill Claude

Alat

  • Kalkulator Biaya Aplikasi Mobile
  • Kalkulator Biaya API OpenAI / LLM
  • Kalkulator Biaya MVP
  • Kalkulator Biaya Voice AI Agent

Perusahaan

  • Tentang
  • Mitra
  • Kontak
HukumKebijakan PrivasiSyarat LayananKebijakan Kuki
TECHSY
© 2026 Techsy. Seluruh hak cipta dilindungi.