LLM Inference Engineering : Quantization, KV-Cache Optimization, and High-Throughput Serving: A Production Engineer's Guide to INT4/INT8 Quantization, vLLM, TGI, Speculative Decoding, and Cost Optimization

Sprache: Englisch

Verlag: Independently Published Jun 2026, 2026

9798180985187

Serie: Buch 11 von 21 - Production AI Engineering Series

Anbieter: AHA-BUCH GmbH, Einbeck, DeutschlandAHA-BUCH GmbH

Verkäufer/-in mit 5 Sternen

Verkäufer:in bei ZVAB seit 14. August 2006

Softcover

Zustand: Neu

EUR 17,73

EUR 35,00 Versand 
Versand von Deutschland nach USA

Anzahl: 2 verfügbar

In den Warenkorb
30 Tage kostenlose Rückgabe

Artikelbeschreibung des Verkäufers

Neuware - Master the Art of Low-Latency, High-Throughput LLM ServingIn 2026, the defining challenge of production AI is no longer training-it is cost-effective inference. LLM Inference Engineering is the definitive production guide for software engineers, ML developers, and DevOps professionals tasked with deploying large language models at scale without breaking the bank.This hands-on manual strips away the theoretical academic jargon and delivers practical, production-ready strategies to cut your GPU and cloud serving costs by 50% to 70% while maintaining absolute response quality.What You Will Master: - Advanced Quantization: Hands-on implementation of INT4/INT8 quantization using AWQ, GPTQ, and GGUF algorithms without destroying model accuracy.- High-Throughput Architectures: Deep dives into PagedAttention, continuous batching, and GPU memory management to maximize hardware utilization.- Serving Frameworks: Configuration recipes and production tuning guidelines for vLLM, TGI (Text Generation Inference), and llama.cpp.- Speed Optimization: Implement speculative decoding to achieve 2x to 4x latency reduction with mathematically guaranteed quality.- Scaling to 70B+ Models: Configure multi-GPU setups using tensor parallelism to distribute memory footprints efficiently.- Rigorous Benchmarking: Establish robust metrics for latency, cost-per-token, and throughput to justify infrastructure decisions.Written specifically for practicing engineers, this guide assumes familiarity with Python and basic PyTorch. Inside, you will find real-world deployment examples, benchmarking code, and architectural breakdowns that bridge the gap between model training and highly scalable production deployments. Equip yourself with the skills to architect the next generation of AI infrastructure. Stop wasting expensive GPU cycles-optimize your inference pipeline today.…

Bestandsnummer des Verkäufers 9798180985187

Titel
LLM Inference Engineering : Quantization, KV-Cache Optimization, and High-Throughput Serving: A Production Engineer's Guide to INT4/INT8 Quantization, vLLM, TGI, Speculative Decoding, and Cost Optimization
Autor
Chatvariety Team
Verlag
Independently Published Jun 2026
Erscheinungsjahr
2026
Zustand
Neu
Einband
Taschenbuch
Sprache
Englisch
ISBN-13
9798180985187
Artikelgewicht
126 Gramm
Abmessungen
229x152x4 mm
Serie
Buch 11 von 21: Production AI Engineering Series

AHA-BUCH GmbH

Einbeck, Deutschland

Verkäufer/-in mit 5 Sternen

Verkäufer:in bei ZVAB seit 14. August 2006

Versandkosten von Deutschland nach USA

Artikel7 bis 10 Werktage5 bis 7 Werktage
Erster ArtikelEUR 35,00EUR 45,00
Die Versandzeiten werden von den Verkäuferinnen und Verkäufern festgelegt. Sie variieren je nach Versanddienstleister und Standort. Sendungen, die den Zoll passieren, können Verzögerungen unterliegen. Eventuell anfallende Abgaben oder Gebühren sind von der Käuferin bzw. dem Käufer zu tragen. Die Verkäuferin bzw. der Verkäufer kann Sie bezüglich zusätzlicher Versandkosten kontaktieren, um einen möglichen Anstieg der Versandkosten für Ihre Artikel auszugleichen.

Zahlungsarten

  • Visa
  • Mastercard
  • American Express
  • Carte Bleue
  • Apple Pay
  • Google Pay
  • Banküberweisung
  • PayPal
  • Vorauskasse

Shopbeschreibung

Das Unternehmen AHA-BUCH GmbH: Seit der Gründung von AHA-BUCH im Juli 2005 ist unser Hauptziel, zufriedenen Kunden so schnell und so preisgünstig wie möglich ihren Bücherwunsch zu erfüllen. Unsere Firma beschäftigt 16 Mitarbeiter, die nur ein Ziel kennen: den Kunden und seine Wünsche! Auf über 3700 m2 Fläche haben wir über 100.000 Bücher, Modernes Antiquariat und Spiele auf Lager.

Spezialisierung

Kinderbücher & Kinderhör Casetten, German Books, Software, Natur & Tiere, Ratgeber, Sachbücher, Englische Bücher, Medizin & Gesundheit, Universität & Studium

Unternehmensdaten der Verkäuferin bzw. des Verkäufers

AHA-BUCH GmbH

Garlebsen 48
Einbeck, Deutschland 37574