Lokale KI-Infrastruktur
als Rohstoff für Ideen

SmartLLM ist eine OpenAI-kompatible API zu Open-Weights-Modellen, gehostet in Österreich. Bei roher Inferenz halten wir in Europa mit der Cloud nicht mit, das ist auch nicht der Plan. Der Wert liegt in der Ebene darüber und dafür braucht es eine Basis, die in der eigenen Hand liegt. Die stellen wir bereit.

Das Smart steht dabei nicht für das Modell, sondern für die Schicht darüber: Algorithmen, die ein LLM geschickt in ein gutes Programm einbinden, mit Determinismus dort wo er zählt. Der Kern ist nicht das größte und beste Modell, sondern das kluge Zusammenspiel aus solider Programmierung und einem leistungsfähigen LLM.

10+ Modelle verfügbar · 100% Daten in Österreich · Ab Minute eins startklar · OpenAI-kompatibel

861.914.404
Input-Tokens
13.742.990
Output-Tokens
68.896
Requests

Warum wir das selbst bauen

SmartLLM entstand aus der eigenen Praxis, nach über 25 Jahren in der Softwareentwicklung und digitalen Geschäftsmodellen. Wer KI-Infrastruktur für Unternehmen betreiben will, muss sie selbst verstehen. Bis runter zur Hardware. Cloud-Dienste haben ihre Berechtigung, aber für viele Anwendungen sind sie schlicht nicht notwendig.

Keine Daten für fremdes Training

Cloud-Anbieter behalten sich oft vor, Ihre Eingaben zur Modellverbesserung zu verwenden. Bei SmartLLM ist das technisch ausgeschlossen, Open-Source-Modelle auf eigener Hardware, ohne möglichen Datenabfluss.

Echte DSGVO-Compliance

EU-Hosting bei einem US-Anbieter löst das Problem im Grunde nicht. Eigene Hardware, kein Subunternehmer, keine Drittstaaten, das ist echte Datensouveränität, nicht nur ein Zertifikat.

Sofort startklar

Zwischen „wir hosten selbst“ und „die Hardware läuft“ liegen Monate: bestellen, bewilligen, installieren, konfigurieren. In dieser Zeit entwickeln Sie auf unseren Modellen weiter, dieselbe API die später auf Ihrer eigenen Hardware spricht. Wenn Ihr Spark läuft, tauschen Sie eine URL. Fertig.

Kuratierte Modelle

Die Welt der KI-Modelle entwickelt sich rasant weiter. Wir prüfen neue Open-Weights-Modelle sorgfältig und nehmen diese rasch in den Katalog auf. Gibt es bessere Modelle, werden wir diese verfügbar machen. Mit dem Alias-Modell bekommen Sie diese automatisch.

Ein Ansprechpartner, nicht ein Ticket

Kein Support-Portal, keine Warteschleife. Ein persönlicher Ansprechpartner der Ihre Infrastruktur kennt und der die Systeme selbst gebaut hat. Von der Hardware bis zur Anwendung.

Bilder & Dokumente verstehen

Nicht nur Text: SmartLLM analysiert Bilder, Screenshots und PDFs direkt über die API. Rechnungen, Verträge, technische Zeichnungen: Ein Call, alles auf eigener GPU in Österreich. Dazu 55+ Werkzeuge für Web, Mathematik, Dateien und mehr, plus Ihre eigenen APIs als Plugin.

„Wer KI im Unternehmen einsetzt ohne die Infrastruktur zu kontrollieren, baut auf Sand. Cloud-Dienste werden eingestellt, Modellversionen geändert, Regionen gesperrt. Wir bauen fertige Lösungen auf eigener Hardware - von der Eingabe bis zum Ergebnis.“

- Mag. Michael Allerstorfer, ALL Smart GmbH

Verfügbare Modelle

Lokale Inferenz auf dedizierter Hardware in Oberösterreich.

Name Production Alias Parameter Context Input Status
Flagship
Qwen 3.5 397B
frontier 397B (17B aktiv) 256K Text, Bild loaded
Multimodal
Nemotron 3 Omni
33B 128K Text, Bild, Audio (Beta) on-demand
Reasoning
Nemotron Cascade 2
32B 256K Text on-demand
Phi 4
14B 16K Text on-demand
Allgemein
Qwen 3.6 35B
mid vision coder 35B (3B aktiv) 32K Text, Bild, Video loaded
Qwen 3.5 35B
35B (3B aktiv) 256K Text on-demand
Granite 4.1
30B 256K Text on-demand
Nemotron 3 Nano
30B (3.5B aktiv) 256K Text on-demand
Qwen 3.6 27B
27B 256K Text, Bild on-demand
Gemma 4 26B
26B (4B aktiv) 256K Text, Bild on-demand
Code
Qwen3 Coder Next
80B 256K Text on-demand
Qwen3 Coder
coder-fast 31B 256K Text on-demand
Ornith 35B
35B (qwen35moe) 256K Text on-demand
Schnell
Qwen 3.5 9B
9B 256K Text on-demand
LFM 2.5 8B
fast 8B 16K Text loaded

loaded Modelle sind dauerhaft im Speicher, sofortige erste Antwort. on-demand Modelle werden bei der ersten Anfrage geladen; das kann initial einige Sekunden dauern.

Performance

Backend-Rate bei kontinuierlichem Text-Output.

Nächtlich gemessen mit Standard-Prompt und Streaming, Warmup-Run verworfen, Median aus mehreren Läufen. Reine Decode-Rate, ohne First-Token-Latenz und Queue-Wait. Bei Tool-Calls oder Reasoning- lastigen Prompts variiert die tatsächliche Zeit.

Modell Modus Durchsatz Startup
Qwen 3.5 397B
loaded 29.5 t/s 213 ms
Nemotron 3 Omni
on-demand 46.0 t/s 1 min 46 s cold
1.0 s warm
Nemotron Cascade 2
on-demand 40.0 t/s 2.4 s cold
723 ms warm
Qwen 3.6 35B
loaded 53.3 t/s 119 ms
Qwen 3.5 35B
on-demand 39.8 t/s 26.1 s cold
1.0 s warm
Granite 4.1
on-demand 6.4 t/s 1 min 36 s cold
1.1 s warm
Nemotron 3 Nano
on-demand 37.8 t/s 1.3 s cold
1.3 s warm
Qwen 3.6 27B
on-demand 7.9 t/s 2.0 s cold
2.0 s warm
Gemma 4 26B
on-demand 33.8 t/s 1 min 15 s cold
1.3 s warm
Ornith 35B
on-demand 37.4 t/s 18.7 s cold
1.9 s warm
Qwen 3.5 9B
on-demand 23.8 t/s 11.9 s cold
1.6 s warm
LFM 2.5 8B
loaded 60.1 t/s 85 ms

System Status

Echtzeit-Übersicht der Infrastruktur.

Alle Systeme operativ
-

Woher SmartLLM kommt

SmartLLM ist nicht am Reißbrett entstanden, sondern aus eigenem Bedarf. ALL Smart betreibt eigene Produkte, die auf Sprachmodellen laufen und dafür braucht es Inferenz, die verlässlich ist, in eigener Hand liegt und den europäischen Datenschutz nicht als Nachgedanken behandelt. Die Cloud erfüllt das zum Großteil nicht.

Also haben wir die Infrastruktur selbst gebaut: frei verfügbare Open-Weights-Modelle, gehostet auf eigener Hardware. Was als interne Lösung begann, ist ein Dienst geworden, den wir auch anderen gerne zur Verfügung stellen. Nicht nur als Dienst, auch als Beweis, dass wir in der Lage sind, das zu tun.

Was SmartLLM leistet

SmartLLM ist ein DSGVO-konformer Inferenzdienst. Die Modelle laufen auf eigener Hardware, nicht in einer fremden Cloud in irgendeinem Rechenzentrum. Kein Training auf Ihren Daten, keine Weitergabe, keine Blackbox in einem anderen Rechtsraum. Ein Ansprechpartner, der das Thema KI bis runter zur Hardware lebt.

Über ein einfaches Alias-System wählen Sie die passende Modellklasse, von schnell und günstig bis zur stärksten verfügbaren Stufe, ohne sich um die Technik dahinter kümmern zu müssen. Der Dienst ist dabei nicht theoretisch: Er trägt unsere eigenen produktiven Anwendungen im täglichen Betrieb. Was Sie hier nutzen, nutzen wir vor allem auch selbst.

Nicht das größte Modell, das richtige

Man greift viel zu schnell zum Spitzenmodell. Dabei braucht es das für die meisten Anwendungen, auch für unsere, gar nicht. Sauber gebaut reichen oft einfachere Open-Weights-Modelle und senken damit die Hürde, ab der ein KI-Projekt wirtschaftlich wird. Eine Anwendung so zu bauen, dass sie mit dem passenden statt dem teuersten Modell läuft, ist kein Kompromiss. Es ist Handwerk.

Was SmartLLM nicht ist

SmartLLM ist kein Billig-Massendienst und will es nicht sein. Der Preis ist bewusst so gesetzt, dass er Qualität vor Volumen stellt und auch unsere Kosten deckt. Wer die günstigste Inferenz für beliebige Zwecke sucht, ist woanders besser aufgehoben. Der Dienst soll vor allem Unternehmen die Hürde für erste eigene Entwicklungen senken, gemeinsam können wir sofort starten.

Und so weit Open-Weights-Modelle auf souveräner Hardware heute reichen, und sie reichen deutlich weiter, als die meisten annehmen: Die absolute Spitze proprietärer Frontier-Modelle bilden sie nicht in jedem Einzelfall ab. Wir sagen offen, wo die Grenze liegt, statt etwas zu versprechen, das der Dienst nicht hält.

Für wen SmartLLM gedacht ist

Für alle, denen Datenhoheit und Verlässlichkeit wichtiger sind als der niedrigste Preis und die europäischen Datenschutz nicht als Hürde verstehen, sondern als Grundlage für das eigene Tun. Für Unternehmen, die Sprachmodelle produktiv nutzen wollen, ohne ihre Daten aus der Hand zu geben und vielleicht sogar im Anschluss selbst Hardware hosten möchten, statt alles über die Cloud zuzukaufen. Und für alle, die für Beratung, Entwicklung und Inferenz einen kompetenten Ansprechpartner wollen.

SmartLLM entspricht unserem Leitbild

Wir möchten nicht mit Kunden über LLMs reden, wenn wir nicht in der Lage sind, diese selbst zu hosten. Wir möchten wissen, wie die Dinge konkret funktionieren. Bis zur Hardware. Wir möchten die Wärme spüren, die ein DGX Spark unter Volllast abgibt und auch den Schmerz, wenn eine Konfiguration falsch war und ein Dienst abschmiert. Beides befähigt uns dazu, unseren Kunden die Wege zu zeigen, die zum Ziel führen.

SmartLLM: fair und transparent

10m Tokens kostenlos zum Testen und Einrichten
8 / 1m Tokens danach, alle Modelle, alle Anfragen
0 Grundgebühr Keine Bindung, nur Verbrauch

Ein Preis für alle Modelle. Keine versteckten Kosten. Keine Abonnements. Alle Preise netto zzgl. USt.

Häufig gestellte Fragen

Was ist SmartLLM?
SmartLLM ist eine OpenAI-kompatible KI-API auf eigener Hardware in Österreich. Open-Weights-Modelle auf eigener Hardware. Ihre Daten verlassen nie das Land.
Wie viel kostet SmartLLM?
10 Millionen Tokens sind kostenlos zum Testen. Danach €8 pro Million Tokens - ein Preis für alle Modelle, keine Grundgebühr, keine Bindung.
Brauche ich technisches Wissen um SmartLLM zu nutzen?
SmartLLM ist vollständig OpenAI-kompatibel. Wenn Ihre Software mit OpenAI funktioniert, funktioniert sie auch mit SmartLLM - Sie ändern nur die URL und den API-Key.

Bereit für lokale Infrastruktur?