Lokale KI-Infrastruktur
als Rohstoff für Ideen
SmartLLM ist eine OpenAI-kompatible API zu Open-Weights-Modellen, gehostet in Österreich. Bei roher Inferenz halten wir in Europa mit der Cloud nicht mit, das ist auch nicht der Plan. Der Wert liegt in der Ebene darüber und dafür braucht es eine Basis, die in der eigenen Hand liegt. Die stellen wir bereit.
Das Smart steht dabei nicht für das Modell, sondern für die Schicht darüber: Algorithmen, die ein LLM geschickt in ein gutes Programm einbinden, mit Determinismus dort wo er zählt. Der Kern ist nicht das größte und beste Modell, sondern das kluge Zusammenspiel aus solider Programmierung und einem leistungsfähigen LLM.
10+ Modelle verfügbar · 100% Daten in Österreich · Ab Minute eins startklar · OpenAI-kompatibel
Dienste, die auf SmartLLM bauen
Prüft Webseiten darauf, wie gut generative KI-Systeme sie lesen, verstehen und zitieren.
Bestehende Websites per Texteingabe ändern: Inhalte, Abschnitte, Layout. Kein technisches Know-how nötig, jederzeit umkehrbar.
Das Smart ist nicht das Modell. Smart ist, was darauf läuft.
Warum wir das selbst bauen
SmartLLM entstand aus der eigenen Praxis, nach über 25 Jahren in der Softwareentwicklung und digitalen Geschäftsmodellen. Wer KI-Infrastruktur für Unternehmen betreiben will, muss sie selbst verstehen. Bis runter zur Hardware. Cloud-Dienste haben ihre Berechtigung, aber für viele Anwendungen sind sie schlicht nicht notwendig.
Keine Daten für fremdes Training
Cloud-Anbieter behalten sich oft vor, Ihre Eingaben zur Modellverbesserung zu verwenden. Bei SmartLLM ist das technisch ausgeschlossen, Open-Source-Modelle auf eigener Hardware, ohne möglichen Datenabfluss.
Echte DSGVO-Compliance
EU-Hosting bei einem US-Anbieter löst das Problem im Grunde nicht. Eigene Hardware, kein Subunternehmer, keine Drittstaaten, das ist echte Datensouveränität, nicht nur ein Zertifikat.
Sofort startklar
Zwischen „wir hosten selbst“ und „die Hardware läuft“ liegen Monate: bestellen, bewilligen, installieren, konfigurieren. In dieser Zeit entwickeln Sie auf unseren Modellen weiter, dieselbe API die später auf Ihrer eigenen Hardware spricht. Wenn Ihr Spark läuft, tauschen Sie eine URL. Fertig.
Kuratierte Modelle
Die Welt der KI-Modelle entwickelt sich rasant weiter. Wir prüfen neue Open-Weights-Modelle sorgfältig und nehmen diese rasch in den Katalog auf. Gibt es bessere Modelle, werden wir diese verfügbar machen. Mit dem Alias-Modell bekommen Sie diese automatisch.
Ein Ansprechpartner, nicht ein Ticket
Kein Support-Portal, keine Warteschleife. Ein persönlicher Ansprechpartner der Ihre Infrastruktur kennt und der die Systeme selbst gebaut hat. Von der Hardware bis zur Anwendung.
Bilder & Dokumente verstehen
Nicht nur Text: SmartLLM analysiert Bilder, Screenshots und PDFs direkt über die API. Rechnungen, Verträge, technische Zeichnungen: Ein Call, alles auf eigener GPU in Österreich. Dazu 55+ Werkzeuge für Web, Mathematik, Dateien und mehr, plus Ihre eigenen APIs als Plugin.
„Wer KI im Unternehmen einsetzt ohne die Infrastruktur zu kontrollieren, baut auf Sand. Cloud-Dienste werden eingestellt, Modellversionen geändert, Regionen gesperrt. Wir bauen fertige Lösungen auf eigener Hardware - von der Eingabe bis zum Ergebnis.“
- Mag. Michael Allerstorfer, ALL Smart GmbH
Verfügbare Modelle
Lokale Inferenz auf dedizierter Hardware in Oberösterreich.
| Name | Production Alias | Parameter | Context | Input | Status |
|---|---|---|---|---|---|
| Flagship | |||||
|
|
frontier | 397B (17B aktiv) | 256K | Text, Bild | loaded |
| Multimodal | |||||
|
|
— | 33B | 128K | Text, Bild, Audio (Beta) | on-demand |
| Reasoning | |||||
|
|
— | 32B | 256K | Text | on-demand |
|
|
— | 14B | 16K | Text | on-demand |
| Allgemein | |||||
|
|
mid vision coder | 35B (3B aktiv) | 32K | Text, Bild, Video | loaded |
|
|
— | 35B (3B aktiv) | 256K | Text | on-demand |
|
|
— | 30B | 256K | Text | on-demand |
|
|
— | 30B (3.5B aktiv) | 256K | Text | on-demand |
|
|
— | 27B | 256K | Text, Bild | on-demand |
|
|
— | 26B (4B aktiv) | 256K | Text, Bild | on-demand |
| Code | |||||
|
|
— | 80B | 256K | Text | on-demand |
|
|
coder-fast | 31B | 256K | Text | on-demand |
|
|
— | 35B (qwen35moe) | 256K | Text | on-demand |
| Schnell | |||||
|
|
— | 9B | 256K | Text | on-demand |
|
|
fast | 8B | 16K | Text | loaded |
loaded Modelle sind dauerhaft im Speicher, sofortige erste Antwort. on-demand Modelle werden bei der ersten Anfrage geladen; das kann initial einige Sekunden dauern.
Performance
Backend-Rate bei kontinuierlichem Text-Output.
Nächtlich gemessen mit Standard-Prompt und Streaming, Warmup-Run verworfen, Median aus mehreren Läufen. Reine Decode-Rate, ohne First-Token-Latenz und Queue-Wait. Bei Tool-Calls oder Reasoning- lastigen Prompts variiert die tatsächliche Zeit.
| Modell | Modus | Durchsatz | Startup |
|---|---|---|---|
|
|
loaded | 29.5 t/s | 213 ms |
|
|
on-demand | 46.0 t/s |
1 min 46 s cold 1.0 s warm |
|
|
on-demand | 40.0 t/s |
2.4 s cold 723 ms warm |
|
|
loaded | 53.3 t/s | 119 ms |
|
|
on-demand | 39.8 t/s |
26.1 s cold 1.0 s warm |
|
|
on-demand | 6.4 t/s |
1 min 36 s cold 1.1 s warm |
|
|
on-demand | 37.8 t/s |
1.3 s cold 1.3 s warm |
|
|
on-demand | 7.9 t/s |
2.0 s cold 2.0 s warm |
|
|
on-demand | 33.8 t/s |
1 min 15 s cold 1.3 s warm |
|
|
on-demand | 37.4 t/s |
18.7 s cold 1.9 s warm |
|
|
on-demand | 23.8 t/s |
11.9 s cold 1.6 s warm |
|
|
loaded | 60.1 t/s | 85 ms |
System Status
Echtzeit-Übersicht der Infrastruktur.
Woher SmartLLM kommt
SmartLLM ist nicht am Reißbrett entstanden, sondern aus eigenem Bedarf. ALL Smart betreibt eigene Produkte, die auf Sprachmodellen laufen und dafür braucht es Inferenz, die verlässlich ist, in eigener Hand liegt und den europäischen Datenschutz nicht als Nachgedanken behandelt. Die Cloud erfüllt das zum Großteil nicht.
Also haben wir die Infrastruktur selbst gebaut: frei verfügbare Open-Weights-Modelle, gehostet auf eigener Hardware. Was als interne Lösung begann, ist ein Dienst geworden, den wir auch anderen gerne zur Verfügung stellen. Nicht nur als Dienst, auch als Beweis, dass wir in der Lage sind, das zu tun.
Was SmartLLM leistet
SmartLLM ist ein DSGVO-konformer Inferenzdienst. Die Modelle laufen auf eigener Hardware, nicht in einer fremden Cloud in irgendeinem Rechenzentrum. Kein Training auf Ihren Daten, keine Weitergabe, keine Blackbox in einem anderen Rechtsraum. Ein Ansprechpartner, der das Thema KI bis runter zur Hardware lebt.
Über ein einfaches Alias-System wählen Sie die passende Modellklasse, von schnell und günstig bis zur stärksten verfügbaren Stufe, ohne sich um die Technik dahinter kümmern zu müssen. Der Dienst ist dabei nicht theoretisch: Er trägt unsere eigenen produktiven Anwendungen im täglichen Betrieb. Was Sie hier nutzen, nutzen wir vor allem auch selbst.
Nicht das größte Modell, das richtige
Man greift viel zu schnell zum Spitzenmodell. Dabei braucht es das für die meisten Anwendungen, auch für unsere, gar nicht. Sauber gebaut reichen oft einfachere Open-Weights-Modelle und senken damit die Hürde, ab der ein KI-Projekt wirtschaftlich wird. Eine Anwendung so zu bauen, dass sie mit dem passenden statt dem teuersten Modell läuft, ist kein Kompromiss. Es ist Handwerk.
Was SmartLLM nicht ist
SmartLLM ist kein Billig-Massendienst und will es nicht sein. Der Preis ist bewusst so gesetzt, dass er Qualität vor Volumen stellt und auch unsere Kosten deckt. Wer die günstigste Inferenz für beliebige Zwecke sucht, ist woanders besser aufgehoben. Der Dienst soll vor allem Unternehmen die Hürde für erste eigene Entwicklungen senken, gemeinsam können wir sofort starten.
Und so weit Open-Weights-Modelle auf souveräner Hardware heute reichen, und sie reichen deutlich weiter, als die meisten annehmen: Die absolute Spitze proprietärer Frontier-Modelle bilden sie nicht in jedem Einzelfall ab. Wir sagen offen, wo die Grenze liegt, statt etwas zu versprechen, das der Dienst nicht hält.
Für wen SmartLLM gedacht ist
Für alle, denen Datenhoheit und Verlässlichkeit wichtiger sind als der niedrigste Preis und die europäischen Datenschutz nicht als Hürde verstehen, sondern als Grundlage für das eigene Tun. Für Unternehmen, die Sprachmodelle produktiv nutzen wollen, ohne ihre Daten aus der Hand zu geben und vielleicht sogar im Anschluss selbst Hardware hosten möchten, statt alles über die Cloud zuzukaufen. Und für alle, die für Beratung, Entwicklung und Inferenz einen kompetenten Ansprechpartner wollen.
SmartLLM entspricht unserem Leitbild
Wir möchten nicht mit Kunden über LLMs reden, wenn wir nicht in der Lage sind, diese selbst zu hosten. Wir möchten wissen, wie die Dinge konkret funktionieren. Bis zur Hardware. Wir möchten die Wärme spüren, die ein DGX Spark unter Volllast abgibt und auch den Schmerz, wenn eine Konfiguration falsch war und ein Dienst abschmiert. Beides befähigt uns dazu, unseren Kunden die Wege zu zeigen, die zum Ziel führen.
SmartLLM: fair und transparent
Ein Preis für alle Modelle. Keine versteckten Kosten. Keine Abonnements. Alle Preise netto zzgl. USt.