AI Model Ecosystem Center

Supports high-speed download of cutting-edge local models within the software

Supports dual-source local models from HuggingFace and ModelScope, as well as numerous domestic and international cloud model service providers

34+
Compatible with local lightweight models
100%
Privacy guaranteed, offline operation
35+
Mainstream cloud API integration
Capability Filter:
unslothHuggingFace

Qwen 3.5 0.8B (Chinese is better)

unsloth/Qwen3.5-0.8B-GGUF:UD-Q5_K_XL

Text
Parameters:0.8B
Size:579MB
Quantization:UD-Q5_K_XL
Context:128k
SpeedExtreme speed
QualityMedium

Extremely fast and lightweight text model, suitable for low-end and CPU environments, with balanced Chinese analysis performance.

#Lightweight#Support CPU operation#Ultra Fast#Text only
unslothHuggingFace

Qwen 3.5 0.8B (Lightweight image recognition)

unsloth/Qwen3.5-0.8B-GGUF:UD-Q6_K_XL

TextImage
Parameters:0.8B
Size:976MB
Context:128k
SpeedExtreme speed
QualityMedium

Extreme running speed, suitable for extremely low-configuration environments, and supports image analysis, which is less accurate.

#GPU extremely fast#Support CPU operation#Multimodal#Mini
AbirayHuggingFace

LFM2.5 2.6B(Prison Break)

Abiray/LFM2.5-2.6B-Heretic-Abliterated-GGUF:Q4_K_M

推荐
Text
Parameters:2.6B
Size:1.56GB
Quantization:Q4_K_M
Context:32k
SpeedVery Fast
QualityHigh

LFM2.5 2.6B is a delimited uncensored version, balancing speed and quality.

#To limit#No censorship#NSFW#Text only
UnslothHuggingFace

Gemma 4 E4B-it(Support audio)

unsloth/gemma-4-E4B-it-GGUF:Q4_K_S

推荐
TextImage Audio
Parameters:4B
Size:5.83GB
Quantization:Q4_K_S
Context:128k
SpeedFast
QualityHigh

Google's original quantified version, supporting text, image and audio analysis.

#Multimodal#Fast#Audio #English is better
mradermacherHuggingFace

Qwen 3.5 4B(Balance)

mradermacher/Qwen3.5-4B_Abliterated-GGUF:Q4_K_M

TextImage
Parameters:4B
Size:3.08GB
Quantization:Q4_K_M
Context:256k
SpeedFast
QualityHigh

Abliterated version balances speed and quality.

#To limit#No censorship#NSFW#Prison Break#Multimodal
mradermacherHuggingFace

Qwen 3.5 2B(Better)

mradermacher/Huihui-Qwen3.5-2B-abliterated-GGUF:Q8_0

TextImage
Parameters:2B
Size:2.68GB
Quantization:Q8_0
Context:256k
SpeedVery Fast
QualityUltra High

4G video memory is the first choice.

#To limit#No censorship#NSFW#Prison Break#Multimodal
tatsuyaaaaaaaHuggingFace

Qwen 3.5 2B(Japanese optimization)

tatsuyaaaaaaa/Qwen3.5-2B-gguf:Q4_0

Text
Parameters:2B
Size:1.2GB
Quantization:Q4_0
Context:128k
SpeedFast
QualityMedium

Text analysis model optimized for Japanese data sets, only supports text analysis.

#Japanese optimization#Text only#Low video memory
jordanwoodsonHuggingFace

Qwen 3.5 2B(Jailbreak text)

jordanwoodson/Qwen3.5-2B-heretic-GGUF:Q4_K_M

Text
Parameters:2B
Size:1.27GB
Quantization:Q4_K_M
Context:128k
SpeedFast
QualityHigh

A jailbreak model that has a certain understanding of the content.

#Prison Break#No censorship#NSFW#Text only
OpenBMBHuggingFace

MiniCPM-V 4.6 (Picture-reading small steel cannon)

ggml-org/MiniCPM-V-4.6-GGUF:Q4_K_M

推荐
TextImage
Parameters:0.8B
Size:1.17GB
Quantization:Q4_K_M
Context:32k
SpeedFast
QualityUltra High

The top end-side multi-modal model performs extremely well in OCR, object recognition, and complex scene understanding.

#Multimodal#Optical Character Recognition#Scene understanding#Top image recognition
unslothHuggingFace

Gemma 4 E2B-it QAT MTP(All-round - high speed)

unsloth/gemma-4-E2B-it-qat-MTP-GGUF:UD-Q4_K_XL

推荐
TextImage Audio
Parameters:2B
Size:3.71GB
Quantization:UD-Q4_K_XL
Context:128k
SpeedExtreme speed
QualityMedium

With full capabilities, plus MTP technology for speed, it is by far the best model to choose.

#Multimodal#Audio #QAT quantification#MoE#Very small video memory#English is better
GnLOLotHuggingFace

MiniCPM5 1B Claude微调(Thought chain)

GnLOLot/MiniCPM5-1B-Claude-Opus-Fable5-Thinking-GGUF:Q4_K_M

Text
Parameters:1B
Size:688MB
Quantization:Q4_K_M
Context:128k
SpeedExtreme speed
QualityUltra High

MiniCPM5-1B, which is fine-tuned based on the Claude Opus Fable5 data set, supports chain-of-thinking reasoning and is good at programming and instruction following.

#Fine-tuning optimization#Claude dataset#Thought chain#Programming optimization#Lightweight#Support CPU operation#Text only
owaoHuggingFace

Nanbeige 4.2 3B (beyond 9B)

owao/Nanbeige4.2-3B-GGUF:Q4_K_M

Text
Parameters:3B
Size:2.40GB
Quantization:Q4_K_M
Context:128k
SpeedFast
QualityMedium

3B body hard steel 9B, highly recommended, but only supports text.

#Prison Break#No censorship#NSFW#Text only
mradermacherHuggingFace

Nanbeige 4.2 3B(Jailbreak-Optimization)

mradermacher/Nanbeige4.2-3B-heretic-i1-GGUF:i1-Q5_K_M

推荐
Text
Parameters:3B
Size:2.78GB
Quantization:i1-Q5_K_M
Context:128k
SpeedFast
QualityHigh

3B body hard steel 9B, the jailbroken version of i1 has higher quantization accuracy, but only supports text.

#Prison Break#No censorship#NSFW#Text only#High precision
GoogleHuggingFace

Gemma 3 1B Instruct(基础)

unsloth/gemma-3-1b-it-GGUF:UD-Q4_K_XL

Text
Parameters:1B
Size:770MB
Quantization:UD-Q4_K_XL
Context:32k
SpeedExtreme speed
QualityMedium

English model leader

#Lightweight#Support CPU operation#Text only#English is better
gaston-parraviciniHuggingFace

LFM2.5 8B A1B(Prison Break)

gaston-parravicini/LFM2.5-8B-A1B-Uncensored-Gaston-GGUF:Q4_K_M

推荐
Text
Parameters:8B-A1B
Size:4.80GB
Quantization:Q4_K_M
Context:32k
SpeedVery Fast
QualityHigh

LFM2.5 8B A1B MoE Uncensored version, only 1B activation parameters, balanced speed and quality.

#MoE#No censorship#NSFW#Prison Break#Text only#English is better
dealignaiHuggingFace

Bonsai 27B 1-bit(Super compression)

dealignai/Bonsai-27b-1bit-CRACK-GGUF:Q1_0

TextImage
Parameters:27B
Size:5.21GB
Quantization:Q1_0
Context:128k
SpeedFast
QualityMedium

Bonsai 27B one-bit quantization jailbreak version, de-aligned and uncensored, supports text and image analysis.

#1-bit#Prison Break#No censorship#NSFW#Multimodal#Low video memory
JonathanColettiHuggingFace

Qwen 3.8 27B(The Strongest-Jailbreak)

JonathanColetti/Qwen3.8-27B-Uncensored-GGUF:Q4_K_M

TextImage
Parameters:27B
Size:16.52GB
Quantization:Q4_K_M
Context:128k
SpeedSlower
QualityHigh

Qwen3.8-27B is an uncensored quantitative version that retains MTP long predictions and supports text and image analysis.

#No censorship#Prison Break#NSFW#Multimodal#Large parameters#MTP
empero-aiHuggingFace

Qwen 3.8 2B(Distillation)

empero-ai/Qwen3.8-2B-Distill-GGUF:Q4_K_M

推荐
Text
Parameters:2B
Size:1.22GB
Quantization:Q4_K_M
Context:128k
SpeedExtreme speed
QualityHigh

Qwen3.8 Distilled Edition, ultra-fast performance, text analysis only.

#Distillation#Lightweight#Support CPU operation#Text only
empero-aiHuggingFace

Qwen 3.8 9B(Distillation)

empero-ai/Qwen3.8-9B-Distill-GGUF:Q4_K_M

推荐
Text
Parameters:9B
Size:5.38GB
Quantization:Q4_K_M
Context:128k
SpeedFast
QualityUltra High

Qwen3.8 Distilled Edition, inheriting deep reasoning capabilities from large models, text analysis only.

#Distillation#Reasoning#Text only#Fine-tuning optimization
ornith-aiHuggingFace

Ornith 1.5 9B(Top-tier)

ornith-ai/Ornith-1.5-9B-GGUF:Q4_K_M

推荐
TextImage
Parameters:9B
Size:6.24GB
Quantization:Q4_K_M
Context:128k
SpeedMedium
QualityUltra High

Ornith 1.5 Multimodal model, supports text and image analysis.

#Multimodal#Image recognition#English is better
XHTokenHuggingFace

Spark X2.5 1.7B(Lightweight)

XHToken/Spark-X2.5-1.7B-GGUF

Text
Parameters:1.7B
Size:3.19GB
Context:128k
SpeedFast
QualityMedium

Spark X2.5 1.7B 文本模型,轻量高效,仅支持文本分析。

#Lightweight#Support CPU operation#Text only

Ready to experience more powerful local AI file management?

No complex configuration needed. Firefly AI Folder supports a built-in engine and one-click model download, beginning your journey to intelligent and efficient organization.