GitHub - Pranshu-Bahadur/4Bit-Forge: big llm become smol using CUDA

This repo builds upon the solid foundation laid in MoE-Quant. Thank you for your amazing work!

Supports: MiniMax M2.1, DeepSeek V3.2, Qwen3, (Prolly more models) (technicallly kimi k2 as well, but need multigpu support to confirm / downcasting Hessians / dispatch solver kernel)

Runs GPTQ quantization on a Single A100...and its like supa fast...!

Unpacks model weights accordingly (fp8, uint8, packed int32, using checkpoint model's scales etc -> fp16/bf16) instead of neaively just setting weights to fp16/bf16.

Note: Still...WIP..

Todo(s):

Name		Name	Last commit message	Last commit date
Latest commit History 917 Commits
assets		assets
examples		examples
forge		forge
.gitignore		.gitignore
LICENSE		LICENSE
README.md		README.md
fused_moe.v6.blueprints.txt		fused_moe.v6.blueprints.txt
fused_moe.v6.contract.md		fused_moe.v6.contract.md
fused_moe.v6.schematics.txt		fused_moe.v6.schematics.txt
pack_quantized.py		pack_quantized.py
pack_sparse14int4sym.py		pack_sparse14int4sym.py
quant.py		quant.py
sparse14_gemm.py		sparse14_gemm.py

Provide feedback

Saved searches

Use saved searches to filter your results more quickly

Repository files navigation

About

Uh oh!

Releases

Packages

Uh oh!

Contributors

Uh oh!

Languages

Folders and files

Latest commit

History

Repository files navigation

About

Resources

License

Uh oh!

Stars

Watchers

Forks

Releases

Packages 0

Uh oh!

Contributors

Uh oh!

Languages

Packages