auto-round
Optimize CPU RAM peak memory during quantization
#1386
Merged
Go
Login via GitHub
Home
Pricing
FAQ
Install
Login
via GitHub
Overview
Commits
78
Changes
View On
GitHub
Commits
Optimize CPU RAM peak memeory during quantization
lvliang-intel
committed
178 days ago
Merge branch 'main' into lvl/ram_usage_optimization
lvliang-intel
committed
177 days ago
rm duplicate args of the quantization extra config (#1334)
lvliang-intel
committed
177 days ago
fix --device_map cuda and xpu issue (#1383)
lvliang-intel
committed
177 days ago
[pre-commit.ci] auto fixes from pre-commit.com hooks
pre-commit-ci[bot]
committed
177 days ago
refine test case
lvliang-intel
committed
177 days ago
Disable replace `FP8Expert` (#1379)
lvliang-intel
committed
177 days ago
Support general MOE replacement for MOE models (Transformers 5.0 compatible) (#1374)
lvliang-intel
committed
177 days ago
fix cuda ut fail (#1370)
lvliang-intel
committed
177 days ago
[Regression] Detach scale tensor to prevent holding computation graph references (#1389)
lvliang-intel
committed
177 days ago
fix layer config (#1373)
lvliang-intel
committed
177 days ago
Merge branch 'main' into lvl/ram_usage_optimization
lvliang-intel
committed
177 days ago
update code for comments
lvliang-intel
committed
176 days ago
[pre-commit.ci] auto fixes from pre-commit.com hooks
pre-commit-ci[bot]
committed
171 days ago
support AutoScheme cpu ram optimization
lvliang-intel
committed
171 days ago
Merge branch 'main' into lvl/ram_usage_optimization
lvliang-intel
committed
171 days ago
Refactor evaluation in tests to use evaluate_accuracy function (#1402)
lvliang-intel
committed
154 days ago
fix bug in PR-1244 (#1422)
lvliang-intel
committed
154 days ago
remove require_intel_extension_for_pytorch and fix TypeError: unhashable type: 'set' (#1425)
lvliang-intel
committed
154 days ago
Fix cuda model ut [glm4][Molmo] (#1428)
lvliang-intel
committed
154 days ago
Update BackendInfos for AutoGPTQ based on transformer version and save g_idx for gptqmodel backend (#1429)
lvliang-intel
committed
154 days ago
fix CUDA CI (#1431)
lvliang-intel
committed
154 days ago
refine global scale calculation to blockwise (#1421)
lvliang-intel
committed
154 days ago
support GPTQ_FORMAT for "gptqmodel:exllamav2" backend (#1434)
lvliang-intel
committed
154 days ago
Update diffusion README (#1439)
lvliang-intel
committed
154 days ago
Enable new cpu test pool (#1435)
lvliang-intel
committed
154 days ago
Update auto-round-lib README.md (#1437)
lvliang-intel
committed
154 days ago
update logic for compatibility with gptqmodel:exllamav2 backend (#1438)
lvliang-intel
committed
154 days ago
update readme for Intel xpu usage (#1441)
lvliang-intel
committed
154 days ago
fix bug of evaluate_accuracy (#1430)
lvliang-intel
committed
154 days ago
bump version (#1445)
lvliang-intel
committed
154 days ago
Attach `act_max_hook` for FP8 model (#1447)
lvliang-intel
committed
154 days ago
[Regression] fix FP8_STATIC loading (#1452)
lvliang-intel
committed
154 days ago
Fix requirements packaging for source distribution (#1455)
lvliang-intel
committed
154 days ago
fix: preserve classmethod descriptor in from_pretrained monkey patch (#1460)
lvliang-intel
committed
154 days ago
Support load FP8 model on HPU (#1449)
lvliang-intel
committed
154 days ago
Update compatibility test and version to 0.10.2 (#1463)
lvliang-intel
committed
154 days ago
support multiple device evaluation for activation quantized model (#1394)
lvliang-intel
committed
154 days ago
Fix KeyError when GPU is missing from accelerate max_memory (#1457)
lvliang-intel
committed
154 days ago
support glm5 (#1466)
lvliang-intel
committed
154 days ago
Disable replace `FP8Expert` (#1379)
lvliang-intel
committed
154 days ago
fix layer config (#1373)
lvliang-intel
committed
154 days ago
update code for comments
lvliang-intel
committed
154 days ago
fix issue 1368
lvliang-intel
committed
154 days ago
Merge branch 'main' into lvl/ram_usage_optimization
lvliang-intel
committed
154 days ago
[pre-commit.ci] auto fixes from pre-commit.com hooks
pre-commit-ci[bot]
committed
154 days ago
refactor code according to comments
lvliang-intel
committed
150 days ago
[pre-commit.ci] auto fixes from pre-commit.com hooks
pre-commit-ci[bot]
committed
150 days ago
Merge branch 'main' into lvl/ram_usage_optimization
lvliang-intel
committed
150 days ago
refactor code according to comments
lvliang-intel
committed
150 days ago
[pre-commit.ci] auto fixes from pre-commit.com hooks
pre-commit-ci[bot]
committed
150 days ago
Merge branch 'main' into lvl/ram_usage_optimization
lvliang-intel
committed
150 days ago
Grep core dumped issue in UT test (#1484)
lvliang-intel
committed
149 days ago
gguf better support for transformers5.0 and fix bug of Qwen3Next (#1474)
lvliang-intel
committed
149 days ago
Optimize CPU RAM peak memeory during quantization
lvliang-intel
committed
149 days ago
Support general MOE replacement for MOE models (Transformers 5.0 compatible) (#1374)
lvliang-intel
committed
149 days ago
fix cuda ut fail (#1370)
lvliang-intel
committed
149 days ago
update code for comments
lvliang-intel
committed
149 days ago
Update BackendInfos for AutoGPTQ based on transformer version and save g_idx for gptqmodel backend (#1429)
lvliang-intel
committed
149 days ago
refactor code according to comments
lvliang-intel
committed
149 days ago
refine code
lvliang-intel
committed
149 days ago
[pre-commit.ci] auto fixes from pre-commit.com hooks
pre-commit-ci[bot]
committed
149 days ago
Merge branch 'main' into lvl/ram_usage_optimization
lvliang-intel
committed
149 days ago
fix merge issue
lvliang-intel
committed
149 days ago
fix merge issue
lvliang-intel
committed
149 days ago
[pre-commit.ci] auto fixes from pre-commit.com hooks
pre-commit-ci[bot]
committed
149 days ago
Merge branch 'lvl/ram_usage_optimization' of https://github.com/intel/auto-round into lvl/ram_usage_optimization
lvliang-intel
committed
149 days ago
fix ci issues
lvliang-intel
committed
149 days ago
refactor offload manager
lvliang-intel
committed
148 days ago
[pre-commit.ci] auto fixes from pre-commit.com hooks
pre-commit-ci[bot]
committed
148 days ago
Merge branch 'main' into lvl/ram_usage_optimization
lvliang-intel
committed
148 days ago
Update base.py
lvliang-intel
committed
148 days ago
update code for comments
lvliang-intel
committed
148 days ago
Merge branch 'main' into lvl/ram_usage_optimization
lvliang-intel
committed
148 days ago
[pre-commit.ci] auto fixes from pre-commit.com hooks
pre-commit-ci[bot]
committed
148 days ago
fix ci issues
lvliang-intel
committed
148 days ago
Merge branch 'main' into lvl/ram_usage_optimization
lvliang-intel
committed
148 days ago
Merge branch 'main' of https://github.com/intel/auto-round into lvl/ram_usage_optimization
lvliang-intel
committed
142 days ago
Loading