auto-round
Optimize CPU RAM peak memory during quantization
#1386
Merged

Commits
  • Optimize CPU RAM peak memeory during quantization
    lvliang-intel committed 178 days ago
  • Merge branch 'main' into lvl/ram_usage_optimization
    lvliang-intel committed 177 days ago
  • rm duplicate args of the quantization extra config (#1334)
    lvliang-intel committed 177 days ago
  • fix --device_map cuda and xpu issue (#1383)
    lvliang-intel committed 177 days ago
  • [pre-commit.ci] auto fixes from pre-commit.com hooks
    pre-commit-ci[bot] committed 177 days ago
  • refine test case
    lvliang-intel committed 177 days ago
  • Disable replace `FP8Expert` (#1379)
    lvliang-intel committed 177 days ago
  • Support general MOE replacement for MOE models (Transformers 5.0 compatible) (#1374)
    lvliang-intel committed 177 days ago
  • fix cuda ut fail (#1370)
    lvliang-intel committed 177 days ago
  • [Regression] Detach scale tensor to prevent holding computation graph references (#1389)
    lvliang-intel committed 177 days ago
  • fix layer config (#1373)
    lvliang-intel committed 177 days ago
  • Merge branch 'main' into lvl/ram_usage_optimization
    lvliang-intel committed 177 days ago
  • update code for comments
    lvliang-intel committed 176 days ago
  • [pre-commit.ci] auto fixes from pre-commit.com hooks
    pre-commit-ci[bot] committed 171 days ago
  • support AutoScheme cpu ram optimization
    lvliang-intel committed 171 days ago
  • Merge branch 'main' into lvl/ram_usage_optimization
    lvliang-intel committed 171 days ago
  • Refactor evaluation in tests to use evaluate_accuracy function (#1402)
    lvliang-intel committed 154 days ago
  • fix bug in PR-1244 (#1422)
    lvliang-intel committed 154 days ago
  • remove require_intel_extension_for_pytorch and fix TypeError: unhashable type: 'set' (#1425)
    lvliang-intel committed 154 days ago
  • Fix cuda model ut [glm4][Molmo] (#1428)
    lvliang-intel committed 154 days ago
  • Update BackendInfos for AutoGPTQ based on transformer version and save g_idx for gptqmodel backend (#1429)
    lvliang-intel committed 154 days ago
  • fix CUDA CI (#1431)
    lvliang-intel committed 154 days ago
  • refine global scale calculation to blockwise (#1421)
    lvliang-intel committed 154 days ago
  • support GPTQ_FORMAT for "gptqmodel:exllamav2" backend (#1434)
    lvliang-intel committed 154 days ago
  • Update diffusion README (#1439)
    lvliang-intel committed 154 days ago
  • Enable new cpu test pool (#1435)
    lvliang-intel committed 154 days ago
  • Update auto-round-lib README.md (#1437)
    lvliang-intel committed 154 days ago
  • update logic for compatibility with gptqmodel:exllamav2 backend (#1438)
    lvliang-intel committed 154 days ago
  • update readme for Intel xpu usage (#1441)
    lvliang-intel committed 154 days ago
  • fix bug of evaluate_accuracy (#1430)
    lvliang-intel committed 154 days ago
  • bump version (#1445)
    lvliang-intel committed 154 days ago
  • Attach `act_max_hook` for FP8 model (#1447)
    lvliang-intel committed 154 days ago
  • [Regression] fix FP8_STATIC loading (#1452)
    lvliang-intel committed 154 days ago
  • Fix requirements packaging for source distribution (#1455)
    lvliang-intel committed 154 days ago
  • fix: preserve classmethod descriptor in from_pretrained monkey patch (#1460)
    lvliang-intel committed 154 days ago
  • Support load FP8 model on HPU (#1449)
    lvliang-intel committed 154 days ago
  • Update compatibility test and version to 0.10.2 (#1463)
    lvliang-intel committed 154 days ago
  • support multiple device evaluation for activation quantized model (#1394)
    lvliang-intel committed 154 days ago
  • Fix KeyError when GPU is missing from accelerate max_memory (#1457)
    lvliang-intel committed 154 days ago
  • support glm5 (#1466)
    lvliang-intel committed 154 days ago
  • Disable replace `FP8Expert` (#1379)
    lvliang-intel committed 154 days ago
  • fix layer config (#1373)
    lvliang-intel committed 154 days ago
  • update code for comments
    lvliang-intel committed 154 days ago
  • fix issue 1368
    lvliang-intel committed 154 days ago
  • Merge branch 'main' into lvl/ram_usage_optimization
    lvliang-intel committed 154 days ago
  • [pre-commit.ci] auto fixes from pre-commit.com hooks
    pre-commit-ci[bot] committed 154 days ago
  • refactor code according to comments
    lvliang-intel committed 150 days ago
  • [pre-commit.ci] auto fixes from pre-commit.com hooks
    pre-commit-ci[bot] committed 150 days ago
  • Merge branch 'main' into lvl/ram_usage_optimization
    lvliang-intel committed 150 days ago
  • refactor code according to comments
    lvliang-intel committed 150 days ago
  • [pre-commit.ci] auto fixes from pre-commit.com hooks
    pre-commit-ci[bot] committed 150 days ago
  • Merge branch 'main' into lvl/ram_usage_optimization
    lvliang-intel committed 150 days ago
  • Grep core dumped issue in UT test (#1484)
    lvliang-intel committed 149 days ago
  • gguf better support for transformers5.0 and fix bug of Qwen3Next (#1474)
    lvliang-intel committed 149 days ago
  • Optimize CPU RAM peak memeory during quantization
    lvliang-intel committed 149 days ago
  • Support general MOE replacement for MOE models (Transformers 5.0 compatible) (#1374)
    lvliang-intel committed 149 days ago
  • fix cuda ut fail (#1370)
    lvliang-intel committed 149 days ago
  • update code for comments
    lvliang-intel committed 149 days ago
  • Update BackendInfos for AutoGPTQ based on transformer version and save g_idx for gptqmodel backend (#1429)
    lvliang-intel committed 149 days ago
  • refactor code according to comments
    lvliang-intel committed 149 days ago
  • refine code
    lvliang-intel committed 149 days ago
  • [pre-commit.ci] auto fixes from pre-commit.com hooks
    pre-commit-ci[bot] committed 149 days ago
  • Merge branch 'main' into lvl/ram_usage_optimization
    lvliang-intel committed 149 days ago
  • fix merge issue
    lvliang-intel committed 149 days ago
  • fix merge issue
    lvliang-intel committed 149 days ago
  • [pre-commit.ci] auto fixes from pre-commit.com hooks
    pre-commit-ci[bot] committed 149 days ago
  • Merge branch 'lvl/ram_usage_optimization' of https://github.com/intel/auto-round into lvl/ram_usage_optimization
    lvliang-intel committed 149 days ago
  • fix ci issues
    lvliang-intel committed 149 days ago
  • refactor offload manager
    lvliang-intel committed 148 days ago
  • [pre-commit.ci] auto fixes from pre-commit.com hooks
    pre-commit-ci[bot] committed 148 days ago
  • Merge branch 'main' into lvl/ram_usage_optimization
    lvliang-intel committed 148 days ago
  • Update base.py
    lvliang-intel committed 148 days ago
  • update code for comments
    lvliang-intel committed 148 days ago
  • Merge branch 'main' into lvl/ram_usage_optimization
    lvliang-intel committed 148 days ago
  • [pre-commit.ci] auto fixes from pre-commit.com hooks
    pre-commit-ci[bot] committed 148 days ago
  • fix ci issues
    lvliang-intel committed 148 days ago
  • Merge branch 'main' into lvl/ram_usage_optimization
    lvliang-intel committed 148 days ago
  • Merge branch 'main' of https://github.com/intel/auto-round into lvl/ram_usage_optimization
    lvliang-intel committed 142 days ago
Loading