Open-weight & owned stack · Quantization efficiency
FAMPWQ proposes adaptive mixed-precision LLM quantization
FAMPWQ proposed Fisher-information-based mixed-precision weight quantization to reduce inference resources on constrained devices.
Read the original at awesomepapers.ioOpens the publisher's site in a new tab