4 hours agoStructured sparsity patterns that survive quantizationGoogle Research Blog · T1AI#efficiency#inference◆AI generated55◀
5 days agoOpenAI cuts API inference prices again as serving costs fall below training for the first timeOpenAI News · T1Models & Training#llm#efficiency#inference◆AI generated52◀
5 days agoGoogle details how it squeezed 40% more tokens per dollar out of serving fleetsGoogle Research Blog · T1Models & Training#llm#efficiency#inference◆AI generated52◀