Svmuu 소식: OpenAI 엔지니어링 팀은 최근 일부 동료들에게 회사가 AI 모델의 ‘추론(inference)’ 비용을 절반 이상 절감할 수 있는 새로운 시스템 최적화 방법을 찾아냈다고 밝혔다. 추론 비용이란 모델이 실제로 실행되어 사용자 요청에 응답할 때 소모되는 컴퓨팅 자원 비용을 의미한다. 이번 최적화는 주로 기존 서버 자원 활용 효율을 높인 데서 비롯된 것이며, 새로운 연산 칩 도입에 의존한 것은 아니다. 이러한 진전은 AI 기업들이 연산 자원을 지속적으로 확보하기 위해 경쟁하는 동시에, 소프트웨어 및 시스템 수준의 최적화를 통해 기존 인프라의 활용 효율을 높여 급속히 증가하는 모델 운영 비용 부담을 완화하고 있음을 반영한다. (The Information)