AI 모델 5월 18일
공정한 결과, 편향된 내부: LLM의 고위험 결정을 위한 인과력과 불균형의 잠재력
대규모 언어 모델(LLM)은 고위험 결정을 위한 행동적 공정성을 나타내지만, 내부 표현에서 편향된 연관성을 유지한다. 이러한 억제된 표현이 모델 출력에 영향을 미칠 수 있는지, 이러한 인과력의 균형이 인구 집단 간에 어떻게 균일하게 적용되는지 여부는 알려져 있지 않다. 우리는-mortgage-underwriting을 위한 open-weight 모델을 사용하여, 유사한 응용 프로그램만이 인종과 관련된 이름만 다를 때, 유의미한 불일치를 발견한다. 모델은 출력 수준에서 편향이 없지만, 모델 레이어를 통해 인구 집단에 대한 표현을 유지하고 증폭한다. 활성화 조정 및 새로운 상위 레이어 간의 개입을 통해, 우리는 이러한 억제된 정보가 결정을 결정적이기 때문에, 비판적 레이어에서 재인입했을 때, 거의 완전한 결정 역전을 생산한다. 중요한 것은, 이러한 잠재적 편향이 불균형적이라는 점이다 - 중재적 개입이 한 인구 집단의 방향으로 결정을 변경시키지만, 반대 방향으로는 거의 영향을 미치지 않는다. 또한, 이 잠재적 편향은 적극적인 지시어 설계 및 매개 변수 효율적인 미세 조정에 취약하다. 이러한 발견은, 행동적 감사에 대한 집중이 출력 수준에서만 충분하지 않다는 것을 보여준다. 공정한 출력은 내부 편향을 추출할 수 있는 잠재적이다. 또한, 고위험 결정을 위한 AI 관리에 대한 이중 레이어 테스트 프레임워크를 조합한 출력 평가와 표현 분석을 동시에 하다.