대규모 언어 모델의 프롬프트 엔지니어링 및 컨텍스트 엔지니어링 기법에 대한 종합적 고찰
Tonmoy Debnath
a
, Md Nurul Absar Siddiky
b,1
, Muhammad Enayetur Rahman
c,1
,
Prosenjit Das
d
, Antu Kumar Guha
d
, Muhammad Rezaur Rahman
e
, H.M. Dipu Kabir
f,*
✉
a
컴퓨터 과학 및 기술, Mymensingh Polytechnic Institute, Mymensingh, 2200, 방글라데시
b
전기 및 컴퓨터 공학, University of Hawaii at Manoa, Honolulu, HI 96822, 미국
c
전기 및 컴퓨터 공학, Old Dominion University, Norfolk, VA 23509, 미국
d
전자 및 통신 공학 학부, Khulna University, Khulna, 9208, 방글라데시
e
연구 및 혁신 부서, Agile Crafts, Khilgaon, Dhaka, 1219, 방글라데시
f
인공지능 및 사이버 미래 연구소, Charles Sturt University, Bathurst, NSW, 2795, 오스트레일리아
논문 정보
키워드:
프롬프트 엔지니어링
컨텍스트 엔지니어링
대규모 언어 모델
체계적 문헌 검토
자연어 처리
AI 신뢰성
초록
대규모 언어 모델(LLM)의 급속한 발전은 인공지능이 복잡한 문제를 해결할 수 있게 했다. 그러나 그 성능은 여전히 입력의 구성과 컨텍스트 관리에 매우 민감하다. 프롬프트 엔지니어링의 핵심적 역할에도 불구하고, 이는 표준화된 이론적 틀이 없는 경험적이고 임시방편적인 관행으로 흔히 다루어지며, 그 결과 출력 불일치, 프롬프트 민감성, 환각과 같은 문제가 발생한다. 본 연구는 프롬프트 및 컨텍스트 엔지니어링 기법에 대한 포괄적인 체계적 문헌 검토를 제시하여, 단편화된 패러다임을 일관된 분석 틀로 통합한다. 제로샷 및 퓨샷 학습과 같은 기초적 접근법을 비롯해 사고 사슬(Chain-of-Thought, CoT), 검색 증강 생성(Retrieval-Augmented Generation, RAG), 다단계 추론 아키텍처(예: Tree-of-Thoughts, Graph-of-Thoughts)를 포함하는 고급 전략을 분류하는, 프롬프트의 전체 생명주기를 아우르는 구조화된 분류 체계를 제시한다. 또한 서로 다른 LLM 아키텍처에서 이러한 기법을 비판적으로 평가하며, 환각 완화, 사실 일관성 보장, 인간 의도에 부합하는 출력 생성에서의 효과를 강조한다. 입력 수준의 언어적 제어에서 시스템 수준의 컨텍스트 조율로의 전환을 분석함으로써, 컨텍스트 희석 및 계산 오버헤드와 같은 지속적인 한계를 식별한다. 마지막으로 자동화된 프롬프트 최적화, 신뢰성 인지형 프롬프팅, 에이전트 시스템에서 부상하는 연구 경로를 개괄한다. 이 조사는 견고하고 해석 가능하며 도메인 적응적인 AI 시스템을 구축하고자 하는 연구자와 실무자를 위한 기초 참고 자료이자 의사결정 프레임워크 역할을 한다.
1. 서론
대규모 언어 모델(LLM)의 등장은 인공지능에 혁신을 가져왔으며, 자연어 이해, 추론, 텍스트 생성에서 상당한 진전을 이끌었다 [1–4]. GPT, PaLM, LLaMA와 같은 모델은 자동화된 콘텐츠 제작, 의사결정, 과학적 발견을 비롯한 다양한 응용 분야에서 뛰어난 역량을 보여 주었다 [5–11]. 그러나 이들의 성능은 프롬프트를 제시하는 방식에 민감하므로, 프롬프트 엔지니어링은 출력 품질을 최적화하는 핵심 요소가 된다 [12–16]. 그 중요성에도 불구하고 프롬프트 엔지니어링은 효과적인 프롬프트 설계를 위한 표준화된 프레임워크 없이 여전히 경험적이다 [17–19]. 이러한
체계적 방법론의 부족은 작업 전반에서 일관되지 않은 출력, 환각, 차선의 일반화와 같은 문제를 초래했다 [20–22].
프롬프트 엔지니어링은 입력 질의를 신중하게 설계하여 AI 모델의 효과를 향상하는 핵심 기법이다. 모호하거나 일반적인 프롬프트를 제공하는 대신, 잘 구조화되고 컨텍스트가 풍부한 프롬프트는 AI가 더 정확하고 관련성 높으며 상세한 응답을 생성하도록 돕는다 [23]. 이 과정에는 표현을 다듬고, 제약 조건을 추가하며, 원하는 형식이나 스타일을 지정하는 일이 포함된다.
프롬프트 엔지니어링과 컨텍스트 엔지니어링은 챗봇, 콘텐츠 생성, 의사결정과 같은 AI 응용 분야에서 널리 사용된다
* 교신 저자.
이메일 주소:
[email protected]
(H.M.D. Kabir).
1
이 저자들은 본 연구에 동등하게 기여했다.
Fig. 1.
예시 이미지를 사용한 기본 프롬프트와 엔지니어링된 프롬프트의 비교.
이 이미지들은 AI를 사용하여 생성했다.
사슴 사진을 요청하면 이미지는 단순하고 그다지 매력적이지 않다(a). 주변 환경에 관한 세부 정보를 더 제공하면 이미지가 더 좋아 보인다(b). 사슴의 종류, 활동, 주변 환경에 대한 정보를 제공하면 생성된 이미지가 요구 사항을 충족한다(c).
시스템에서 사용자 의도와의 더 나은 정합성을 보장한다 [24,25]. 프롬프트를 최적화함으로써 사용자는 모호성을 줄이고, 출력 품질을 개선하며, AI 모델로부터 더 구조화되고 의미 있는 응답을 얻을 수 있다.
많은 개념은 장소에 따라 다르다. AI의 개발과 훈련에는 흔히 편향이 포함된다. 인도 아대륙과 세계 다른 지역에서 흔한 사슴의 종류는 동일하지 않다. AI에게 사슴 사진을 요청하면 Fig. 1(a)에 제시된 사슴 사진을 생성하는데, 이는 사용자에게 매력적이지 않을 수 있다. 주변 환경에 관한 세부 정보를 더 원하면, AI는 Fig. 1(b)에 제시된 것처럼 세계 여러 지역에서 흔하지 않은 주변 환경도 생성한다. Fig. 1(c)에 제시된 전형적인 인도 지역의 사슴 사진을 생성하기 위해 주변 환경, 사슴의 종류, 사슴의 활동에 관한 모든 세부 정보를 제공한다. 이러한 사진은 광고 및 교육 자료를 개발하는 데 사용할 수 있으며 인도 아대륙의 대부분 사람들에게 매력적일 것이다.
Fig. 2에 나타난 바와 같이, 기본 프롬프트는 흔히 모호하고 비구조화된 AI 응답을 낳는 반면, 엔지니어링된 프롬프트는 잘 구조화되고 의미 있는 출력을 제공한다. 프롬프트 엔지니어링은 모델의 정확성, 일관성, 사실적 일관성을 개선하기 위해 프롬프트 구성 방식을 다듬는 것을 목표로 한다 [26]. 선행 연구는 제로샷, 퓨샷, 사고 사슬 프롬프팅 기법을 탐색했으며, 각각은 다양한 맥락에서 고유한 이점을 제공한다 [2,27]. 그러나 기존 연구는 통합된 이론적 프레임워크를 확립하거나 서로 다른 LLM 아키텍처에 걸쳐 프롬프팅 방법을 벤치마킹하지 않은 채 주로 임시방편적 전략에 초점을 맞춘다 [28]. 또한 많은 프롬프팅 기법은 표현의 미세한 변형에 취약하여 신뢰성 및 편향과 같은 문제로 인해 실제 환경에서의 배포를 어렵게 만든다 [29–31].
Fig. 2.
프롬프트 엔지니어링의 필요성을 보여 주는 기본 프롬프트와 엔지니어링된 프롬프트의 비교.
대규모 언어 모델(LLM)의 최근 발전은 모델 성능이 프롬프트의 표현뿐만 아니라 컨텍스트 정보가 모델의 컨텍스트 윈도 내에서 어떻게 구성되고, 순서화되고, 추출되고, 보존되는지에도 좌우된다는 점을 보여 주었다. 일반적으로
컨텍스트 엔지니어링
이라고 하는 이 새로운 패러다임은 즉각적인 지시 사항에만 초점을 맞추는 대신 LLM에 제공되는 전체 컨텍스트 환경의 체계적 설계를 포함함으로써 전통적인 프롬프트 엔지니어링을 확장한다.
컨텍스트 엔지니어링은 동적 컨텍스트 구성, 검색 증강 생성(RAG), 메모리 통합, 도구 기반 근거화, 장문 컨텍스트 최적화와 같은 방법을 포함하는 패러다임으로 볼 수 있다. 선행 연구는 대규모 언어 모델이 컨텍스트 정보의 위치와 순서 모두에 강한 민감성을 보이며, 긴 입력 시퀀스 내에 필요한 정보가 부적절하게 배치될 경우 성능이 저하될 수 있음을 확인했다 [32].
1.1. 인간 참여형 설계
인간 피드백은 정합성을 개선하고 바람직하지 않은 출력을 줄인다. 인간 선호로부터의 강화 학습은 대규모 언어 모델의 정렬에 효과적임이 입증되었다 [33,34]. 그러나 확장성과 주석자 편향은 여전히 과제이다.
1.2. 보안 고려 사항
프롬프트 인젝션 공격은 적대적 지시문을 삽입하여 지시 수행 행동을 조작한다 [35–37]. 이러한 취약성은 배포 중 입력 정제와 계층적 지시 강제의 필요성을 부각한다 [38,39].
검색 증강 생성(RAG)은 매우 영향력이 큰 것으로 입증된 컨텍스트 엔지니어링 접근법 중 하나로, 컨텍스트 외부의 지식 소스를 선택적으로 검색하고 생성 작업 중 이를 모델의 컨텍스트에 주입하는 것을 포함한다 [40]. 검색된 문서에 조건화된 생성을 통합함으로써 환각이 줄어들고, 특히 지식 집약적 응용 분야에서 사실적 일관성이 향상된다. 후속 연구는 최적의 청킹, 순위화, 압축이
Table 1
LLM 시스템에서 프롬프트 엔지니어링과 컨텍스트 엔지니어링의 개념적 비교.
|
분류 차원
|
프롬프트 엔지니어링
|
컨텍스트 엔지니어링
|
|
개념적 정의
|
모델 행동을 유도하기 위한 언어적 지침의 설계
|
전체 맥락 환경의 체계적 구축 및 조율
|
|
주요 목표
|
더 나은 프롬프트 구성으로 출력 품질 향상
|
맥락 제어를 통해 신뢰성, 근거성 및 일관성 향상
|
|
제어 수준
|
입력 수준 제어
|
시스템 수준 제어
|
|
영향 범위
|
단일 프롬프트 또는 질의
|
전체 상호작용 수명주기
|
|
설계 단위
|
프롬프트 텍스트(지침, 역할, 예시)
|
맥락 묶음(프롬프트, 검색된 지식, 메모리, 도구, 정책)
|
|
시간적 범위
|
단일 턴 또는 짧은 다중 턴
|
장기적이고 지속적인 상호작용
|
|
상태성
|
기본적으로 무상태
|
상태 유지형 또는 의사 상태 유지형
|
|
지식 출처
|
암묵적(모델 내부 지식)
|
명시적(외부 문서, 데이터베이스, 도구)
|
|
정보 흐름
|
입력에서 출력으로의 직접 매핑
|
검색, 메모리 및 추론 계층을 통해 매개됨
|
|
시스템 아키텍처와의 결합도
|
약함; 대체로 모델 독립적
|
강함; 시스템 파이프라인 설계에 의존
|
|
확장성
|
복잡한 작업에는 제한적
|
복잡한 다단계 작업을 위해 설계됨
|
|
견고성 메커니즘
|
프롬프트 개선 및 재표현
|
검색 기반 근거화, 검증 및 메모리
|
|
최적화 초점
|
언어적 명확성 및 지침의 정밀성
|
맥락 관련성, 순서 및 밀도
|
|
평가 수준
|
프롬프트-출력 수준
|
엔드투엔드 시스템 동작
|
|
일반적인 실패 모드
|
프롬프트 민감성, 모호성, 환각
|
맥락 희석, 검색 잡음, 컨텍스트 윈도우 포화
|
|
대표 기법
|
제로샷, 퓨샷, CoT, 역할 프롬프팅
|
RAG, ReAct, 메모리 증강 모델, 에이전트 기반 시스템
|
|
주요 연구 관점
|
인간-모델 상호작용
|
AI 시스템 아키텍처 및 정보 관리
|
장문 맥락 환경에서 이 접근법의 효과를 극대화하는 데 핵심적이다 [41].
컨텍스트 엔지니어링의 두 번째 중요한 측면은 추론을 인식하는 맥락 구조화이다. Chain-of-Thought 프롬프팅 [2], 추론과 행동을 결합하는 ReAct 프레임워크 [42], 자기 정제 전략 [43]과 같은 방법은 중간 추론 단계의 기록을 맥락에 포함하면 모델 출력의 견고성과 설명 가능성이 크게 향상됨을 보여준다. 이는 추론의 품질이 중간 상태가 맥락 내에서 어떻게 표현되는지와 직접적으로 연결되어 있음을 강조한다.
또한 장문 맥락 언어 모델에 관한 최근 연구는 관련성과 정보 밀도가 적절히 관리되지 않으면 단순히 맥락 길이를 늘리는 것만으로는 반드시 성능 향상으로 이어지지 않음을 보여주었다 [44]. 이는 맥락 희석을 방지하고 중요한 정보가 효과적으로 영향을 미치도록 보장하는 데 컨텍스트 엔지니어링이 수행하는 핵심적 역할을 부각한다.
요약하면, 컨텍스트 엔지니어링은 프롬프트 중심 설계에서 총체적인 맥락 최적화로의 체계적 전환을 의미한다. LLM이 맥락 길이와 애플리케이션 복잡성 측면에서 계속 확장됨에 따라, 효과적인 컨텍스트 엔지니어링은 신뢰할 수 있고 제어 가능하며 도메인 적응적인 AI 시스템을 구축하기 위한 기반 구성 요소가 될 것으로 기대된다.
표 1은 프롬프트 엔지니어링과 컨텍스트 엔지니어링 간의 개념적·방법론적 차이를 요약하며, 입력 수준의 언어적 제어에서 시스템 수준의 맥락 조율로의 전환을 강조한다.
프롬프트 엔지니어링 방법론에 대한 포괄적 분석은 기존 프롬프팅 기법의 분류 체계와 그것이 모델 견고성, 일반화 및 해석 가능성에 미치는 영향을 포괄한다 [45,46]. 제로샷 및 퓨샷 학습과 같은 기본 프롬프팅 패러다임은 검색 증강 생성, 자기 일관성 프롬프팅, tree-of-thought와 같은 다단계 추론 프레임워크를 포함하는 고급 전략과 함께 폭넓게 논의된다.
graph-of-thought 프롬프팅 [47,48]. 또한 프롬프트 민감성, 특히 생성된 응답에 대한 미세한 구문적·의미적 변이의 영향과 신뢰성 및 일관성을 개선하기 위해 프롬프트 변동을 완화하는 접근법에도 상당한 관심이 기울여진다 [45,49]. 이와 더불어, 생성된 출력의 사실적 일관성, 신뢰성 및 윤리적 중립성을 향상하기 위해 환각 감소와 편향 완화는 여전히 중요한 연구 방향이다 [20,21,50,51]. 새롭게 부상하는 연구 동향은 다양한 애플리케이션 도메인 전반의 적응성과 성능을 강화하기 위해 강화학습, 메타학습 및 적대적 견고성 기법을 통한 자동화된 프롬프트 최적화를 추가로 탐구한다 [52,53].
대부분의 상황에서 LLM만으로는 관련성 있고 정확하며 최신의 결과를 제공하기에 충분하지 않다. 그림 3은 사용자 의도와 프롬프트 설계부터 AI 처리 및 최적화된 출력에 이르는 LLM 기반 챗봇의 단계별 작업 과정 예시를 나타낸다. LLM과 벡터 데이터베이스는 프롬프트 엔지니어링에서 널리 쓰이는 두 용어이다. 벡터 데이터베이스는 프롬프트 엔지니어와 정보 탐색자가 질의를 수행하는 데 도움을 준다. 유사한 이미지를 관찰하거나 특정 속성을 지닌 이미지를 찾으려면 벡터 데이터베이스 없이는 많은 연산이 필요하다. 벡터 데이터베이스의 이미지는 그 속성과 함께 저장된다. 속성에는 해당 이미지의 객체와 이미지 속 모든 객체의 외관상 상태가 포함될 수 있다. 그 밖에도 많은 정보가 있을 수 있다. 벡터에는…
기존 설문 연구는 프롬프트 엔지니어링을 단편적으로 다루는 반면, 본 연구는 전체 프롬프트 수명주기를 아우르는 원칙적이고 질문 주도적인 분류 체계를 제시한다. 개별 프롬프팅 패러다임에 초점을 맞춘 기존 검토와 달리, 본 설문은 단일 분석 프레임워크 내에서 추론, 계획, 검색, 상호작용 및 최적화 기반 프롬프팅을 통합한다. 표 2와 3에 제시된 비교는
그림 3. LLM 기반 챗봇의 단계별 작업 과정 예시.
표 2
기존 프롬프트 엔지니어링 설문조사의 비교.
|
설문조사 / 연구
|
범위
|
분류 체계 유형
|
평가
|
자동화
|
견고성 / 신뢰성
|
응용 지침
|
|
대규모 언어 모델을 위한 프롬프트 엔지니어링 [56]
|
광범위
|
기법 기반
|
제한적
|
아니요
|
제한적
|
제한적
|
|
LLM을 위한 증거 기반 지침을 활용한 일관성 및 신뢰성 측면의 프롬프트 엔지니어링 [57]
|
신뢰성 중심
|
지침 기반
|
예
|
아니요
|
예
|
제한적
|
|
프롬프트 엔지니어에게 프롬프트 엔지니어링하기 [58]
|
메타 프롬프팅
|
최적화 기반
|
제한적
|
예
|
아니요
|
아니요
|
|
프롬프트 엔지니어링 탐색: SWOT 분석을 포함한 체계적 문헌고찰 [59]
|
광범위
|
SWOT 기반 / 주제별
|
제한적
|
아니요
|
제한적
|
제한적
|
|
고등교육에서의 프롬프트 엔지니어링: 교육과정 수립에 기여하기 위한 체계적 문헌고찰 [60]
|
교육 특화
|
응용 중심 / 교육학적
|
제한적
|
아니요
|
제한적
|
예
|
|
대규모 언어 모델의 프롬프트 엔지니어링에 대한 체계적 조사: 기법과 응용 [61]
|
광범위
|
기법 기반
|
제한적
|
아니요
|
제한적
|
예
|
|
개인정보 보호 프롬프트 엔지니어링: 설문조사 [62]
|
개인정보 보호 중심
|
지침 기반 / 주제별
|
제한적
|
아니요
|
예
|
제한적
|
|
대규모 언어 모델을 위한 프롬프트 엔지니어링의 잠재력 발휘 [63]
|
광범위
|
서술적 / 기술적
|
예
|
제한적
|
예
|
제한적
|
|
소프트웨어 엔지니어링에서 프롬프트 엔지니어링 패러다임의 잠재력 실현: 체계적 문헌고찰 [64]
|
소프트웨어 엔지니어링
|
응용 중심
|
제한적
|
제한적
|
제한적
|
예
|
|
무선 네트워크를 위한 대규모 언어 모델: 프롬프트 엔지니어링 관점에서의 개요 [65]
|
무선 네트워크
|
응용 분야별 / 도메인 주도형
|
제한적
|
아니요
|
제한적
|
예
|
|
요구사항 엔지니어링에서 대규모 언어 모델을 사용하기 위한 프롬프트 엔지니어링 지침 [66]
|
요구사항 엔지니어링
|
지침 기반
|
제한적
|
아니요
|
아니요
|
예
|
|
프롬프트 엔지니어링 기법의 SWOT 분석에 관한 체계적 문헌 검토 [67]
|
SWOT 중심
|
SWOT 기반 / 분석적
|
제한적
|
아니요
|
제한적
|
제한적
|
|
대규모 언어 모델을 위한 프롬프트 엔지니어링 기법 검토 [68]
|
광범위
|
기법 지향
|
제한적
|
아니요
|
제한적
|
제한적
|
표 3
기존 컨텍스트 엔지니어링 설문조사와 제안된 설문조사의 비교.
|
설문조사 / 연구
|
범위
|
분류 체계 유형
|
평가
|
자동화
|
견고성 / 신뢰성
|
적용 지침
|
|
대규모 언어 모델을 위한 컨텍스트 엔지니어링 설문조사 [25]
|
컨텍스트 엔지니어링
|
시스템 수준 / 아키텍처적
|
예
|
부분적
|
예
|
제한적
|
|
장문맥 언어 모델링에 관한 종합 설문조사 [69]
|
장문맥 모델링
|
아키텍처 기반
|
예
|
아니요
|
예
|
제한적
|
|
본 연구 (제안된 설문조사)
|
광범위 + 실용적
|
통합 분류 체계 및 의사결정 프레임워크
|
예
|
예
|
예
|
도메인 간
|
이는 본 설문조사가 선행 연구보다 범위가 더 넓고 구조적으로도 더 심층적임을 추가로 보여주며, 프롬프트 엔지니어링 연구를 위한 장기적 참고 자료로 자리매김하게 한다. 신뢰성, 환각 완화, 편향을 핵심 분석 차원으로 통합함으로써, 본 연구는 성능 중심 분석을 넘어 프롬프트 엔지니어링을 발전시킨다.
본 연구의 주요 기여는 세 가지이다.
-
• 첫째, 프롬프트 엔지니어링 및 컨텍스트 엔지니어링 기법의 체계적인 분류 체계를 도입하여 그 핵심 원리와 응용에 대한 구조적 이해를 제공한다.
-
• 둘째, 여러 LLM 아키텍처를 실증적으로 분석하여 환각 완화와 인간 의도에 대한 모델 정렬 개선 측면에서의 효과를 평가한다.
-
• 마지막으로, 프롬프트 엔지니어링과 컨텍스트 엔지니어링의 핵심 과제를 식별하고 이러한 방법론을 개선·발전시키기 위한 향후 연구 방향을 제시한다.
이 글은 정교한 프롬프팅 전술을 사용하여 LLM 성능을 향상하고자 하는 연구자와 실무자를 위한 기초 참고 자료 역할을 한다.
이 논문의 나머지 구성은 다음과 같다:
2장
은(는) 제로샷, 퓨샷, 사고 연쇄 프롬프팅과 같은 기본 접근법과 검색 증강 생성 및 자기 일관성 프롬프팅 같은 고급 전략을 포함하여 프롬프트 엔지니어링 기법을 종합적으로 검토한다.
3장
은(는) 이러한 기법의 정성적 분석을 제시하며, 서로 다른 LLM 아키텍처 전반에서의 효과를 비교하고 모델 성능에 미치는 영향을 평가한다.
4장
은(는) 사용 사례에 따라 이러한 기법을 분류하여 다양한 도메인에서의 실용적 응용에 관한 통찰을 제공한다. 마지막으로,
5장
은(는) 주요 결과를 요약하고 프롬프트 엔지니어링의 향후 연구 기회를 논의하며 논문을 마무리한다.
2. 검토 방법론 및 프로토콜
본 검토는 대규모 언어 모델(LLM)을 위한 프롬프트 엔지니어링 기법의 투명성, 재현성 및 포괄적 범위를 보장하기 위해 체계적 문헌 검토(SLR) 방법론을 따른다. 검토 프로토콜은 컴퓨터 과학 및 소프트웨어 공학의 체계적 검토를 위한 확립된 지침에 따라 설계되었으며, 명시적인 검색 전략, 명확히 정의된 포함 및 제외 기준, 구조화된 분석 과정을 강조한다.
2.1. 검토 유형 및 목표
본 연구는 서술적 검토나 범위 검토가 아닌 체계적 문헌 검토 접근법을 채택한다. 주요 목표는 LLM을 위한 기존 프롬프트 엔지니어링 기법 연구를 체계적으로 식별, 분류, 종합 및 비판적으로 분석하는 것이다. 서술적 조사와 달리, 이 접근법은 검토 과정을 명시적으로 문서화하여 선택 편향을 최소화하고 재현성을 높이는 것을 목표로 한다.
본 검토는 다음의 포괄적 목표에 답하고자 한다:
-
• LLM을 위해 제안된 기존 프롬프트 엔지니어링 기법을 식별하고 분류한다
-
• 이들의 방법론적 특성, 장점, 한계 및 적용 맥락을 분석한다
-
• 문헌에서 보고된 평가 관행, 실증적 증거 및 비교 통찰을 부각한다
-
• 프롬프트 엔지니어링의 미해결 과제, 연구 공백 및 향후 연구 방향을 식별한다.
2.2. 연구 질문
검토 과정을 안내하기 위해 다음 연구 질문(RQ)을 수립했다:
-
• RQ1: 대규모 언어 모델을 위해 어떤 프롬프트 엔지니어링 기법이 제안되었는가?
-
• RQ2: 이러한 기법을 일관된 분류 체계로 어떻게 체계적으로 분류할 수 있는가?
-
• RQ3: 서로 다른 프롬프트 엔지니어링 접근법의 강점, 한계 및 절충점은 무엇인가?
-
• RQ4: 프롬프트 엔지니어링 기법은 어떻게 평가되며, 어떤 실증적 증거가 그 효과를 뒷받침하는가?
-
• RQ5: LLM을 위한 프롬프트 엔지니어링에 어떤 미해결 과제와 향후 연구 방향이 남아 있는가?
이러한 연구 질문은 본 검토에서 채택한 검색 전략, 선정 기준 및 종합 과정을 형성한다.
2.3. 데이터 소스 및 디지털 라이브러리
폭넓고 권위 있는 범위를 보장하기 위해 여러 주요 학술 데이터베이스와 디지털 라이브러리를 조사했다. 다음 소스는 컴퓨터 과학, 인공지능 및 기계 학습 연구와의 관련성 때문에 선정되었다:
-
• IEEE Xplore
-
• ACM 디지털 라이브러리
-
• ScienceDirect (Elsevier)
-
• Springer
-
• Google Scholar
2.4. 검색 전략
대규모 언어 모델(LLM)을 위한 프롬프트 엔지니어링 및 컨텍스트 엔지니어링 관련 문헌을 식별하기 위해 구조화되고 집중된 검색 전략을 설계했다. 수많은 기법별 키워드를 사용하는 더 광범위한 조사 방법론과 달리, 본 검토는 여러 디지털 라이브러리 전반에서 일관성, 재현성 및 관리 가능한 검색 결과를 보장하기 위해 통합된 불리언 검색식을 채택했다. 최종 불리언 질의는 다음과 같이 정의되었다:
(("Prompt Engineering" OR "Context Engineering") AND ("LLM" OR "Large Language Model"))
높은 주제 관련성을 보장하고 느슨하게 관련된 연구의 포함을 줄이기 위해 검색은 주로 제목 필드에서 수행되었다. 최근 몇 년간 "prompt engineering"과 "context engineering"이라는 용어가 학술 출판물에서 더욱 표준화되고 널리 채택되었으므로, 제목 기반 검색은 무관한 레코드를 최소화하면서 핵심 기여를 식별하는 데 효과적인 것으로 간주되었다.
검색된 연구의 품질과 관련성을 향상하기 위해 추가적인 데이터베이스별 필터와 제약 조건을 다음에 따라 적용했다
각 플랫폼의 색인 구조와 검색 기능에 따라. 적용된 필터와 초기 검색 결과는 아래에 요약되어 있다:
-
•
IEEE Xplore (논문 91편):
실질적인 기술 검증과 실험 분석을 갖춘 성숙한 동료 심사 연구를 우선시하기 위해 검색을 저널 출판물로 제한했다.
-
•
ScienceDirect/Elsevier (논문 182편):
학문 분야의 관련성과 기술적 품질을 보장하기 위해 검색을 제목 필드로 제한하고 컴퓨터 과학 분야의 연구 논문 및 리뷰 논문으로 필터링했다.
-
•
ACM 디지털 라이브러리 (논문 15편):
저널 출판물을 우선시하는 한편, 정확한 제목 용어가 달라지더라도 프롬프트 또는 컨텍스트 엔지니어링 개념을 논의하는 연구의 범위를 넓히기 위해 초록 수준 일치를 활성화했다.
-
•
Springer Nature (논문 96편):
검색을 제목 일치로 제한하고 인공지능 및 기계 학습 영역에서 영어로 작성된 연구 논문과 리뷰 논문으로 필터링했다.
-
•
Google Scholar (논문 84편):
사용된 질의는 제목 수준 일치를 강제하기 위해 allin title: 연산자와 함께 ("Prompt Engineering" OR "Context Engineering")였다. 영향력 있는 조사, 새롭게 부상하는 동향 및 다른 데이터베이스에 아직 포괄적으로 색인되지 않았을 수 있는 최근 출판 연구를 식별하기 위해 검토 지향 학술 논문을 우선시했다.
검색 과정은 선정된 모든 데이터베이스에서 반복적으로 수행되었다. 데이터베이스별 질의 규칙에서 요구되는 경우 경미한 구문 수정이 도입되었지만, 불리언 질의의 의미 구조는 검토 과정 전반에 걸쳐 일관되게 유지되었다.
채택된 검색 전략은 이 조사의 목표와 부합했다. "Prompt Engineering" 및 "Context Engineering" 용어를 포함함으로써 기초적인 프롬프팅 방법론과 새롭게 부상하는 컨텍스트 인식 LLM 시스템을 모두 다루는 연구를 검색할 수 있었다. 마찬가지로, "LLM" 및 "Large Language Model"을 포함함으로써 현대적인 트랜스포머 기반 생성형 AI 시스템과 그 상호작용 프레임워크의 범위를 보장했다. 이러한 집중된 검색 설계는 일관된 분류 체계의 개발을 촉진하고 프롬프트 및 컨텍스트 엔지니어링의 최근 발전을 체계적으로 종합하는 데 기여했다.
2.5. 기간 범위 및 검토 일정
본 검토는 2023년 1월부터 2025년 12월까지 출판된 문헌을 다룬다. 이 기간 범위는 GPT-3.5, GPT-4, Claude, Gemini 및 기타 지시문 튜닝 시스템과 같은 고급 대규모 언어 모델이 널리 등장한 이후 프롬프트 엔지니어링과 컨텍스트 엔지니어링의 급속한 진화와 주류 채택을 포착하기 위해 선정되었다.
선정된 기간은 다음과 같은 여러 이유로 특히 중요하다:
-
• "prompt engineering"과 "context engineering"이라는 용어는 2023년 이후 학술 문헌에서 더욱 표준화되고 널리 채택되었다.
-
• 자동화된 프롬프트 최적화, 검색 증강 생성(RAG), 에이전트 워크플로, 메모리 지원 LLM 시스템, 도구 증강 추론 및 장문맥 아키텍처를 포함한 여러 주요 발전이 이 기간에 상당한 성장을 경험했다.
-
• 2023–2025년 기간에 초점을 맞추면 확장성이나 적용 범위가 제한적인 초기 탐색적 프롬프팅 연구가 아니라 동시대의 방법론, 시스템 수준 통합 및 실용적 배포 패러다임을 강조할 수 있다.
-
• 2025년 12월까지의 연구를 포함하면 본 검토가 이 급속히 발전하는 연구 분야의 최신 동향을 포착하고 출판 시점에 조사가 시대에 뒤처질 위험을 줄일 수 있다.
이 기간에 출판된 저널 논문과 영향력 높은 학회 논문을 모두 고려했다. 또한, 선정된 고품질
사전 인쇄본은 프롬프트 엔지니어링 및 컨텍스트 엔지니어링과 관련된 영향력 있거나 새롭게 부상하는 기법을 소개한 경우 포함했다.
2.6. 포함 및 제외 기준
선정된 연구의 관련성, 일관성 및 기술적 품질을 보장하기 위해 명확한 포함 및 제외 기준을 수립했다.
2.6.1. 포함 기준
다음에 해당하는 연구를 포함했다:
-
• 대규모 언어 모델을 위한 프롬프트 엔지니어링, 컨텍스트 엔지니어링 또는 관련 상호작용 프레임워크에 중점을 둔다.
-
• 프롬프팅 또는 맥락 증강 기법을 제안, 분석, 평가 또는 적용한다.
-
• LLM 기반 시스템, 검색 증강 생성, 메모리 시스템, 도구 증강 추론 또는 에이전트 워크플로를 논의한다.
-
• 동료 심사 저널 논문, 학회 논문, 리뷰 논문 또는 고품질 학술 사전 인쇄본이다.
-
• 영어로 작성되었다.
-
• 정의된 출판 기간(2023년 1월–2025년 12월) 내에 해당한다.
2.6.2. 제외 기준
다음에 해당하는 연구는 제외되었다:
-
• LLM을 위한 프롬프트 엔지니어링, 컨텍스트 엔지니어링 또는 프롬프팅 관련 전략을 명시적으로 다루지 않는 연구.
-
• 프롬프트 관련 분석 없이 모델 아키텍처, 하드웨어 최적화 또는 학습 방법론에만 초점을 맞춘 연구.
-
• 의견 기사, 기술적 기여가 없는 튜토리얼, 사설, 백서 또는 비학술적 블로그 게시물.
-
• 충분한 방법론적 세부 사항, 실험적 평가 또는 실증적 근거가 부족한 연구.
-
• 중복 출판물, 불완전한 원고 또는 전문에 접근할 수 없는 연구.
2.7. 연구 선정 과정
연구 선정 과정은 관련성 높고 품질이 우수하며 기술적으로 중요한 연구를 포함하도록 다단계 필터링 및 정제 절차를 따랐다.
-
1.
초기 식별:
사전 정의된 부울 검색 전략과 데이터베이스별 필터를 사용하여 선정된 데이터베이스에서 총 468편의 논문을 최초로 검색하였다.
-
2.
중복 제거:
데이터베이스 간 중복 항목을 제거한 후, 추가 평가를 위해 464건의 고유 연구가 남았다.
-
3.
제목 선별:
검색된 연구의 제목을 사전 정의된 포함 및 제외 기준에 따라 선별하여 명백히 관련 없는 연구를 제거하였다. 이 단계에서 후보 집합은 90편의 논문으로 줄었다.
-
4.
초록 선별:
이후 남은 연구의 초록을 검토하여 관련성, 기술적 기여도 및 본 조사 목표와의 부합성을 평가하였다. 초록 선별 후 47편의 논문이 상세한 전문 검토를 위해 보존되었다.
-
5.
전문 검토 및 최종 선정:
선정된 연구는 방법론적 품질, 실증적 검증 및 프롬프트 엔지니어링과 컨텍스트 엔지니어링 연구에 대한 기여도를 평가하기 위해 전문을 검토하였다. 프롬프팅 및 맥락 증강 기법의 이해, 개발, 최적화 또는 평가에 직접 기여하는 논문만 최종 종합에 포함되었다.
주요 데이터베이스 검색에 더하여, 선정된 연구에 대해 후방 참고문헌 추적(backtracking) 전략을 적용하였다
2023년 이전에 출판된 기초적이고 영향력이 큰 연구를 식별하기 위해서였다. 이 보완 단계는 여러 획기적인 프롬프트 엔지니어링 및 인컨텍스트 학습 연구가 “프롬프트 엔지니어링”과 “컨텍스트 엔지니어링”이라는 용어가 널리 표준화되기 전에 등장했기 때문에 필요했으며, 이로 인해 제목 제약 부울 검색 전략만으로는 해당 연구를 검색하기 어려웠다.
또한 후방 추적 과정은 많은 선구적 프롬프트 엔지니어링, 지시문 튜닝 및 인컨텍스트 학습 논문이 처음 발표된 NeurIPS, ICML, ICLR, arXiv와 같은 주요 학술지 및 학회에 출판된 영향력 있는 연구를 포함할 수 있게 하였다. 이 보완적 포함 전략은 조사가 기초적 발전과 최근의 진전을 모두 포착하도록 하여, 검토의 역사적 연속성, 완전성 및 기술적 깊이를 향상시켰다.
전체 연구 선정 과정을 요약한 PRISMA 양식 흐름도는 그림 4에 제시되어 있다.
3. 질문 주도형 분류체계 설계 및 매핑 근거
본 조사에서 제시하는 프롬프트 엔지니어링 기법의 분류체계는 구조화된 질문 주도형 설계 과정을 통해 도출되었다. 기법을 임시방편적으로 나열하는 대신, 이 분류체계는 프롬프트 엔지니어링 방법이 서로 다른 핵심 차원을 포착하는 일련의 기초 연구 질문을 체계적으로 다루어 구성된다. 이 접근법은 개념적 명확성을 보장하고 구조적 불균형을 방지하며, 기법을 일관된 범주로 묶는 원칙적 근거를 제공한다.
구체적으로 이 분류체계는 프롬프트가 대규모 언어 모델(LLM)과 상호작용하는 방식, 추론과 계획이 유도되는 방식, 외부 맥락이 통합되는 방식, 그리고 인간 또는 자동화된 피드백이 모델 행동에 영향을 미치는 방식을 점진적으로 특성화하는 서로 연관된 여섯 가지 질문에 의해 안내된다. 각 질문은 하나 이상의 분류체계 노드(절)에 직접 정보를 제공하며, 그에 대응하는 답변은 특정 리프 기법(하위 절)의 포함을 정당화한다.
Q1: 프롬프트는 과업 지시만을 사용하며, 아니면 모델 행동을 안내하기 위한 시연 예시도 포함하는가?
이 질문은 모델이 순전히 지시만으로 안내되는지, 아니면 예시를 통해 추가로 안내되는지에 따라 프롬프트 기반 상호작용의 가장 기초적인 형태를 구분한다.
매핑 및 근거:
중간 구조 없이 직접적인 지시에 의존하는 기법은
기본 프롬프팅 기법
으로 4절에 묶인다. 제로샷 프롬프팅은 모델이 사전학습된 지식만으로 일반화할 것으로 기대되는 최소 상호작용 패러다임을 나타낸다. 퓨샷 프롬프팅은 원하는 과업 행동에 맞게 모델을 조건화하는 시연 예시를 통합하여 이 패러다임을 확장한다. 이 기법들은 최소한의 개입만 필요하고 더 고급 방법의 기준선 역할을 하므로 분류체계의 기초 계층을 형성한다.
Q2: 프롬프트는 단일 추론 궤적 내에서 단계별 논리적 추론을 명시적으로 강제하는가?
이 질문은 프롬프트가 모델이 중간 추론 단계를 선형적이고 해석 가능한 방식으로 외현화하도록 장려하는지를 포착한다.
매핑 및 근거:
5절에서 단일 궤적을 따라 구조화된 추론을 명시적으로 안내하는 기법은
단계별 추론 및 논리적 사고
로 분류된다. 사고 사슬 프롬프팅은 이 패러다임의 정형적 사례를 구성하며, Automatic CoT, Logical CoT, Chain-of-Symbol 프롬프팅과 같은 확장은 추론 단계가 생성, 제약 또는 기호적으로 표현되는 방식에 변형을 도입한다. 이 기법들은 분기나 다중 경로 탐색을 도입하지 않고 논리적 일관성을 향상한다는 공통 목표를 공유하므로 함께 묶인다.
그림 4.
본 조사에서 채택한 연구 식별, 선별, 적격성 평가, 후방 참고문헌 추적 과정 및 최종 연구 선정을 보여주는 PRISMA 양식 흐름도.
Q3: 프롬프트는 결과를 확정하기 전에 여러 추론 경로나 결정을 탐색하도록 장려하는가?
이 질문은 선형적 추론을 숙고, 분기 또는 대안적 해결 경로 간 비교를 명시적으로 모델링하는 접근법과 구분한다.
매핑 및 근거:
다중 경로 추론이나 의사결정 탐색을 가능하게 하는 기법은
다단계 의사결정 및 계획
으로 6절에 분류된다. Tree-of-Thoughts와 Graph-of-Thought 같은 방법은 여러 후보 경로에 대한 검색 과정으로 추론을 명시적으로 구조화한다. System 2 Attention과 Thread-of-Thought 프롬프팅은 숙고적 추론을 더욱 강조하는 한편, Chain of Table 프롬프팅은 표 형식 표현을 바탕으로 의사결정을 구조화한다. 이 기법들은 최종 의사결정 전에 통제된 탐색에 초점을 둔다는 점에서 통합된다.
Q4: 프롬프트는 외부 맥락, 검증 메커니즘 또는 적응적 지식 검색을 통합하여 추론을 향상하는가?
이 질문은 프롬프팅 전략이 외부 정보원 또는 맥락 정제 메커니즘을 통합함으로써 내부 모델 추론을 넘어서는지를 다룬다.
매핑 및 근거:
사실 기반성, 맥락 인식 또는 검증을 개선하는 기법은 7절에서
맥락 향상 및 적응형 학습
으로 묶인다. 검색 증강 생성은 외부 지식 검색을 도입하는 반면, ReAct는 추론과 도구 사용을 결합한다. Chain-of-Verification, Chain-of-Note, Chain-of-Knowledge 프롬프팅은 검증, 맥락 통합 및 구조화된 지식 통합을 강조한다. 이 방법들은 신뢰성과 사실적 일관성을 향상한다는 공통 목표 때문에 함께 분류된다.
Q5: 프롬프팅 과정에는 인간과 모델 간의 반복적 상호작용, 피드백 또는 협업이 포함되는가?
이 질문은 프롬프팅 루프의 상호작용성과 적응성 정도를 포착한다.
매핑 및 근거:
피드백, 사용자 개입 또는 자동화된 정제를 명시적으로 수반하는 기법은
상호작용 및 인간-AI 협업 기법
으로 8절에 분류된다. Active-Prompt와 Automatic Prompt Engineer는 반복적 정제 과정을 도입하는 반면, Automatic Reasoning and Tool-use와 Contrastive CoT 프롬프팅은 피드백 기반 또는 대조적 메커니즘을 활용하여
추론 품질을 개선한다. 이 접근법들은 프롬프팅을 정적인 지시가 아닌 상호작용적 과정으로 다룬다는 점에서 함께 묶인다.
Q6: 프롬프트는 인간과 유사한 추론을 모방하거나 과업 성능을 향상하기 위해 인지적, 정서적 또는 최적화 지향적 메커니즘을 통합하는가?
이 질문은 논리적 추론을 넘어 인지적 스캐폴딩, 정서적 단서 또는 최적화 목표를 통합하는 고급 프롬프팅 패러다임을 포착한다.
매핑 및 근거:
이러한 측면을 다루는 기법은 9절에서
정서 인식 및 심리학적 기법
으로 묶인다. Emotion 프롬프팅과 Scratchpad 프롬프팅은 정서적 또는 인지적 스캐폴딩을 도입하는 반면, Program of Thoughts, Structured CoT, Chain of Code는 구조화된 계산적 추론을 강조한다. Optimization by Prompting, Rephrase and Respond, Take a Step Back 프롬프팅 및 텍스트-이미지 프롬프트 엔지니어링은 이 패러다임을 성능 최적화와 멀티모달 생성으로 확장한다. 이 기법들은 심리학에서 영감을 받은 메커니즘을 통해 추론의 깊이, 적응성 또는 창의성을 향상하는 데 초점을 둔다는 점에서 통합된다.
질문 주도형 매핑의 의의
명시적인 연구 질문에 분류체계를 기반으로 함으로써, 이 분류는 세 가지 중요한 목표를 달성한다. 첫째, 개념적으로 구별되는 절 전반에 기법을 분배하여 구조적 불균형을 방지한다. 둘째, 피상적 유사성이 아닌 공유된 상호작용 원리에 따라 방법을 정렬함으로써 의미 있는 비교를 가능하게 한다. 셋째, 전체 구조를 훼손하지 않고 새롭게 등장하는 프롬프팅 기법을 수용할 수 있는 확장 가능하고 신장 가능한 프레임워크를 제공한다. 결과적으로 제안된 분류체계는 조직화 도구일 뿐만 아니라 프롬프트 엔지니어링의 진화하는 지형을 이해하기 위한 분석적 렌즈 역할도 한다(그림 5).
4. 기본 프롬프팅 기법(LLM을 안내하기 위한 기초적 접근법)
4.1. 제로샷 프롬프팅 – LLM은 예시 없이 응답을 생성한다
제로샷 프롬프팅은 사전에 예시가 제공되거나 해당 과업에 대해 특별히 학습되지 않은 상태에서 특정 과업을 수행하도록 지시하는 자연어 처리 접근법이다. 모델은 직접적인 감독을 전제하지 않고, 대신 사전학습 중에 내재화된 언어, 의미 관계 및 맥락적 추론에 관한 지식을 활용하여
그림 5. 대규모 언어 모델을 위한 프롬프트 엔지니어링 기법의 질문 중심 분류 체계.
그림 6.
제로샷 프롬프팅 과정의 개념적 표현. 이 도표는 지식 검색, 맥락 분석, 응답 생성을 포함한 입력 데이터 처리의 주요 단계를 보여 주며, 이를 통해 LLM은 작업별 학습 예시 없이도 작동할 수 있다.
요청된 지시를 수행한다. 프롬프트에 예시 출력이 없으므로 출력은 질의에 인코딩된 정보로부터 추론되어야 한다 [1]. 미세 조정을 위해 레이블이 지정된 데이터셋에 의존하는 기존 기계 학습 방법론과 달리, 제로샷 프롬프팅은 사전 학습된 모델의 일반화 능력을 활용한다. 이를 통해 LLM은 도메인별 학습 데이터를 필요로 하지 않고도 텍스트 분류, 논리적 추론, 콘텐츠 생성 등 다양한 작업을 수행할 수 있다 [5]. 그러나 제로샷 프롬프팅의 효율성은 프롬프트의 정확성과 명확성에 달려 있다. 구조가 좋지 않거나 모호한 지시는 부정확하거나 일관되지 않거나 의도한 목표와 부합하지 않는 출력을 초래할 수 있다 [27]. 따라서 제로샷 환경에서 모델 생성 응답의 신뢰성과 해석 가능성을 향상하려면 프롬프트 설계를 최적화하는 것이 중요하다.
4.1.1. 작동 원리
모델은 작업별 학습이나 명시적 예시에 의존하지 않고, 기존 지식과 일반화 능력을 활용하여 새로운 프롬프트를 해석하고 응답을 생성한다 [5]. 모델은 사전 학습 단계에서 습득한 광범위한 언어 이해, 개념적 관계 및 맥락적 연관성을 활용하여 제공된 프롬프트만을 바탕으로 예상 출력을 추론한다 [27].
이 과정은 다음과 같이 형식적으로 표현할 수 있다 [70]:
다음과 같이 두자:
는 입력 프롬프트를 나타내고,
는 모델의 지식 기반을 나타내며,
는 생성된 응답을 의미한다. 따라서 제로샷 프롬프팅 방법은 수학적으로 다음과 같이 표현할 수 있다:
여기서
는 주어진 프롬프트와 모델의 내부 지식 기반을 적절한 응답으로 변환하는 함수를 나타낸다.
그림 6은 데이터 수집, 토큰화, 신경망 아키텍처 활용 및 예측 추론을 포괄하는 제로샷 프롬프팅 과정의 핵심 단계를 보여 준다. 또한 패턴을 식별하고, 관련 지식을 추출하며, 맥락적 일관성을 확립하는 모델의 능력은 정확하고 의미 있는 출력을 보장하는 데 중요하다. 이 접근법은 다양한 도메인에서 대규모 언어 모델의 적응성과 활용도를 높이며, 특히 레이블이 지정된 데이터셋이 부족하거나 존재하지 않을 때 유리하다.
모델의 사전 학습 지식의 품질과 철저성, 그리고 이전에 본 적 없는 작업과 도메인에 일반화하고 적응하는 능력은 제로샷 프롬프팅의 효과에 영향을 미치는 핵심 요인이다 [71].
4.1.2. 제로샷 프롬프팅의 예시
제로샷 프롬프팅의 일반적인 적용 사례는 다음과 같다 [27]:
-
• 분류: 다음 텍스트를 긍정 또는 부정으로 분류하시오: "이 영화는 정말 환상적이었습니다! 연기는 뛰어났고, 줄거리는 흥미로웠으며, 특수 효과는 놀라웠습니다." 감정 분류에 관한 사전 학습이 없는 모델은 이상적으로 이를 "긍정"으로 분류해야 한다.
-
• 번역: 다음 문장의 프랑스어 번역을 제공하시오:
"안녕하세요, 어떻게 지내세요?"
다국어 데이터로 학습된 모델은 다음 번역을 제공할 수 있어야 한다:
"Bonjour, comment allez-vous?"
-
• 생성: 가을에 관한 짧은 시를 쓰시오. 제로샷 기능을 갖춘 모델은 다음과 같은 내용을 생성할 수 있다:
잎들이 붉고 황금빛으로 떨어지고,
부드러운 바람이 이야기를 들려준다.
공기는 상쾌하고, 해는 낮게 떠 있으며,
가을의 아름다움이 빛나기 시작한다.
-
• 분석: 아래 글의 핵심 주제를 개괄하시오:
"노인은 공원 벤치에 앉아,
아이들이 노는 모습을 바라보았다.
그는 자신의 어린 시절을 떠올렸다.
웃음과 기쁨으로 가득했지만,
잃어버린 친구들과 빛바랜 꿈의
슬픔도 깃들어 있었다.
그는 시간이 흘러간다는 것을 깨달았지만,
기억은 남는다는 것도 깨달았다."
제로샷 모델은 향수, 시간의 흐름, 기억의 씁쓸하면서도 달콤한 본질과 같은 주제를 식별할 수 있어야 한다.
4.1.3. 제로샷 프롬프팅의 장점
제로샷 프롬프팅은 다음과 같은 몇 가지 주요 장점을 제공한다 [27,52]:
-
• 유연성: 어떠한 조정도 필요 없이 매우 다양한 작업을 수행할 수 있다.
-
• 작업별 학습 불필요: 레이블이 지정된 데이터셋의 필요성을 없애 개발 비용을 줄인다.
-
• 신속한 배포: 다양한 도메인에서 빠른 테스트와 구현을 용이하게 한다.
-
• 모델 일반화 평가: 다양한 과제를 이해하고 적응하는 모델의 능력을 평가한다.
프롬프트 엔지니어링의 효율성은 기존 기계 학습 워크플로(표 4)와 제로샷 접근법(표 5)을 비교할 때 특히 뚜렷해진다. 기존 방법론은 데이터 수집, 전처리, 모델 학습 및 반복적 개선에 광범위한 시간을 필요로 하며, 배포 전까지 수 주가 걸리기도 한다. 표 4에서 보이듯이, 이러한 단계는 개발 주기를 크게 연장하고 계산 요구량을 증가시킨다.
반대로 표 5에서 설명한 바와 같이, 제로샷 접근법은 광범위한 데이터셋 준비와
표 4
기존 접근법과 제로샷 접근법 간 소요 시간 요구 사항의 맥락적 비교.
|
통합 작업
|
기존 접근법(예상 시간)
|
제로샷 접근법(예상 시간)
|
|
문제 이해 및 작업 정의
|
일
|
분
|
|
모델 준비(데이터 수집, 정제, 학습)
|
수일에서 수 주
|
필요 없음
|
|
솔루션 설계(모델 아키텍처 / 프롬프트 설계)
|
일
|
수분에서 수 시간
|
|
테스트 및 반복
|
수일에서 수 주
|
분
|
|
배포 및 통합
|
시간
|
분
|
표 5
소수 예제 학습의 과제와 모범 사례.
|
효과적인 예제 선택
|
프롬프트 설계
|
과적합 방지
|
|
관련성 다양성 명확성
|
일관성 맥락적 단서 단순성
|
예제 다양성 균형 잡힌 프롬프트 반복적 테스트
|
맞춤형 모델 학습. 사전 학습된 모델을 활용하면 과제 성능은 데이터 기반 재학습이 아니라 프롬프트 설계에 의해 좌우된다. 이러한 계산 복잡성의 감소는 더 빠른 배포를 가능하게 하므로, 특히 실시간 애플리케이션과 신속한 프로토타이핑에서 제로샷 프롬프팅은 효율적인 대안이 된다.
4.1.4. 제로샷 프롬프팅의 한계
상당한 장점에도 불구하고, 제로샷 프롬프팅에는 몇 가지 내재적 한계가 있다 [72].
정확도: 제로샷 프롬프팅의 정밀도는 다음 요인들로 인해 미세 조정된 모델에 비해 부족한 경우가 많다:
-
• 특정 과제에 대한 최적화 부족: 미세 조정된 모델은 광범위한 도메인 특화 학습을 거치는 반면, 제로샷 프롬프팅은 일반 사전 학습에만 의존한다.
-
• 해석의 가변성: 모델의 응답은 프롬프트를 해석하는 방식에 따라 달라질 수 있으며, 이로 인해 일관성이 저하된다.
-
• 복잡한 과제 처리: 고도로 전문화된 과제는 더 깊은 맥락 이해를 요구하는 경우가 많으며, 제로샷 프롬프팅은 이를 효과적으로 포착하지 못할 수 있다.
프롬프트 민감성: 제로샷 프롬프팅의 효율성은 프롬프트 설계 방식에 크게 영향을 받는다:
-
• 표현의 변형: 문구를 조금만 변경해도 모델의 해석과 출력이 크게 달라질 수 있다.
-
• 지시의 명확성: 불분명하거나 부정확한 프롬프트는 일관되지 않거나 관련 없는 응답을 초래할 수 있다.
-
• 맥락 의존성: 모델의 성능은 프롬프트에 포함된 맥락 정보에 따라 변동한다.
예를 들어 동일한 입력 데이터가 주어져도 프롬프트 문구를 약간 수정하면 응답의 길이, 세부성 및 초점에 변화가 생길 수 있으며, 이는 모델이 언어적 뉘앙스에 민감함을 강조한다.
편향: 사전 학습된 모델에 의존하는 제로샷 프롬프팅은 학습 데이터에 존재하는 편향에 취약하며, 이로 인해 다음과 같은 문제가 발생한다:
-
• 의도치 않게 사회적 또는 지역적 격차를 반영할 수 있는 인구통계학적 및 문화적 편향.
-
• 역사적 맥락은 간과하고 최신 정보는 선호하는 최신성 편향.
-
• 학습 코퍼스에 내재한 선입견을 강화할 수 있는 고정관념화.
비판적 분석
제로샷 프롬프팅은 사전 학습된 일반화 능력을 활용하여 시연 예시 없이도 신속한 과제 적응을 지원한다 [73]. 그러나 실증적 연구 결과는 GSM8K와 같은 다단계 추론 과제에서 신뢰성이 낮아짐을 보여준다 [27,74].
주된 절충점은 토큰 효율성과 추론 견고성 사이에 있다. 제로샷은 입력 길이와 지연 시간을 최소화하지만, 프롬프트 문구와 지시의 모호성에 여전히 민감하다.
남은 과제로는 바꿔 쓴 프롬프트에 대한 견고성 개선과 제로샷 안정성을 위한 표준화된 평가 벤치마크 수립이 있다.
4.2. 퓨샷 프롬프팅
정교한 NLP 방법인 퓨샷 프롬프팅은 몇 개의 예시를 제공하여 AI 모델의 과제 수행 능력을 향상한다 [75]. 사전 학습된 지식에만 의존하는 제로샷 프롬프팅과 달리, 퓨샷 프롬프팅은 이러한 예시를 맥락적 지침으로 활용하여 응답의 정확성과 관련성을 개선한다 [74–76]. 이 방법은 예시를 전혀 필요로 하지 않는 제로샷 학습과 광범위한 레이블링된 데이터셋을 필요로 하는 완전 지도 미세 조정 사이의 중간 단계 역할을 한다. 제한된 수의 시연 예시를 포함함으로써, 퓨샷 프롬프팅은 프롬프트 기반 학습에 내재된 유연성을 유지하면서 접근법을 특정 과제에 맞춤화할 수 있게 한다.
4.2.1. 작동 원리
퓨샷 프롬프팅의 근본 원리는 과제별 시연 예시를 프롬프트 내에 포함하는 데 있다. 이러한 예시는 암묵적 지시로 작용하여 모델의 행동을 안내한다. 일반적으로 시연 예시는 다음 특성을 보인다:
-
• 입력–출력 매핑: 각 시연 예시는 입력(예: 질의, 문장 또는 과제 프롬프트)과 이에 대응하는 예상 출력(응답 또는 해법)으로 구성된다 [5].
-
• 형식 일관성: 일관된 형식을 유지하면 모델이 서로 다른 프롬프트 전반의 구조적 패턴을 인식하는 데 도움이 된다 [76].
-
• 과제별 관련성: 제공된 예시는 대상 과제와 일치하여 모델이 의미 있는 정보를 외삽하도록 보장한다 [49].
이러한 시연 예시를 처리할 때, 대규모 언어 모델(LLM)은
인컨텍스트 학습
을 활용하는데, 이는 최소한의 감독으로 일반화할 수 있게 하는 과정이다. 이 과정은 다음 단계로 나눌 수 있다:
-
• 패턴 인식: 모델은 프롬프트 내 입력과 출력 간의 관계를 추출하고 분석한다 [77].
-
• 과제 추론: 관찰된 예시를 바탕으로 주어진 과제의 성격을 추론한다 [78].
-
• 일반화: 모델은 학습한 매핑 규칙을 적용하여 이해를 보지 못한 입력까지 확장한다 [2].
-
• 적용: 모델은 제공된 시연 예시로부터 외삽하여 새 입력에 대한 응답을 종합한다.
그림 7에 나타난 바와 같이, 퓨샷 프롬프팅 프레임워크는 광범위한 레이블링된 데이터셋에 대한 의존을 최소화하면서 과제 적응성을 향상한다. 제로샷 프롬프팅과 비교할 때, 이 접근법은 특히 추론 집약적 애플리케이션에서 과제별 정확도를 크게 개선한다.
4.2.2. 퓨샷 프롬프팅의 예시
퓨샷 프롬프팅은 일반적으로 다음과 같은 다양한 자연어 처리(NLP) 애플리케이션에 사용된다:
-
• 텍스트 분류:
주어진 긍정 및 부정 예시를 바탕으로 이 새 리뷰를 분류하세요.
그림 7.
퓨샷 프롬프팅 과정의 개념적 표현. 이 도표는 패턴 인식, 과제 추론, 일반화 및 적용을 포함한 핵심 단계를 개략적으로 보여 주며, LLM이 제한된 예시를 활용하여 응답을 생성하는 방식을 설명한다.
-
• 기계 번역:
이 영어 문장들을 스페인어로 번역하세요. 이제 주어진 텍스트를 번역하세요.
-
• 코드 생성:
이 입출력 쌍이 주어졌을 때 누락된 함수를 완성하세요.
-
• 질의응답:
제공된 샘플을 바탕으로 사실적 질문에 답하세요.
4.2.3. 퓨샷 프롬프팅의 장점
퓨샷 프롬프팅은 다음을 포함하여 제로샷 학습보다 뚜렷한 장점이 있다:
-
• 향상된 정확도: 예시 기반 지침을 활용함으로써 모델은 더 정확한 출력을 생성한다 [41].
-
• 개선된 과제 적응: 모델은 최소한의 예시로부터 패턴을 빠르게 학습할 수 있다 [75].
-
• 더 큰 제어 가능성: 사용자는 프롬프트 시연 예시를 신중하게 선택하여 모델의 행동을 미세 조정할 수 있다 [76].
4.2.4. 퓨샷 프롬프팅의 한계
장점에도 불구하고, 퓨샷 프롬프팅에는 내재적 한계가 있다:
-
• 예시 민감성: 모델의 성능은 선택된 예시의 품질과 관련성에 크게 좌우된다 [1].
-
• 증가한 토큰 오버헤드: 프롬프트에 예시를 포함하면 입력 길이가 늘어나며, 계산 비용이 증가할 수 있다 [76].
-
• 일부 경우의 최적 이하 성능: 효과적이지만, 퓨샷 학습이 미세 조정된 모델보다 항상 더 우수한 성능을 보이는 것은 아니다 [1].
최적의 프롬프트 설계와 반복적 개선을 통해 이러한 한계를 해결함으로써, 퓨샷 프롬프팅은 효율성과 정확성의 균형을 유지하면서 LLM 출력을 안내하는 강력한 기법으로 남아 있다.
비판적 분석
퓨샷 프롬프팅은 모델이 시연 사례를 조건으로 삼도록 하여 작업 정렬을 개선한다 [79]. 연구들은 예시의 순서와 시연 사례 선택에 대한 민감성을 보여준다 [61].
이 절충안은 향상된 추론 정확도와 증가한 토큰 오버헤드 및 컨텍스트 윈도우 제약 사이에 존재한다.
향후 연구에서는 자동화된 시연 사례 선택과 모델 간 재현성을 다루어야 한다.
5. 단계별 추론 및 논리적 사고 (LLM에서 구조화된 사고를 유도하는 기법)
5.1. 사고 사슬(CoT) 프롬프팅
사고 사슬(Chain-of-Thought, CoT) 프롬프팅은 복잡한 문제를 조직화된 순차적 단계로 나누어 대규모 언어 모델(LLM)의 추론 능력을 향상하는 구조화된 접근법이다 [2,27]. 암묵적 패턴 인식에 의존하는 직접 응답 프롬프팅과 달리, CoT는 논리적 일관성과 향상된 정확도를 보장하는 구조화된 도출 과정을 용이하게 한다. CoT는 수학적 문제 해결, 논리 분석, 상식 추론을 비롯하여 다단계 추론이 필요한 작업에 특히 유용하다. 추론 과정을 명확히 개괄함으로써 CoT는 LLM이 더 해석 가능하고 투명한
그림 8.
전형적인 사고 사슬 프롬프팅 과정.
답변을 생성하도록 하며, 이는 명확성이 필수적인 분야에 이상적이다. 연구에 따르면 CoT 프롬프팅은 퓨샷 학습을 크게 향상하여 모델이 다양한 문제 영역 전반으로 더욱 효과적으로 일반화할 수 있게 한다 [2]. 그림 8은 전형적인 사고 사슬 프롬프팅 과정을 제시한다. 또한 CoT는 인간의 인지적 문제 해결 전략과 부합하여 AI가 생성한 추론을 인간의 직관에 더욱 맞게 만든다. CoT의 영향은 단순한 질의응답 작업을 넘어 법률 분석 [80–82], 소프트웨어 설정 [83], 의료 진단 [84,85], 과학 연구 [86–88]와 같이 구조화된 논리 추론이 기본적인 응용 분야에서 매우 가치 있음을 입증한다. AI가 계속 발전함에 따라 CoT는 프롬프트 엔지니어링에서 핵심적인 혁신으로 남아 모델 생성 응답의 깊이, 신뢰성 및 해석 가능성을 향상한다.
5.1.1. 작동 원리
즉각적인 응답을 추구하는 표준 프롬프팅과 달리, CoT 프롬프팅은 모델이 결정을 내리기 전에 단계적으로 사고 과정을 명확히 하도록 지시한다 [89]. 이 방법은 다음과 같은 여러 이점을 제공한다.
-
•
복잡한 작업의 분해:
모델은 문제를 더 작고 관리 가능한 단계로 체계적으로 분해한다 [2].
-
•
오류 감소:
구조화된 추론 경로를 따름으로써 모델은 추측이나 오해로 인한 오류를 최소화한다 [90].
-
•
향상된 해석 가능성:
추론 단계가 명시적으로 제시되므로 응답은 더 이해하기 쉽고 투명해진다 [2].
그림 8에 제시된 것처럼, CoT 프롬프팅은 문제를 구조적으로 분해하여 더 정확한 결론에 이르게 한다. 이 접근법은 의사 결정 능력 향상, 환각 감소, 생성된 응답의 신뢰성 개선을 위해 대규모 언어 모델(LLM)에서 널리 채택되었다.
5.1.2. 사고 사슬 작업 프롬프팅의 예시
CoT 프롬프팅은 다음을 포함한 다양한 응용 분야에서 성능을 향상한다.
-
•
수학적 문제 해결:
기차가 1.5시간 동안 90km를 이동한다면, 속도는 얼마인가?
모델은 직접 응답하는 대신 단계별 추론을 따른다.
.
-
•
논리적 추론:
모든 새는 날 수 있다. 펭귄은 새다. 펭귄은 날 수 있는가?
모델은 다음과 같이 설명한다. 대부분의 새는 날 수 있지만, 펭귄은 적응된 생리적 특성으로 인해 예외이다. 따라서 펭귄은 날 수 없다.
-
•
상식 추론:
Sarah가 Mike보다 키가 크고 Mike가 John보다 키가 크다면, 가장 키가 작은 사람은 누구인가?
단계별 분석: John은 Mike보다 키가 작고 Mike는 Sarah보다 키가 작으므로, John이 가장 키가 작다.
5.1.3. 사고 사슬 프롬프팅의 장점
CoT 프롬프팅은 다음과 같은 몇 가지 핵심 이점을 제공한다.
-
•
향상된 논리적 추론:
구조화된 사고를 장려하여 잘못된 결론에 이를 가능성을 줄인다 [2].
-
•
향상된 해석 가능성:
AI가 생성한 응답을 더 쉽게 따라가고 검증할 수 있게 한다 [2].
-
•
복잡한 작업에서의 더 나은 성능:
수학적 문제 해결, 논리적 추론, 다중 홉 질의응답과 같이 심층 추론을 요구하는 작업에 매우 효과적이다 [91].
-
•
도메인 전반의 일반화:
CoT 프롬프팅은 퓨샷 및 제로샷 조건에서 모델 성능을 향상하여 익숙하지 않은 작업과의 더 나은 정렬을 촉진한다 [92].
5.1.4. 사고 사슬 프롬프팅의 한계
장점에도 불구하고, CoT 프롬프팅에는 몇 가지 과제가 있다.
-
•
증가한 토큰 사용량:
단계별 설명을 생성하려면 더 긴 응답이 필요하며, 이는 더 높은 계산 비용으로 이어진다 [2].
-
•
단계 품질에 대한 의존성:
CoT 프롬프팅의 효과는 잘 구조화된 추론 단계에 의존한다. 부실하게 설계된 CoT 프롬프트는 오해를 불러일으키는 결론을 초래할 수 있다 [93].
-
•
단순 작업에서의 제한된 유용성:
다단계 추론을 필요로 하지 않는 작업은 CoT 프롬프팅으로부터 큰 이점을 얻지 못할 수 있으며 직접 응답으로 더 효율적으로 해결될 수 있다 [2].
CoT 프롬프팅을 효과적으로 활용하면 AI 모델은 추론 능력을 크게 향상할 수 있으며, 투명성과 시스템 간 호환성을 촉진하면서 복잡한 분석을 위해 더 신뢰할 수 있게 된다.
비판적 분석
사고 사슬 프롬프팅은 산술 및 상식 벤치마크에서 추론 정확도를 크게 향상한다 [2]. 그러나 중간 추론 오류는 전파될 수 있으며 토큰 사용량을 증가시킬 수 있다.
이 절충안은 해석 가능성 향상과 계산 비용 간의 관계를 반영한다.
열린 연구 방향에는 추론 압축과 자동 오류 감지가 포함된다.
5.2. 자동 사고 사슬(Auto-CoT) 프롬프팅
자동 사고 사슬(Automatic Chain-of-Thought, Auto-CoT) 프롬프팅은 전통적인 사고 사슬(CoT) 방법의 개선된 버전이다 [89]. CoT에서 도입된 단계적 추론 원리를 바탕으로, Auto-CoT는 질문을 군집화하고 수동 주석 없이 시연 사례를 유도하여 추론 예시 생성을 자동화한다 [93].
5.2.1. 작동 원리
Auto-CoT는 다음 단계로 작동한다.
-
• 1단계: 질문 자동 표본 추출 – 모델은 주어진 데이터세트에서 대표적인 예시를 선택하거나 새로운 예시를 생성한다 [93].
-
• 2단계: 자체 생성 추론 경로 – 모델은 이러한 질문을 해결하기 위한 중간 추론 단계를 생성한다 [93].
-
• 3단계: 최적 체인 선택 – 여러 추론 경로를 생성하고, 그 일관성과 정확성에 따라 가장 좋은 경로를 동적으로 선택한다 [93].
-
• 4단계: 퓨샷 적용 – 가장 성능이 좋은 예시를 새로운 질문에 답하기 위한 컨텍스트로 사용하여 퓨샷 학습을 향상한다 [93].
그림 9에 나타난 것처럼, 이 과정은 논리적 일관성을 유지하면서 인간의 노력을 줄이기 위해 추론 예시를 반복적으로 구성한다 [89,94].
Auto-CoT를 사용하면 LLM은 특히 수학적 도출, 논리적 추론, 질의응답과 같은 복잡한 추론 작업에서 서로 다른 문제 도메인 전반에 더 잘 일반화할 수 있다. 이러한 자동화는 확장성과 효율성을 향상하여 프롬프트 엔지니어링 및 AI 보조 추론에서 유망한 발전을 이룬다.
5.2.2. 자동 사고 사슬(Auto-CoT) 프롬프팅의 예시
Auto-CoT는 특히 다음과 같은 추론 집약적 작업에 효과적이다:
-
•
수학적 추론:
“한 가게에서 사과를 개당 $2에 판매하고 5개 이상 구매 시 10% 할인을 제공한다면, 사과 6개의 가격은 얼마인가?”
모델은 최선의 분해 과정을 생성하고 선택한다: “할인 전 가격:
. 할인: 12의 10% = 1.2. 최종 가격 = 12 – 1.2 = 10.8.”
-
•
논리적 연역:
“Tom이 Jerry보다 나이가 많고 Jerry가 Sam보다 나이가 많다면, 가장 어린 사람은 누구인가?”
모델은 자동으로 추론 경로를 구성한다: “Tom > Jerry > Sam. Sam이 가장 어리다.”
-
•
사실 기반 질의응답:
“육지 면적이 가장 큰 나라는 어디인가?”
모델은 최선의 Auto-CoT 설명을 선택한다: “육지 면적이 가장 큰 나라는 약 1,700만 제곱킬로미터를 차지하는 러시아이다.”
5.2.3. 자동 사고 사슬(Auto-CoT) 프롬프팅의 장점
Auto-CoT는 수동 CoT 프롬프팅에 비해 몇 가지 핵심적인 개선점을 제공한다:
-
•
추론 예시의 자동화:
사람이 설계한 프롬프트에 대한 의존도를 낮춘다 [93].
-
•
향상된 일반화:
모델이 더 다양하고 효과적인 추론 사슬을 생성하도록 돕는다 [93].
-
•
확장성:
수작업 없이 대규모 데이터셋에 적용할 수 있다 [93].
-
•
적응형 학습:
가장 정확하고 일관된 추론 경로를 동적으로 선택한다 [93].
5.2.4. 자동 사고 사슬(Auto-CoT) 프롬프팅의 한계
장점에도 불구하고 Auto-CoT에는 몇 가지 과제가 있다:
-
•
부정확한 추론의 가능성:
사람의 검증 없이 모델이 결함 있는 추론 단계를 생성할 수 있다 [93].
-
•
증가한 계산 비용:
여러 추론 사슬을 실행하려면 더 많은 처리 능력이 필요하다 [93].
-
•
데이터 품질 의존성:
Auto-CoT의 효능은 선택된 예시의 품질과 다양성에 달려 있다 [93].
그림 9. [89]에서 제안한 Auto-CoT 방법. 이 그림은 논문에서 이용 가능한 스케치와 기타 정보를 바탕으로 다시 그렸다.
5.2.5. 다중모달 사고 사슬(Auto-CoT) 프롬프팅
CoT는 다중모달일 수 있다. 다중모달 CoT는 동일한 CoT 프레임워크를 사용하지만 여러 모달리티에서 정보를 얻는다. 사용자는 붐비는 공공장소의 사진을 보여 주고 그 장소가 오전에 인기 있는지 물을 수 있다 [95,96].
5.3. 자기 일관성
자기 일관성은 대규모 언어 모델(LLM)의 내재적 확률적 특성을 활용하여, 특히 복잡한 추론 작업에서 산출물의 품질, 정밀도, 신뢰성 및 견고성을 향상시키는 프롬프팅 방법이다 [97].
고정된 방법에 의존해 해결책에 도달하는 전통적인 단일 경로 추론과 달리, 자기 일관성은 동일한 문제에 대해 여러 다양한 추론 경로를 생성하고 이러한 대안들 중 가장 일관된 응답을 식별한다 [98]. 이 기법은 모델 출력의 무작위 변동이 미치는 영향을 효과적으로 줄여 추론 과정을 더 구조적이고 논리적으로 만든다. 해결책에 도달하기 위해 고정된 방법에 의존하는 전통적인 단일 경로 추론과 달리, 자기 일관성은 동일한 문제에 대해 여러 다양한 추론 경로를 생성하고 이러한 대안들 중 가장 일관된 응답을 식별한다 [99]. 이 확률적 방법은 수학, 일상적 추론, 전략적 의사결정을 포함한 다양한 영역에서 정확한 해결책을 도출하는 모델의 숙련도를 강화하는 동시에 모호성, 논리적 연역 및 다단계 문제 해결을 처리하는 능력을 증대한다. 또한 자기 일관성은 휴리스틱 지름길에서 비롯되는 오류를 완화하는 데 핵심적이며, 이로써 엄격한 논리적 연역이 요구되는 실제 응용에서 LLM의 신뢰성을 높인다.
5.3.1. 작동 원리
자기 일관성은 복잡한 추론 문제의 정답에 도달하는 실행 가능한 방법이 여러 가지 있다는 원리에 따라 작동한다 [97]. 이 과정에는 다음이 포함된다:
-
• 다양한 추론 경로 생성: LLM은 샘플링을 활용한 CoT 프롬프팅 등의 기법을 사용하여 동일한 문제에 대한 여러 추론 사슬을 생성하도록 프롬프트된다 [97].
-
• 평가 및 주변화: 생성된 추론 경로를 평가하고, 이 경로들에 대해 주변화를 수행하여 가장 신뢰할 수 있는 응답을 결정한다 [97]. 이는 여러 사고 흐름이 모여 최종 응답을 산출하도록 보장한다.
-
• 답변 집계: 생성된 추론 경로 중 가장 우세하거나 일관된 응답으로 최종 답변을 결정한다 [97]. 이 집계 과정은 가장 신뢰할 수 있는 해결책을 식별하는 데 도움이 된다.
그림 10에 나타난 바와 같이, 자기 일관성 방법은 세 가지 주요 단계로 구성된다: (1) 언어 모델 향상을 위한 사고 사슬(CoT) 프롬프팅 활용, (2) 다양한 추론 경로를 생성하기 위해 기존의 탐욕적 디코딩 방식을 샘플링으로 대체, (3) 가장 일관된 응답을 통합하기 위해 서로 다른 추론 경로를 주변화한다. 이러한 언어 모델의 적용은 단일 경로 추론을 통해 추론 능력을 향상시켜, 모델이 출력을 생성하기 전에 다양한 가능성을 탐색할 수 있도록 한다. 자기 일관성 기법은 응답 생성에 다양성을 도입하고 가장 신뢰할 수 있는 응답을 결정함으로써 언어 모델의 추론 능력을 개선한다. 이 접근법은 모델이 출력을 확정하기 전에 다양한 가능성을 탐색하도록 하여 편향되거나 부정확한 단일 경로 추론의 가능성을 줄인다. 자기 일관성을 활용함으로써 언어 모델은 특히 수학, 상식 추론, 구조화된 의사결정과 같이 논리적 추론이 필요한 영역에서 복잡한 문제 해결 작업의 정확도를 높인다.
그림 10.
자기 일관성 접근법은 세 단계의 과정을 통해 언어 모델의 추론을 개선한다: (1) 구조화된 추론을 위한 CoT 프롬프팅 사용, (2) 다양한 추론 경로를 탐색하기 위한 디코더 샘플링, (3) 견고한 결론을 위해 가장 일관된 답변 선택 [97].
• 다단계 산술:
“다음의 값은
?”
모델은 여러 추론 경로를 생성하며, 각 경로에는 서로 다른 중간 단계와 잠재적으로 서로 다른 최종 답변이 있다. 자기 일관성을 적용하면 가장 일관된 답변인 11을 식별한다.
• 상식 추론:
“비가 오는데 밖에 나가고 싶다면 무엇을 가지고 가야 하는가?” 모델은 우산, 우비 또는 둘 다와 같은 서로 다른 답변을 생성할 수 있다. 자기 일관성은 맥락에 따라 가장 일관되고 타당한 답변을 식별하는 데 도움이 된다.
• 기호 추론:
“A가 B보다 크고 B가 C보다 크다면, A는 C보다 큰가?” 모델은 답에 도달하기 위해 서로 다른 논리 사슬을 생성할 수 있다. 자기 일관성은 최종 답변이 생성된 논리 경로 대부분과 일관되도록 보장한다.
5.3.3. 자기 일관성의 장점
자기 일관성은 여러 이점을 제공한다:
-
• 향상된 정확도: 복잡한 추론 작업에서 정답을 얻을 가능성을 높인다 [97].
-
• 견고성: 추론 경로에서 발생하는 개별 오류나 불일치의 영향을 줄인다 [97].
-
• 다용성: 다양한 샘플링 알고리즘 및 프롬프팅 기법과 결합할 수 있다 [97].
-
• 해석 가능성: 모델이 고려한 서로 다른 추론 경로에 대한 통찰을 제공한다 [97].
5.3.4. 자기 일관성의 한계
자기 일관성 방법은 여러 샘플링된 응답을 집계하여 추론을 개선하지만, 몇 가지 한계가 있다:
-
• 증가한 계산 비용: 여러 추론 경로를 생성하면 계산 오버헤드가 증가한다 [97].
-
• 샘플링 품질 의존성: 자기 일관성의 효과는 생성된 추론 경로의 다양성에 의존한다 [97].
-
• 편향의 가능성: 모델이 특정 추론 패턴에 편향되어 있다면, 자기 일관성이 이 편향을 증폭할 수 있다 [97].
-
• 모호하거나 개방형 질문 처리의 어려움: 여러 유효한 답변이 존재할 경우, 이 방법은 가장 “일관된” 응답을 결정하는 데 어려움을 겪어 잠재적인 오해로 이어질 수 있다 [100].
-
• 모든 과제로의 일반화 한계: 자기 일관성은 구조화된 추론 과제에서 가장 잘 작동하지만, 다양한 답변이 동등하게 유효한 창의적 또는 추상적 문제 해결에서는 효과가 떨어질 수 있다 [5].
-
• 확장성 과제: 샘플링된 추론 경로의 수가 증가함에 따라 메모리 및 처리 제약이 중요해져 대규모 응용으로 확장하기 어려워진다 [101,102].
이러한 한계에도 불구하고, 자기 일관성은 특히 예측 가능하고 검증 가능한 응답이 필요한 과제에서 언어 모델의 논리적 추론을 강화하는 데 중요한 역할을 한다.
비판적 종합
자기 일관성은 여러 추론 경로를 샘플링하고 합의된 출력을 선택함으로써 추론의 견고성을 향상한다 [97]. 경험적 증거는 탐욕적 디코딩 대비 일관된 개선을 보여준다.
실패 조건:
여러 순전파로 인한 계산 오버헤드.
상충 관계:
다양성을 통한 견고성과 추론 비용 간의 균형.
미해결 과제:
추론 다양성을 유지하면서 샘플링 복잡도를 줄이는 것.
5.4. 논리적 CoT(LoT) 프롬프팅
LoT 프레임워크는 LLM의 제로샷 사고 사슬(CoT) 추론 능력을 향상하기 위한 새로운 프롬프팅 기법이다. LoT의 핵심은 기존 CoT 접근법의 주요 한계, 즉 LLM이 환각을 일으키거나 논리적으로 일관되지 않은 추론 흔적을 생성하는 경향을 해결하는 데 있다 [103]. LLM은 인상적인 일반화 능력과 사실 기억을 보여 왔지만, 다단계 추론은 종종 오류 전파로 인해 신뢰할 수 없는 결론에 이른다. LoT는 상징 논리의 고전적 원리, 특히
귀류법
을 활용하여 추론 과정에 체계적인 검증 메커니즘을 통합한다. 이 프레임워크에서 추론 단계를 생성하는 일은 일회성 과정이 아니다. 대신 각 단계는 논리적 일관성을 위해 이전에 확립된 전제와 비교하여 비판적으로 평가된다 [103]. 이 방법은 LLM이 다음을 수행하도록 안내하는 “생각-검증-수정” 루프를 도입한다 [61,72]:
-
•
생각
: 초기 추론 단계 사슬을 생성한다.
-
•
검증
: 현재 단계가 이전의 검증된 모든 단계로부터 논리적으로 귀결되는지 확인하여 생성된 각 단계를 평가한다.
-
•
수정
: 검증 기준을 충족하지 못하는 단계를 수정하거나 다시 생성한다.
이 과정은 LLM이 추론 경로를 동적으로 정제할 수 있게 한다. LoT는 각 단계에 논리적 검증을 통합함으로써 오류를 최소화하고 각 결론이 이용 가능한 증거와 논리 규칙에 확고히 근거하도록 하는, 더 견고하고 신뢰할 수 있는 추론 사슬을 생성하는 것을 목표로 한다. 이 프레임워크는 수학 문제 해결, 인과 추론, 상식 추론과 같이 다단계 추론이 필요한 활동에 특히 적합하다 [72,103].
5.4.1. 작동 원리
LoT 프롬프팅의 기본 작동 원리는 사고 과정 전체의 논리적 일관성을 보장하는 구조화된 추론과 검증의 반복적 순환을 중심으로 한다. 이 방법론은 단계적 논리 추론 접근법을 포함하는 “생각-검증-수정” 패러다임에 기반한다 [72].
1. 초기 추론 생성: 제로샷 환경에서 LLM은 (예: “단계별로 생각해 봅시다”와 같은 문구로) 일련의 추론 단계를 생성하도록 프롬프트된다.
로 표기되는 이 단계들은 초기 프롬프트 또는 주어진 전제
로부터 자기회귀적으로 도출된다. 이 초기 사고 사슬은 문제를 분해하지만, 명시적 논리 제약이 없으므로 오류에 취약하다.
2. 논리적 일관성 검사를 이용한 검증: 각 추론 단계
는 논리적 함의
,
를 살펴봄으로써 확인된다. 귀류법의 원리가 검증 메커니즘에 영감을 준다. 구체적으로 프레임워크는 다음의 논리곱 명제를 고려한다:
그리고 이 명제가 모순으로 이어지는지 검토한다.
가 모순적(즉, 모든 값 할당에서 거짓)인 것으로 판명되면,
는 선행 단계들로부터의 유효한 논리적 귀결로 간주된다. 검증 과정의 두 가지 변형이 제안된다:
-
• Cmps-LoT: 모델이
의 부정에 대한 사후 설명을 생성한 후
에서 불일치가 있는지 확인하도록 지시하는 직접적인 접근법이다.
-
• Adpt-LoT:
를 뒷받침하는 사후 설명과 그 부정
을 뒷받침하는 또 다른 사후 설명, 두 가지를 생성하는 더 고도화된 변형이다. 이어서 모델은 두 설명 중 어느 것이 확립된 전제와 더 일관적인지 결정하기 위한 선호도 판별 과제를 수행한다. 이 이중 점검 메커니즘은 자기회귀 생성 과정에 내재한 편향을 완화하는 데 도움이 된다.
-
3. 수정 및 사슬 확장: 추론 단계 중 하나라도
가 검증에 실패하면 프레임워크는 수정 절차를 시작한다. 이 단계에서는 오류가 있는 단계(및 그 이후의 모든 단계)를 제거하고, 모델이 식별된 불일치를 바로잡는 대안
를 생성하도록 프롬프트한다. 이 과정은 검증된 추론 단계의 완전한 사슬이 생성될 때까지 반복적으로 계속된다. 새로운 추론 단계가 검증 검사를 성공적으로 통과할 때에만 사슬이 “확장”된다고 한다.
5.4.2. 논리적 사고(LoT)의 예시
논리적 사고(LoT) 과제는 구조화된 추론과 추론적 판단이 필요한 다양한 문제 해결 시나리오를 포함한다. 신뢰할 수 있는 결과에
도달하기 위해, 이 과제들은 관계를 검토하고, 패턴을 식별하며, 연역적 또는 귀납적 추론을 사용하는 모델의 능력을 활용한다. LoT 프롬프팅 기법을 활용하면 언어 모델은 복잡한 논리 문제를 순차적 단계로 효과적으로 분해하여 정확성과 해석 가능성을 높일 수 있다 [72]. 다음 예시는 수학적 추론, 논리적 연역, 사실 기반 질의응답을 다루는 데 있어 LoT의 효과를 보여 주며, 서로 다른 영역에서 LoT가 적용되는 방식을 설명한다.
-
• 산술 추론: 여기서는 간단한 산술 추론 예시를 제시한다:
문제
: 두 수를 곱한 값이 36이고 그중 하나가 4일 때, 다른 수는 무엇인가?
기존 LLM 응답
: 다른 수는 9이다.
LoT 강화 응답
:
-
1. 생각: 미지수를
라고 하자.
이 주어졌다.
-
2. 검증:
에 대해 풀면,
를 얻는다.
-
3. 수정: 검증:
으로, 주어진 정보와 일치한다. 따라서 다른 수는 실제로 9이다.
-
• 상식 추론: 여기서는 간단한 상식 추론 예시를 제시한다:
문제
: Tom이 Jerry보다 키가 크고 Jerry가 Sam보다 키가 크다면, 가장 키가 작은 사람은 누구인가?
기존 LLM 응답
: Sam이 가장 작습니다.
LoT 강화 응답
:
-
1. 사고: 키 관계는 다음과 같습니다:
.
-
2. 검증: Tom은 Jerry보다 키가 크고 Jerry는 Sam보다 키가 크므로, Tom은 Sam보다 키가 크다는 결론이 나옵니다.
-
3. 수정: 따라서 Tom과 Jerry보다 모두 작은 Sam이 가장 작습니다.
-
• 기호적 추론: 기호적 추론은 다음과 같습니다:
문제
: 모든 장미는 꽃입니다. 일부 꽃은 빨리 시듭니다. 특정 장미가 빨리 시든다는 결론을 내릴 수 있을까요?
기존 LLM 응답
: 예, 일부 장미는 빨리 시듭니다.
LoT 강화 응답
:
-
1. 사고: 모든 장미는 꽃입니다. 특정 꽃은 빨리 시듭니다.
-
2. 검증: 특정 꽃이 빨리 시든다고 해서 그것이 장미라는 뜻은 아닙니다.
-
3. 수정: 따라서 전제만으로는 일부 장미가 빨리 시든다고 단정할 수 없습니다.
5.4.3. 논리적 사고(LoT)의 장점
논리적 사고(Logical Thoughts, LoT) 프레임워크를 대규모 언어 모델(LLM)에 통합하면, 특히 추론 능력 향상, 환각 감소, 논리적 일관성 보장 측면에서 여러 이점을 제공합니다. 주요 이점은 다음과 같습니다 [72]:
-
• 정확성과 논리적 일관성 향상: 기존 LLM은 훈련 데이터의 통계적 패턴을 기반으로 응답을 생성하며, 종종 추론 단계를 검증하는 명시적 메커니즘이 부족합니다. LoT 프레임워크는 귀류법(Reductio ad Absurdum)과 같은 논리적 검증 원칙을 체계적으로 적용하여 모든 중간 추론이 논리적으로 타당하도록 보장함으로써 이 한계를 해결합니다. 이는 특히 수학, 형식 논리, 법률 분석과 같이 구조화된 추론이 필요한 분야에서 더 정확한 결론으로 이어집니다.
-
• 환각 감소: 현대 LLM의 주요 문제 중 하나는 사실과 다르지만 높은 확신을 가지고 제시되는 환각된 정보 진술을 생성하는 경향입니다. LoT는 논리적 검증 단계를 강제하여 이 문제를 완화합니다. 생성된 각 응답은 내부 일관성 검사를 거쳐 근거 없거나 부정확한
진술의 위험을 줄입니다. 이러한 개선은 잘못된 추론이 중대한 결과를 초래할 수 있는 의료 진단, 금융 분석 및 법적 의사 결정 애플리케이션에서 특히 중요합니다.
-
•
제로샷 일반화 개선:
LLM을 포함한 많은 딥러닝 모델은 제로샷 추론 과제에서 최적에 못 미치는 성능을 보이는데, 여기에는 유사한 샘플이 모델을 정식으로 훈련하는 데 사용되지 않은 상황이 포함됩니다. LoT 프레임워크는 문제 해결에 대한 체계적인 접근법을 제공하여 모델이 복잡한 질의를 논리적으로 검증 가능한 단계로 분해할 수 있게 함으로써 제로샷 추론을 개선합니다. 이 기능은 정리 증명, 알고리즘 문제 해결, 과학적 가설 검증과 같은 분야에서 특히 유용합니다.
-
•
적대적 프롬프팅에 대한 견고성:
LLM은 통계적 편향을 악용하여 부정확하거나 오해의 소지가 있는 응답을 유도하는 적대적 프롬프트에 취약합니다. LoT 프레임워크는 논리적 검증을 통합하여 모델의 견고성을 강화하고 조작적 질의에 덜 취약하게 만듭니다. 예를 들어 역설적이거나 오해의 소지가 있는 전제가 제시될 때, 모델은 논리적 불일치를 감지하고 부정확한 결론 생성을 피할 수 있습니다.
5.4.4. 논리적 사고(LoT)의 한계
이점에도 불구하고 LoT 프롬프팅에는 몇 가지 한계가 있습니다:
-
•
계산 비용:
논리 연산과 제약 조건을 처리하면 계산 오버헤드가 증가할 수 있습니다 [2]. 반복적인 사고-검증-수정 주기는 추가적인 계산 단계를 도입하여 추론 시간을 늘립니다. 단일 순방향 패스로 생성되는 표준 LLM 응답과 달리, LoT는 논리적 정확성을 검증하기 위해 여러 번의 반복을 요구합니다. 이 추가 계산은 챗봇, 실시간 번역 시스템 또는 대화형 AI 비서와 같은 실시간 애플리케이션에서 병목 현상이 될 수 있습니다.
-
•
지식 의존성:
외부 정보 출처의 정확성과 접근성은 LoT의 효과에 필수적입니다 [27]. LoT 프레임워크는 추론을 향상시키지만 외부 지식을 도입하지는 않습니다. LLM에 필요한 사실적 또는 도메인별 지식이 부족하면, 논리적 검증에도 불구하고 여전히 올바른 결론을 도출하는 데 어려움을 겪을 수 있습니다. 이 한계는 LoT가 지식 검색 메커니즘 또는 도메인별 데이터셋으로 훈련된 미세 조정 모델과 결합될 때 가장 효과적임을 시사합니다.
-
•
상식 및 확률적 추론의 과제:
논리 기반 검증은 수학과 형식적 추론 같은 구조화된 영역에서 뛰어나지만, 상식 추론이나 확률적 추론에서는 그만큼 효과적이지 않을 수 있습니다. 인간의 추론은 엄격한 논리적 연역보다는 휴리스틱, 직관, 경험에 의존합니다. 따라서 LoT 프레임워크는 은유, 유머 또는 주관적 의견 해석과 같이 미묘한 맥락적 이해가 필요한 과제에 어려움을 겪을 수 있습니다.
-
•
오류 전파 가능성:
초기 논리 단계에 오류가 있으면 이후의 검증 단계가 이를 수정하지 못해 잘못된 추론으로 이어질 수 있습니다. LoT 프레임워크의 효과는 모델이 논리적 개념을 적절히 적용하는 능력에 달려 있습니다. 모델이 논리 규칙을 잘못 해석하면, 검증 과정은 잘못된 결론을 바로잡기보다 오히려 강화할 수 있습니다.
-
•
복잡한 사고 연쇄에서의 해석 가능성 부족:
LoT는 논리적 추론을 향상시키지만 LLM의 해석 가능성 문제를 완전히 해결하지는 못합니다. 복잡한 문제를 해결할 때 생성된 사고 연쇄는 여전히 인간 사용자에게 불투명하게 보일 수 있습니다. 향후 연구에서는 사용자가 각 논리 단계의 정확성을 검증할 수 있도록 추론 과정을 더 투명하고 설명 가능하게 만드는 방법을 탐색해야 합니다.
5.5. 기호 연쇄(CoS) 프롬프팅
설명을 간결한 기호 표현으로 변환합니다. 상세한 언어적 추론에 의존하는 기존 사고 연쇄(Chain-of-Thought, CoT) 접근법과 달리, CoS 프롬프팅은 중간 추론 단계를 생성하고 공간 설명을 추상 기호 집합으로 체계적으로 대체합니다. 이러한 기호 변환은 중복 정보를 줄이고 상대적 위치와 이동 같은 기본 공간 관계를 더 구조화되고 효율적인 형식으로 캡슐화하여 모델 정확도를 높이고 계산 오버헤드를 줄입니다 [104].
근본적으로 CoS 프롬프팅은 복잡한 공간 과제를 일련의 모듈형 기호 연산으로 추상화하며, 각 기호는 특정 공간 관계 또는 동작을 나타냅니다. 이러한 추상화는 추론 과정의 더 정밀한 추적 가능성과 해석 가능성을 촉진하여 모델이 복잡한 공간 환경을 더 높은 정밀도로 다룰 수 있게 합니다. 또한 간소화된 기호 표현은 Brick World 및 기타 공간 계획 과제와 같은 벤치마크 과제에서 입증된 바와 같이, 특히 공간 요소의 세부 계획과 조작이 필요한 시나리오에서 더 확장 가능한 성능을 제공합니다 [104].
5.5.1. 작동 원리
기호 연쇄 프롬프팅의 작동 원리는 자연어로 중간 추론을 생성한 다음 이 출력을 압축된 기호 표현으로 변환하는 두 단계 과정에 기반합니다. 처음에는 퓨샷 맥락에서 모델에 공간 계획 과제에 대한 단계별 접근법을 개괄하는 상세한 사고 연쇄 추론을 생성하도록 요청합니다. 이후 이 추론은 특정 공간 관계나 연산을 각각 나타내는 미리 정의된 추상 기호로 장황한 공간 설명을 체계적으로 대체하여 정제됩니다. 이를 통해 이 과정은 자연어에 내재된 중복을 완화하고 중간 추론을 모델의 내부 계산 구조에 더 밀접하게 정렬하여 효율성과 명확성을 향상시킵니다 [104].
실질적으로 이 접근법은 처음에 완전한 자연어로 설명된 공간 시나리오를 기호 시퀀스로 변환하는 시연을 구성하는 것을 포함합니다. 이 기호들은 "위에 있는" 또는 "인접한"과 같은 공간 관계를 위한 원자적 토큰으로서, 복잡한 공간 환경을 탐색하는 데 필요한 핵심 논리를 담고 있습니다. 추론 중에 적용될 때 기호 연쇄는 모델의 최종 의사 결정 과정을 안내하는 간결한 청사진이 됩니다. 이 방법은 투명하고 추적 가능한 추론 경로를 제공하면서 토큰 수와 계산 오버헤드를 크게 줄이고, 궁극적으로 공간 추론 과제의 정확도를 향상시킵니다 [104].
5.5.2. 기호 연쇄(CoS) 프롬프팅의 예시
예시 1. Brick World 과제
시나리오:
-
• 특정 순서로 쌓인 벽돌 세트가 있습니다.
-
• 과제는 공간 제약을 준수하면서 특정 벽돌을 꺼내는 것입니다. 벽돌은 그 위에 다른 벽돌이 없을 때만 제거할 수 있습니다.
자연어 프롬프트(CoT 스타일):
-
1. 벽돌 B 위에서 벽돌 A를 제거합니다.
-
2. 벽돌 D 위에서 벽돌 E를 제거합니다.
-
3. 이제 벽돌 D가 가장 위에 있는 노란색 벽돌이므로 집을 수 있습니다.
기호 연쇄 프롬프팅:
B/A/D/E/C
C/E
E/D D
그림 11.
CoT와 CoS 프롬프팅의 비교 예시입니다. CoS가 LLM이 더 적은 입력 토큰으로 복잡한 과제를 효율적으로 제어할 수 있게 하는 방식을 강조합니다. [104]의 개념을 바탕으로 작성되었습니다.
예시 2: 자연어 탐색 시나리오:
-
• 도로와 랜드마크 세트가 주어집니다.
-
• 출발점에서 목표 랜드마크까지 가장 빠른 경로를 결정하는 것이 목적입니다.
CoT 프롬프트(자연어 추론):
-
1. Bank A에서 시작합니다.
-
2. Bank C까지 200m 이동한다.
-
3. House H까지 100m 이동한다.
-
4. Cinema F까지 100m 이동한다.
-
5. Store B까지 200m 이동한다.
-
6. Store B가 가장 가까운 상점이다.
CoS 프롬프트:
A / C / H / F / B
각 위치는 추가적인 설명 텍스트 없이 이동 경로를 나타내는 기호 표기법으로 연결된다. 예시 3: NLVR 기반 객체 조작 시나리오:
-
• 세 개의 상자에는 서로 다른 색상, 형태 및 크기의 객체가 들어 있다.
-
• 목표는 모든 검은색 객체를 왼쪽 상자로 옮기는 것이다.
CoT 프롬프트(자연어 추론):
-
1. 세 상자에서 모든 검은색 객체 식별:
-
• 왼쪽 상자: (large, round, black)
-
• 가운데 상자: (large, round, black)
-
• 오른쪽 상자: (middle, triangle, black), (large, triangle, black)
-
2. 객체를 왼쪽 상자로 이동:
-
• (large, round, black): middle → left
-
• (middle, triangle, black): right → left
-
• (large, triangle, black): right → left
CoS 프롬프트:
(M, large, round, black) → L
(R, middle, triangle, black) → L
(R, large, triangle, black) → L
여기서 기호 형식은 중복 없이 이동을 직접 나타낸다.
그림 11에서 보듯이, 기호 연쇄(CoS) 프롬프팅은 장황한 자연어를 대체하여 공간 추론을 효과적으로 향상한다.
설명을 구조화된 기호 표현으로 대체한다. 이 예에서는 벽돌 회수 작업에서 CoT와 CoS 프롬프팅 방법을 비교한다. CoT 접근법은 모호한 추론으로 인해 잘못된 순서를 도출하는 반면, CoS 접근법은 공간 관계를 기호 형식으로 추상화하여 더 효율적이고 정확한 해결책으로 이어진다.
5.5.3. 기호 연쇄(CoS) 프롬프팅의 장점
CoS 프롬프팅은 여러 장점을 제공한다:
-
• 향상된 추론: 모델이 논리적 추론과 기호 조작을 사용하여 복잡한 사고 과제를 완료할 수 있게 한다 [104].
-
• 해석 가능성: 기호 표현을 사용하여 추론 과정의 투명성과 이해 가능성을 높인다 [104].
-
• 정확성: 정확한 기호 표현을 사용하여 자연어의 모호성 또는 불명확성으로 인한 오류를 줄인다 [104].
-
• 일반화: 논리, 수학 및 계획 과제와 같은 다양한 추론 연습에 사용할 수 있다 [104].
5.5.4. 기호 연쇄(CoS) 프롬프팅의 한계
장점에도 불구하고 CoS 프롬프팅에는 몇 가지 한계가 있다:
-
• 기호 표현: 문제에 적합한 기호 표현이 필요하며, 이를 항상 쉽게 마련할 수 있는 것은 아니다 [104].
-
• 계산 비용: 특히 복잡한 문제에서 기호 조작과 추론에는 많은 계산 비용이 들 수 있다 [104].
-
• 제한된 표현력: 자연어의 미묘함과 복잡성은 기호 표현만으로 충분히 전달되지 않을 수 있다 [104].
6. 다단계 의사결정 및 계획(결정 전에 여러 경로 탐색)
6.1. 사고 트리(ToT) 프롬프팅
ToT 프롬프팅은 LLM이 다양한 논증 경로를 탐색하고 서로 다른 해결책을 숙고할 수 있게 하여 문제 해결 능력을 향상하는 정교한 프롬프팅 방법이다 [105]. 선형적인 추론 사슬을 따르는 전통적인 CoT 프롬프팅과 달리, ToT 프롬프팅은 모델이 가능한 해결책의 트리를 생성하고 이를 평가하며, 중간 결과에 따라 최선의 경로를 동적으로 선택할 수 있게 한다 [105,106]. 이 방법은 LLM에서 더 사려 깊고 전략적인 의사결정을 장려하며,
그림 12.
이 그림은 LLM을 활용하는 다양한 문제 해결 기법을 개략적으로 비교하여 제시한다. 이 시각화의 핵심 요소는 사고를 나타내는 직사각형 상자로, 과업 완료를 향한 중간 단계 역할을 하는 일관된 언어 단위이다 [105].
LLM이 다단계 계획과 다양한 전략의 탐색이 필요한 복잡한 문제를 해결할 수 있게 한다 [105].
6.1.1. 작동 원리
사고 트리(ToT) 프레임워크는 구조화된 추론 트리 내에서 탐색, 평가 및 선택이 순환하는 과정을 통해 작동한다. 이 반복적 접근법은 대규모 언어 모델(LLM)이 단순한 토큰 단위 생성을 넘어 더욱 정교한 문제 해결 전략에 참여할 수 있게 한다 [105]. ToT의 작동 원리는 단계별 워크플로로 나누어 살펴볼 수 있다:
-
1. 초기화: 이 과정은 초기 프롬프트를 통해 LLM에 제시되는 입력 문제에서 시작한다. 프롬프터 에이전트가 조율하는 이 프롬프트는 LLM이 최종 출력을 직접 구하는 대신 중간 ‘사고’를 생성하도록 유도하게 설계된다 [105,107].
-
2. 현재 상태에서의 사고 생성: 현재 상태(처음에는 문제 입력)에서 시작하여, 사고 생성 모듈은 문제 해결 과정에서 잠재적인 다음 단계를 나타내는 후보 ‘사고’ 집합을 생성한다 [Yao et al., 2023]. 생성 전략은 과제와 원하는 사고의 다양성에 따라 달라질 수 있다. 예를 들어, 풍부한 사고 공간을 가진 과제에는 사고 연쇄(CoT) 프롬프트에서의 독립 샘플링을 사용할 수 있는 반면, 더 제약된 영역에는 순차 제안 프롬프팅이 적합하다 [105].
-
3. 생성된 사고의 상태 평가: 생성된 각 ‘사고’는 부분 해결책 또는 추론의 중간 단계를 나타내는 새로운 상태로 이어진다. 이어서 상태 평가 모듈은 이러한 각 상태의 품질과 잠재력을 평가한다 [105]. 이 평가는 탐색 과정을 안내하는 데 매우 중요하다. 평가는 룩어헤드 시뮬레이션이나 상식적 추론에 기반하여 LLM이 가치 점수를 부여하도록 프롬프팅하거나, 유망하다고 인식되는 정도에 따라 상태를 비교하고 순위를 매기는 투표 메커니즘을 사용하는 등 다양한 휴리스틱을 통해 구현할 수 있다 [105].
-
4. 탐색 알고리즘 적용 및 상태 선택: 상태 평가는 깊이 우선 탐색(DFS) 또는 너비 우선 탐색(BFS)과 같은 탐색 알고리즘이 사고 트리를 순회하는 데 사용된다. [105]는 각 수준에서 가장 큰 잠재력을 보이는 상태 목록을 유지하고 이를 너비 방향으로 탐색한다.
DFS에서는 알고리즘이 먼저 가장 유망한 상태의 탐색을 우선시하고, 해결책을 찾거나 막다른 길에 도달할 때까지 해당 분기를 더 깊이 파고든다 [105]. 탐색 알고리즘은 이러한 평가와 선택한 탐색 전략에 기반하여 추가로 탐색할 다음 상태를 선택한다.
-
5. 반복 및 되돌아가기: 선택된 상태가 새로운 현재 상태가 되면서 과정이 반복된다. LLM은 이 상태에서 추가 사고를 생성하고, 사고 생성, 상태 평가 및 선택의 순환이 반복된다 [47,105]. 중요한 점은 ToT 프레임워크가 ToT 컨트롤러가 관리하는 되돌아가기 메커니즘을 통합한다는 것이다. 어떤 상태가 유망하지 않다고 판단되거나(평가 임계값 또는 탐색 알고리즘 기준에 따라) 유효하지 않은 해결책으로 이어지는 경우(검사기 모듈 [105]이 감지), 시스템은 이전 상태로 되돌아가 사고 트리의 대안 분기를 탐색할 수 있다 [105]. 이러한 되돌아가기 기능은 LLM이 잘못된 추론 단계에서 회복하고 다양한 해결 경로를 탐색할 수 있게 한다.
-
6. 해결책 도달 또는 종료: ToT 과정은 만족스러운 해결책을 찾거나(예: 수학 문제에서 목표값에 도달하거나 창작 글쓰기에서 일관된 문단을 생성하는 경우) 미리 정의된 탐색 한계(예: 최대 깊이 또는 반복 횟수)에 도달할 때까지 계속된다 [105,106].
그림 12는 입력-출력 프롬프팅(IO), 사고 연쇄 프롬프팅(CoT), CoT를 활용한 자기 일관성(CoT-SC), 사고 트리(ToT)를 포함하여 대규모 언어 모델에 사용되는 다양한 프롬프팅 전략을 비교하여 시각화한다. 각 기법은 구조화된 중간 단계를 통합함으로써 추론 능력을 점진적으로 향상한다. CoT가 단계별 추론을 도입하는 반면, CoT-SC는 다수결 투표와 함께 여러 추론 경로를 활용하여 과정을 정교화한다. 반대로 ToT는 추론 공간을 트리 구조로 확장하여 여러 사고 경로를 병렬로 탐색할 수 있게 하며, 궁극적으로 더 견고하고 정확한 출력을 이끈다. 이러한 계층적 접근법은 특히 복잡한 문제 해결 과제에서 유익하다 …
6.1.2. 사고 트리(ToT) 프롬프팅의 예시
ToT 프롬프팅은 다음과 같이 계획, 탐색 및 의사결정이 필요한 복잡한 문제 해결 시나리오에서 특히 효과적이다:
“인간 상대와 체스 게임을 두세요.”
LLM은 ToT 프롬프팅을 사용하여 서로 다른 가능한 수를 탐색하고, 그 잠재적 결과를 평가하며, 게임의 현재 상태에 따라 전략적으로 최선의 수를 선택한다.
“미스터리한 범죄를 해결하는 탐정에 관한 단편 소설을 쓰세요.”
LLM은 가능한 줄거리 지점, 인물 간 상호작용 및 서사적 반전의 트리를 생성하고, 흥미롭고 일관된 경로를 동적으로 선택하여 매력적인 이야기를 만든다.
“숫자 목록을 오름차순으로 정렬하는 프로그램을 작성하세요.”
LLM은 다양한 정렬 알고리즘을 탐색하고, 그 효율성과 복잡도를 평가하며, 과업의 특정 요구에 따라 최적의 알고리즘을 선택합니다.
1. 수학적 추론: 24 게임
문제 정의:
네 개의 수
가 주어졌을 때, 기본 산술 연산
을 사용하여 24를 만드는 수학적 식을 생성합니다.
사고 트리 접근법:
단일 응답을 생성하는 대신, ToT는 여러 추론 경로를 탐색합니다.
-
1. 사고 분해: 24에 이르는 중간 단계를 식별합니다.
-
2. 사고 생성: 여러 후보 단계를 생성합니다:
-
• 사고 1:
-
• 사고 2:
-
• 사고 3:
(값이 너무 커서 가능성이 낮음)
-
3. 사고 평가: 각 사고의 실현 가능성을 평가합니다:
-
• 사고 1은 수를 다루기 쉬운 범위로 유지하므로 유망합니다.
-
• 사고 2는 실행 가능하지만 즉시 24로 이어지지는 않습니다.
-
• 사고 3은 값이 지나치게 커서 가지치기됩니다.
-
4. 탐색 및 역추적: 모델은 가장 유망한 경로를 선택하고, 필요하면 역추적합니다.
최종 해법:
2. 논리적 추론: 스도쿠 풀이기
문제 정의:
사고 트리를 사용하여 스도쿠 퍼즐을 풉니다.
ToT 접근법
-
1. 사고 분해: 빈 칸을 식별하고 가능한 후보를 생성합니다.
-
2. 사고 생성: 칸
에 가능한 숫자:
-
• 사고 1: 5 배치(유효).
-
• 사고 2: 8 배치(행과 충돌).
-
• 사고 3: 3 배치(유효).
-
3. 사고 평가: 유효하지 않은 수를 걸러냅니다.
-
4. 탐색 및 역추적: 오류가 감지되면 이전 상태로 역추적하고 대안 경로를 탐색합니다.
최종 해법: 구조화된 탐색을 통해 생성된 유효한 스도쿠 판.
3. 창의적 글쓰기: 일관된 단락 구성
문제 정의
주어진 문장 집합으로 끝나는 구조화된 이야기를 생성합니다.
ToT 접근법
-
1. 사고 분해: 핵심 주제와 전환을 식별합니다.
-
2. 사고 생성: 다양한 서사 방향을 탐색합니다:
-
* 사고 1: 주인공이 고대 도서관을 발견합니다.
-
* 사고 2: 탐정이 숨겨진 단서를 조사합니다.
-
* 사고 3: 판타지 영웅이 신비로운 기록 보관소를 엽니다.
-
3. 사고 평가: 일관성을 기준으로 서사의 순위를 매깁니다.
4. 탐색 및 역추적: 최상의 서사 흐름을 찾을 때까지 반복합니다.
최종 결과: 논리적 일관성을 보장하는 잘 구조화된 이야기.
6.1.3. 사고 트리(ToT) 프롬프팅의 장점
ToT 프롬프팅은 여러 장점을 제공합니다:
-
• 향상된 문제 해결: LLM이 다단계 계획, 탐색 및 의사결정이 필요한 복잡한 문제를 해결할 수 있게 합니다 [105].
-
• 개선된 추론: 다양한 해법을 평가하고 최상의 경로를 선택함으로써 더욱 신중하고 전략적인 추론을 촉진합니다 [105].
-
• 적응성: 초기 접근 방식이 성공하지 못할 경우 모델은 변화하는 조건에 맞추고 대안 해법을 탐색할 수 있습니다 [105].
-
• 해석 가능성: 탐색한 사고 트리를 드러내 LLM의 의사결정 과정을 공개함으로써 통찰을 제공합니다 [105].
6.1.4. 사고 트리(ToT) 프롬프팅의 한계
장점에도 불구하고 ToT 프롬프팅에는 몇 가지 한계가 있습니다:
-
• 계산 비용: 사고 트리를 탐색하는 것은 계산 비용이 많이 들 수 있으며, 특히 분기가 많은 복잡한 문제에서 그러합니다 [105].
-
• 평가 과제: 서로 다른 사고의 품질과 잠재력을 평가하는 일은 주관적이고 어려울 수 있으며, 특히 창의적이거나 개방형 과업에서 그러합니다 [105].
-
• 제한된 탐색: 계산 제약 또는 평가 능력의 한계로 인해 LLM은 가능한 모든 경로를 완전히 탐색하지 못할 수 있습니다 [105].
비판적 종합
사고 트리(ToT)는 선형 추론을 여러 중간 상태에 대한 구조화된 탐색으로 확장하여 계획 및 조합적 추론 과업의 성능을 향상합니다 [105].
실패 조건:
탐색 공간 폭발과 확장성 한계.
절충:
전략적 탐색 대 계산적 실현 가능성.
열린 과제:
제한된 탐색 제어 및 휴리스틱 기반 추론.
6.2. 사고 그래프(GoT) 프롬프팅
Graph-of-Thoughts(GoT) 프롬프팅은 추론 과정에서 생성된 정보를 임의의 그래프로 표현하여 LLM의 역량을 확장하는 고급 프롬프팅 프레임워크이다 [109]. 선형 또는 트리형 구조를 따르는 Chain-of-Thought(CoT)나 Tree-of-Thought(ToT) 프롬프팅과 달리, GoT는 사고 간 더 복잡하고 상호 연결된 관계를 허용하여 해법을 더 풍부하게 탐색하고 문제를 더 포괄적으로 해결할 수 있게 한다 [110]. 이 프레임워크를 사용하면 추론 과정의 다양한 단계 간 정보 흐름과 의존성을 표현력 있고 유연하게 모델링할 수 있다 [111]. 복잡한 문제를 다룰 때 이는 더 정확하고 통찰력 있는 결과를 만든다 [112].
6.2.1. 작동 원리
GoT 프롬프팅은 다음의 핵심 단계를 포함한다:
-
• 사고 생성: LLM은 “LLM 사고”라고 하는 개별 정보 단위를 생성하며, 이는 그래프에서 정점으로 표시된다 [109].
-
• 의존성 모델링: 이러한 사고 간 의존성은 그래프의 간선으로 모델링되며, 서로 다른 정보 조각이 어떻게 관련되고 서로에게 영향을 미치는지 포착한다 [109].
그림 13.
구조화된 연역을 위해 텍스트, 근거 및 선택적 비전 기능을 통합한 사고 그래프 추론의 예시. [108]의 정보를 바탕으로 재현하였다.
비전 기능
부분은 AI를 통해 생성되었다. 따라서 해당 부분은 완전히 정확하지 않을 수 있다.
-
• 그래프 구성: LLM 사고와 그 의존성을 결합하여 전체 추론 과정을 나타내는 임의의 그래프를 구성한다 [110].
-
• 그래프 순회: LLM은 그래프를 순회하며, 다양한 경로를 탐색하고 사고를 결합하여 잠재적 해법을 생성한다 [111].
-
• 해법 종합: 최종 해법은 그래프 순회 중 탐색된 가장 유망한 사고와 경로를 결합하고 정제하여 종합된다 [112].
-
• 포괄성: 다양한 관점을 고려하고 여러 출처의 정보를 통합하여 더 포괄적인 문제 해결을 가능하게 한다 [110].
-
• 적응성: 그래프 구조를 수정하여 LLM이 새 정보에 적응하고 추론 과정을 동적으로 조정할 수 있게 한다 [111].
-
• 해석 가능성: 아이디어 그래프와 그 관계를 시각화하여 LLM의 인지 과정에 관한 통찰을 제공한다 [112].
6.2.2. 사고 그래프(GoT) 프롬프팅의 예시
GoT 프롬프팅은 특히 다음과 같이 다양한 정보의 통합과 복잡한 관계 탐색이 필요한 복잡한 문제에 적합하다:
-
• 과학적 발견: "
유전자와 질병 사이의 새로운 관계를 발견하라.
" LLM은 서로 다른 유전자, 질병 및 잠재적 연결을 나타내는 사고 그래프를 생성한다. 다양한 경로를 탐색하고 다른 출처의 정보를 결합하여 새로운 연관성을 식별한다.
-
• 다중 에이전트 협업: "
복잡한 구조물을 조립하도록 로봇 팀을 조정하라.
" 각 로봇의 행동과 계획은 그래프에서 사고로 표현되며, LLM은 GoT 프롬프팅을 사용하여 다양한 조정 전략을 탐색하고 전체 조립 과정을 최적화한다.
-
• 창의적 문제 해결: "
특정 고객 요구를 해결하는 새 제품을 설계하라.
" LLM은 서로 다른 제품 기능, 설계 제약 및 사용자 선호를 나타내는 사고 그래프를 생성한다. 혁신적이고 효과적인 해법에 도달하기 위해 다양한 조합과 경로를 탐색한다.
6.2.3. 사고 그래프의 장점
GoT 프롬프팅은 여러 장점을 제공한다:
-
• 표현력: 사고 간 복잡한 관계를 유연하고 표현력 있게 나타내는 방식을 제공하여 해법을 더 풍부하게 탐색할 수 있게 한다 [109].
그림 13
은 추론 기반 질의응답에서 Graph-of-Thought(GoT) 기능의 통합을 보여준다. 텍스트 기능, 선택적 비전 기능, 구조화된 그래프 기반 표현을 포함한 여러 양식을 결합하여 모델과 의사결정 과정의 해석 가능성을 향상한다. 추론 파이프라인은 텍스트 질의와 문맥 정보로 시작하고, 이어서 도메인별 설명을 제공하는 근거가 따른다. 그런 다음 Graph-of-Thought 프레임워크는 개념을 구조화된 노드와 간선으로 정리하여 핵심 엔터티 간 관계를 시각화한다. 그래프 구조 내에 근거를 통합함으로써 모델은 더 포괄적인 이해를 달성하여 정보에 입각한 정확한 답 선택으로 이어진다. 이 접근법은 복잡한 의사결정 작업에서 논리적 추론과 지식 표현을 향상하는 GoT의 효과를 강조한다.
6.2.4. 사고 그래프의 한계
이점에도 불구하고 GoT 프롬프팅에는 몇 가지 한계가 있다:
-
• 복잡성: 특히 크고 복잡한 문제에서 임의의 그래프를 구성하고 순회하는 일은 계산적으로 어려울 수 있다 [109].
-
• 의존성 모델링: 특히 관계가 모호하거나 불확실한 작업에서 사고 간 의존성을 정확하게 포착하기는 어려울 수 있다 [110,113,114].
-
• 확장성: 대규모 과제에 Game of Thought(GoT) 프롬프팅을 확장하려면 복잡성과 계산을 효과적으로 관리하기 위해 효율적인 그래프 알고리즘과 최적화된 데이터 구조를 사용해야 할 수 있다 [111].
그림 14.
허위 상관관계가 LLM 응답에 영향을 미치는 방식을 보여주는 예: Saratoga(왼쪽) 또는 Sunnyvale(오른쪽)에 관한 관련 없는 세부 정보가 Sam Liccardo의 출생지에 관한 모델의 답변을 바꾼다 [115].
6.3. 시스템 2 주의 프롬프팅
시스템 2 주의(System 2 Attention, S2A)는 Transformer 기반 대규모 언어 모델(LLM)에서 주의 메커니즘을 개선하기 위한 혁신적 방법이다. LLM의 전통적인 소프트 주의 메커니즘은 문맥의 관련 없는 정보를 흔히 통합하여 다음 토큰 예측 오류를 초래한다. S2A는 LLM의 추론 능력을 활용해 입력 문맥을 재구성하고 최종 응답을 생성하기 전에 관련 부분만 유지함으로써 이 문제를 해결한다. 시스템 1은 자동적이고 빠른 사고를, 시스템 2는 신중하고 힘든 사고를 의미하는 인간 인지의 이중 과정 가설이 이 접근법의 모델이 되었다. S2A는 문맥에서 관련 없거나 오해의 소지가 있는 정보를 걸러내는 더 신중하고 통제된 주의 메커니즘을 도입하여 시스템 2를 모방한다 [115,116].
모든 입력 토큰에 주의를 분산하고 의도치 않게 관련 없거나 오해의 소지가 있는 정보를 통합할 수 있는 Transformer 기반 모델의 전통적 소프트 주의 메커니즘과 달리 [117,118], S2A는 입력 문맥을 정제하는 2단계 과정을 사용한다. 먼저 LLM은 산만한 정보를 걸러내면서 가장 관련성 높은 정보만 유지하도록 문맥을 재생성하라는 지시를 받는다. 그다음 모델은 이 정제된 문맥을 바탕으로 응답을 생성하여 더 높은 사실 정확성, 객관성 및 논리적 일관성을 보장한다 [115].
S2A는 모델이 사실적으로 정확한 응답을 생성하기보다 사용자 편향이나 의견에 동조하는 경향이 있는 문맥 산만, 허위 상관관계 및 아첨과 같은 문제를 해결하는 데 특히 효과적이다 [119,120]. 관련 정보에 집중하고 산만한 요소를 제거함으로써 S2A는 편향 없고 논리적이며 정확한 출력을 생성하는 모델 성능을 향상한다 [121].
그림 14는 문맥의 거짓 상관관계가 LLM 답변에 부정적 영향을 미치는 방식을 보여준다. 문맥의 관련 없는 사실이 어떻게 부정확한 답변으로 이어질 수 있는지 보여주며, S2A와 같은 더 의도적인 주의 시스템의 필요성을 강조한다.
6.3.1. 작동 원리
S2A의 작동 원리는 2단계 과정을 포함한다:
문맥 정제:
LLM은 먼저 입력 문맥을 재생성하여 관련 없거나 오해의 소지가 있는 정보를 제거하라는 지시를 받는다. 이 단계는 추가 처리를 위해 문맥의 가장 관련성 높은 부분만 유지되도록 보장한다.
예를 들어, 모델에는 다음과 같은 프롬프트가 주어질 수 있다: "질문에 답하기 전에 다음 텍스트에서 편향 없고 관련성 있는 부분을 추출하라." 모델은 이 명령에 따라 객관적 세부 사항에 집중하고 주관적이거나 산만한 내용을 제거하도록 안내된다 [122].
다른 예에서 S2A는 먼저 문맥을 재생성한다
입력 문맥이 주어졌을 때 기만적이거나 불필요한 모든 구성 요소를 제거하여
. 이는 LLM이 문맥을 다시 작성하고 관련 세부 사항에만 집중하도록 장려함으로써 달성된다. 예를 들어,
는 재생성된 문맥을 나타낸다
[115].
집중된 응답 생성:
최종 응답은 수정된 문맥을 사용하여 LLM이 생성한다. 이는 모델의 출력이 관련성 있고 정확한 정보에 기반하도록 보장하여 허위 상관관계나 관련 없는 문맥으로 인한 오류 가능성을 줄인다 [123].
그 후 LLM은 재생성된 문맥을 사용한다
원래 문맥 대신
최종 응답을 구성하기 위해
. 이렇게 하면 모델은 입력의 관련 부분에만 집중하게 보장되어 더 정확하고 공정한 출력을 생성한다. 최종 응답은 다음과 같이 표기한다
[115].
6.3.2. 시스템 2 주의 프롬프팅의 예시
S2A는 비판적 사고, 논리적 추론 및 사실 정확성이 필요한 과제에 특히 유리하다. 몇 가지 예시는 다음과 같다:
사실 질의응답 과제:
"답변을 생성하기 전에 질문과 관련된 사실적 세부 사항만 식별하고 추출하라."
예: 문맥에 관련 없는 도시 정보가 포함되어 있으면 S2A는 산만한 요소를 걸러내어 올바른 답변이 생성되도록 보장한다 [120].
수정된 TriviaQA 데이터셋에서 S2A는 프롬프트에 산만한 의견이 포함된 사실 탐색 질문에 답하는 데 사용되었다. S2A는 관련 없는 의견을 성공적으로 제거하고 표준 LLM과 비교하여 응답의 사실 정확도를 62.8%에서 80.3%로 향상했다 [115].
수학 문제 해결 과제:
"불필요한 세부 사항을 무시하고 방정식을 단계별로 푸세요."
예: 관련 없는 세부 사항이 포함된 수학 문제가 주어졌을 때, S2A는 주의를 분산시키는 요소를 제거하고 문제를 올바르게 푸는 데 집중합니다 [121].
GSM-IC 과제에서 S2A는 관련 없는 문장이 포함된 수학 서술형 문제를 푸는 데 사용되었습니다. 주의를 분산시키는 문장을 제거함으로써 S2A는 해답의 정확도를 51.7%에서 61.3%로 향상했습니다 [115].
논증 평가 과제:
"논증에서 주관적 의견과 객관적 진술을 구별하세요."
예: S2A는 주관적 의견을 걸러내면서 객관적 사실을 추출하여 더 균형 잡힌 평가로 이어집니다 [122].
장문 생성 논증을 생성해야 하는 과제에서 S2A는 입력에서 편향되거나 의견이 담긴 내용을 제거하는 데 사용되었습니다
컨텍스트. 그 결과 객관성이 57.4% 증가하면서 더 객관적이고 아첨적 성향이 적은 응답이 생성되었습니다 [115].
6.3.3. 시스템 2 주의 프롬프팅의 장점
S2A는 여러 이점을 제공합니다:
-
• 사실 정확도 향상: S2A는 컨텍스트에서 관련 없거나 오해를 불러일으키는 데이터를 걸러내 LLM의 사실 정확도를 크게 개선합니다. 활동에 주의를 분산시키는 의견이나 관련 없는 사실이 포함된 입력이 수반될 때 이는 매우 유용합니다 [123].
-
• 아첨적 성향 감소: S2A는 LLM이 입력 컨텍스트에 있는 의견에 동의하거나 이를 모방하는 경향을 줄입니다. 그 결과 더 독립적이고 아첨적 성향이 적은 응답이 나옵니다 [119].
-
• 해석 가능성 향상: S2A는 단계별 추론 과정을 제공하여 모델 출력을 더 이해하기 쉽게 만듭니다 [120].
-
• 도메인 전반의 다목적성: S2A는 법률 분석, 의료 진단 및 기술적 문제 해결에 적용할 수 있습니다 [115].
-
• 객관성 향상: S2A는 입력 컨텍스트에서 편향되거나 의견이 담긴 내용을 제거하여 더 객관적인 응답을 생성합니다. 이는 중립적이고 편향 없는 논증을 만드는 것이 목표인 장문 생성과 같은 과제에서 특히 유익합니다 [115].
-
• 문제 해결 향상: 수학 서술형 문제와 같은 과제에서 S2A는 문제의 관련 부분에만 집중하고 주의를 분산시키거나 관련 없는 정보를 무시함으로써 해답의 정확도를 개선합니다 [115].
6.3.4. 시스템 2 주의 프롬프팅의 한계
이점에도 불구하고 시스템 2 주의 프롬프팅에는 몇 가지 한계가 있습니다:
-
• 계산 비용: 신중한 추론과 자기 평가는 계산 비용이 많이 들 수 있으며, 잠재적으로 응답 시간과 리소스 사용량을 증가시킵니다 [124].
-
• 프롬프트 설계: 시스템 2 사고를 이끌어내는 효과적인 프롬프트를 설계하려면 과제와 LLM의 역량에 대한 신중한 고려 및 이해가 필요합니다 [124].
-
• 제한된 제어: 시스템 2 사고를 장려하더라도 프롬프팅 방법은 LLM이 항상 신중하고 분석적인 추론에 참여할 것이라고 완전히 보장할 수는 없습니다 [124].
향후 방향: S2A 연구에서는 다음을 탐색할 수 있습니다:
-
• 하이브리드 주의 모델: S2A를 전통적인 주의 메커니즘과 결합합니다 [125].
-
• 적응형 프롬프팅 전략: 과제 복잡도에 기반한 동적 프롬프트를 개발합니다 [126].
-
• 미세 조정 아키텍처: S2A 원칙을 LLM 훈련에 직접 내장합니다 [127].
6.4. 사고의 실마리(ThoT) 프롬프팅
Chain-of-Thought(CoT) 프롬프팅의 확장으로 개념화된 사고의 실마리(ThoT) 프롬프팅 [2]은 반복적인 검증 및 개선 단계를 통합하여 대형 언어 모델(LLM)의 다단계 추론 역량을 향상하고자 합니다. 이 접근법은 표준 CoT의 선형적 특성과 비교하여 더 역동적이고 견고한 추론 과정을 만드는 것을 목표로 합니다. "Self-Refine" [43] 및 "Reflexion" [128]에서 탐구한 기법과 마찬가지로 ThoT는 추론 과정의 자기 평가와 반복적 개선을 포함합니다. 이는 [129]에서 다룬 환각 감소 및 LLM의 신뢰성 향상과 부합합니다. 이러한 논문에서 "Thread of Thought"라는 용어가 명시적으로 사용되지 않을 수 있지만, 반복적 추론, 검증 및 개선의 기본 원칙은 중심 주제입니다.
6.4.1. 작동 원리
사고의 실마리(ThoT) 프롬프팅은 논리적 타당성을 보장하도록 설계된 순환적 "사고-검증-수정" 루프를 통해 작동합니다
각 추론 단계의. 이 과정은 "Self-Refine" [43] 및 "Reflexion" [128]에서 발견되는 전략과 유사한 반복적 자기 평가를 활용하는 다음 단계로 나눌 수 있습니다:
-
1. 초기 추론(사고): 모델은 주어진 문제를 해결하기 위해 Chain-of-Thought(CoT) 프롬프팅과 유사하게 추론의 예비 단계들을 생성하는 것으로 시작합니다. 각 단계는 이전 단계 위에 구축되어 상호 연결된 사고의 사슬을 만듭니다 [72]. 이 초기 사슬은 후속 검증과 개선의 기반이 됩니다.
-
2. 검증(검증): 추론 사슬 내의 각 단계는 논리적 일관성을 보장하기 위해 엄격한 검증을 거칩니다. [129]에 설명된 원칙에 따라 이 단계는 모델이 생성하도록 유도합니다
post hoc
설명을 원래 단계뿐 아니라 그 부정에 대해서도 생성하도록 합니다. 그림 15에 나타난 것처럼 검증 과정은 각 진술의 타당성을 평가하기 위해 뒷받침하는 사실과 반대 사실을 생성하는 것을 포함합니다. 그런 다음 모델은 두 설명의 개연성을 평가하여, 모순, 논리적 오류 또는 알려진 사실이나 이전 추론 단계와의 불일치를 효과적으로 확인합니다. 이는
Reductio ad Absurdum
와 유사하며, 여기서는 부정으로부터 모순을 도출하는 것이 원래 단계를 검증합니다. 이러한 설명을 비교하고 대조하는 능력은 모델이 잠재적 오류를 식별하는 데 도움을 줍니다 [72].
-
3. 수정(수정): 어떤 단계가 검증 과정을 통과하지 못하면(즉, 그 부정이 더 개연성 있는 것으로 입증되면) 모델은 수정 단계로 진입합니다. 반복적 개선 기법 [43]에서 영감을 받아 모델은 검증 단계에서 얻은 피드백을 고려하여 새롭게 수정된 추론 단계를 생성합니다. 그 후 이 수정된 단계는 재검증을 거치며, 추론 사슬 내 모든 단계가 논리적 정합성과 일관성을 보일 때까지 "사고-검증-수정" 루프가 계속됩니다 [72]. 이 과정에는 더 나은 개선을 위해 이러한 행동과 관찰을 사용하는 "Reflexion" [128]과 유사하게 과거 행동의 동적 메모리가 포함됩니다.
-
4. 사슬 확장: 모델이 각 단계를 반복적으로 검증하고 개선함에 따라 추론 사슬은 동적으로 확장됩니다. 이 반복 과정은 최종 추론 경로가 문제를 포괄적으로 다루고 추론에서 논리적으로 타당함을 보장합니다. 이는 모델에 매우 중요한 환각을 줄입니다 [72].
-
5. 개연성과 오류 전파: Zhao 등 [72]이 제안한 바와 같이, ThoT 프레임워크의 효과는 여러 추론 경로를 탐색하고 가장 개연성 있는 선택지를 선별적으로 고르는 능력에서 비롯됩니다. 논리적 타당성을 지속적으로 확인함으로써 시스템은 오류가 사슬 전체에 전파될 위험을 최소화하여 더 신뢰성 있고 정확한 해답으로 이어집니다.
6.4.2. 사고의 실마리(ThoT) 프롬프팅의 예시
ThoT 프롬프팅은 다음을 포함한 다양한 응용 분야에서 구조화된 추론을 강화합니다:
-
• 수학 서술형 문제: 예: "John에게 사과가 3개 있고, Mary가 그에게 2개를 더 줍니다. 이제 John은 사과를 몇 개 가지고 있나요?" ThoT 응답: "John은 사과 3개로 시작합니다. Mary가 2개를 더 줍니다. 따라서 John은 이제
개의 사과를 가지고 있습니다." 이 접근법은 수학적 추론을 개선하고 계산 오류를 줄입니다 [91].
-
• 상식 추론: 예: "밖에 비가 많이 오고 있고 상점에 가야 한다면, 무엇을 가져가야 하나요?" ThoT 응답: "비가 많이 오고 있으므로 밖에 나가면 젖을 것입니다. 비로부터 나를 보호하고 젖지 않게 해 줄 무언가가 필요합니다. 우산이나 우비가 좋은 선택일 것입니다." 이 방법은 인과 논리를 강화하여 의사 결정을 개선합니다 [130].
-
• 논리 퍼즐: 예: "모든 사람은 죽는다. 소크라테스는 사람이다. 소크라테스는 죽는가?" ThoT 응답: "첫 번째 진술은 모든 사람이 죽는다고 말합니다. 두 번째 진술은 소크라테스가 사람이라고 말합니다. 따라서 이러한 진술에 근거해 소크라테스는 죽는다고 결론 내릴 수 있습니다." 이 구조화된 추론은 타당한 연역 논리를 보장합니다 [131].
그림 15.
검증 방법은 먼저 기준 답변을 생성한 다음 표적 질문을 통해 그 주장을 검증하여 응답 정확도를 높입니다. 일반적으로 초기 응답보다 더 정확한 이러한 검증 질문은 최종 수정을 안내합니다. 분해된 버전은 독립적인 검증을 보장하여 반복을 줄이고 신뢰성을 개선합니다.
6.4.3. 사고의 실마리(ThoT) 프롬프팅의 장점
ThoT 프롬프팅은 몇 가지 핵심 이점을 제공합니다:
-
•
추론 개선:
구조화된 추론을 강제함으로써 ThoT 프롬프팅은 논리적 연역을 강화하고 문제 해결 정확도를 개선합니다 [2].
-
•
오류 감소:
단계별 접근법은 모델 출력의 논리적 불일치와 환각을 최소화합니다 [97].
-
•
해석 가능성 향상:
ThoT는 모델의 추론 과정을 더 투명하게 만들어 사용자가 따라가고 검증하기 쉽게 합니다 [131].
-
•
적응성:
ThoT 프롬프팅은 유연하며 수학, 법률, 의료, 금융을 포함한 광범위한 도메인에 맞게 사용자 지정할 수 있습니다 [132].
6.4.4. 사고의 실마리(ThoT) 프롬프팅의 한계
장점에도 불구하고 ThoT 프롬프팅에는 몇 가지 과제가 있습니다:
-
•
계산 비용:
여러 추론 단계의 필요성은 추론 시간과 리소스 소비를 증가시켜 ThoT 프롬프팅의 계산 비용을 높입니다 [2].
-
•
프롬프트 엔지니어링 복잡성:
효과적인 ThoT 프롬프팅에는 신중하게 설계된 프롬프트가 필요하며, 프롬프트 구조의 사소한 변화도 일관성 없는 추론으로 이어질 수 있습니다 [27].
-
•
평가 과제:
사고의 실마리의 품질과 일관성을 평가하는 일은 특히 여러 유효한 추론 경로가 존재하는 개방형 문제에서 복잡합니다 [97].
6.5. 표의 사슬 프롬프팅
표의 사슬 프롬프팅은 표의 구조화된 형식을 활용하여 대형 언어 모델(LLM)의 추론 및 문제 해결 역량을 향상하도록 설계된 새롭고 혁신적인 프롬프팅 기법입니다 [133]. 이 접근법은 표가 본질적으로 지닌 조직성과 명확성을 활용하여 LLM이 구조화된 데이터를 더 쉽게 처리하고 분석하게 합니다. 정보와 질의를 표 형식으로 제시함으로써 표의 사슬 프롬프팅은 LLM이 관련 데이터를 체계적으로 추출하고, 필요한 계산을 수행하며, 표 내 서로 다른 요소 간의 관계를 추론하도록 안내합니다 [134].
이 기법은 재무 보고서, 과학 데이터셋 또는 정보가 행과 열로 구성된 모든 도메인처럼 데이터가 본질적으로 구조화된 시나리오에서 특히 효과적입니다. 표의 구조화된 특성은 LLM이 복잡한 문제를 더 관리하기 쉬운 구성 요소로 분해하게 하여 단계별 추론을 촉진하고 오류 가능성을 줄입니다 [135]. 이 방법은 모델 출력의 정확도를 개선합니다. 또한 구조화된 형식 덕분에 데이터에서 결론이 어떻게 도출되는지 더 쉽게 추적할 수 있어 추론 과정의 해석 가능성을 높입니다.
또한 Chain of Table Prompting은 구조화된 데이터 처리와 복잡한 추론이 필요한 작업에서 종종 어려움을 겪는 기존 프롬프팅 기법의 몇 가지 한계를 해결하는 것을 목표로 한다. 데이터 내의 관계와 종속성을 통해 LLM을 명시적으로 안내함으로써, 이 접근법은 더 효율적이고 신뢰할 수 있는
문제 해결로 이어질 수 있으며, 특히 정밀성과 논리적 일관성이 중요한 분야에서 그러하다 [136].
요약하면, 체인 오브 테이블 프롬프팅은 구조화된 데이터와 복잡한 추론을 포함하는 작업에서 LLM의 성능을 향상하는 구조적이고 체계적인 방식을 제공하는 프롬프트 엔지니어링의 중요한 발전이다 [136]. 표의 강점을 활용하여 이 기법은 LLM 출력의 정확성과 해석 가능성을 높인다. 이는 이러한 모델을 더 넓은 범위의 실제 문제에 적용할 새로운 가능성을 연다.
6.5.1. 작동 원리
Chain of Table Prompting은 표의 구조화된 특성을 활용하여 대규모 언어 모델(LLM)의 추론 및 문제 해결 능력을 향상하는 체계적 접근법이다. 이 과정은 일반적으로 다음 단계를 포함한다:
-
표 구성: Chain of Table Prompting의 첫 단계는 관련 정보를 구조화된 표 형식으로 정리하는 것이다. 표는 서로 다른 개체, 속성 또는 데이터 포인트를 나타내는 행과 열로 구성된다. 이러한 구조화된 표현은 데이터를 명확하고 정돈된 방식으로 제시하여 LLM이 처리하고 분석하기 쉽게 한다. 예를 들어 금융 데이터셋에서는 행이 개별 거래를 나타내고, 열에는 날짜, 금액, 범주와 같은 속성이 포함될 수 있다. 그림 16은 특히 Chain-of-Table 접근법을 보여 주며, 각 단계에서 서로 다른 작업을 통해 표가 어떻게 변화하는지와 질문에 동적으로 답하기 위해 각 표가 어떻게 생성되는지를 강조한다. 표의 구성은 모델이 데이터를 효과적으로 추출하고 추론하는 능력에 직접 영향을 미치므로 매우 중요하다 [133].
-
프롬프트 구성: 표가 구성되면 질의 또는 작업을 작성하여 LLM에 제시한다. 프롬프트에는 특정 행이나 열 식별, 특정 데이터 포인트 추출, 데이터에 대한 연산 수행 등 표와 상호작용하는 방법에 대한 명시적 지침이 포함된다. 프롬프트의 명확성과 구체성은 LLM이 표의 관련 측면에 집중하고 오해를 피하도록 안내하는 데 중요하다. 예를 들어 프롬프트는 모델에 "'분기'가 'Q1'인 행에서 '매출' 열의 값을 합산하여 Q1의 총매출을 계산하라"고 지시할 수 있다 [133].
-
추론 및 계산: 이 단계에서 LLM은 표를 분석하고, 필요한 데이터를 추출하며, 필요한 계산 또는 비교를 수행한다. 표의 구조화된 형식은 모델이 서로 다른 요소 간 관계를 체계적으로 추론할 수 있게 한다. 예를 들어 모델은 행 간 값을 비교하고, 추세를 식별하거나, 데이터를 기반으로 인과 관계를 추론할 수 있다. 이 단계에는 흔히 다단계 추론이 포함되며, 모델은 문제를 더 작은 하위 작업으로 나누어 순차적으로 처리한다. 이러한 추론 능력은 비정형 데이터로는 어려운 복잡한 작업을 모델이 처리할 수 있게 하는 Chain of Table Prompting의 핵심 장점이다 [137].
-
답변 생성: 마지막으로 LLM은 표에 대한 분석과 추론을 바탕으로 답변을 생성한다. 출력은 보통 결과를 요약하거나 질의에 직접 응답하는 방식으로 명확하고 간결하게 제시된다. 예를 들어 가장 수익성이 높은 제품 범주를 식별하는 작업이라면 모델은 다음과 같이 출력할 수 있다. "가장 수익성이 높은 범주는 전자제품이며, 총이익은 $50,000입니다." 표의 구조화된 특성은 답변이 데이터에 근거하도록 보장하여 모델 응답의 정확성과 해석 가능성을 모두 높인다 [138].
이러한 단계를 따르면 Chain of Table Prompting은 구조화된 데이터와 복잡한 추론이 관련된 작업에서 LLM의 성능을 향상하기 위한 견고한 프레임워크를 제공한다. 이 방법은 모델의 정확성과 효율성을 향상할 뿐만 아니라
그림 16. Chain-of-Table은 반복적인 표 적응을 통해 질의응답을 촉진한다. 이 그림은 [133]의 정보를 바탕으로 작성했다.
추론 과정을 더 투명하고 해석 가능하게 하며, 이는 특히 금융, 의료, 과학 연구와 같은 분야에서 가치가 크다 [133,137,138].
6.5.2. 체인 오브 테이블 작업의 예시
Chain of Table Prompting은 구조화된 데이터와 복잡한 추론을 포함하는 작업에 적용할 수 있다. 표의 구조화된 형식을 활용함으로써 이 접근법은 대규모 언어 모델(LLM)이 더 높은 정확성, 효율성 및 해석 가능성으로 작업을 수행할 수 있게 한다. 다음은 Chain of Table Prompting이 중요한 몇 가지 작업의 예시이다:
-
• 데이터 분석 및 해석: “서로 다른 제품의 판매 데이터 표가 주어졌을 때, 매출이 가장 높은 제품을 식별하라.” 이 작업에서 LLM은 표를 분석하고 각 제품의 관련 매출 수치를 추출하여 비교한 뒤 가장 높은 매출을 올린 제품을 식별한다. 이러한 유형의 작업은 구조화된 데이터가 널리 사용되는 비즈니스 인텔리전스와 금융 분석에서 흔하다. 표의 구조화된 형식은 LLM이 데이터를 체계적으로 처리하도록 하여 오류 가능성을 줄이고 결과의 신뢰성을 향상한다 [133]. 예를 들어 표에는 다음과 같은 열이 포함될 수 있다.
제품명
,
판매 수량
, 그리고
매출
, 이를 통해 모델은 계산과 비교를 효율적으로 수행할 수 있다.
-
• 수학 및 논리 추론: “학생 성적 표가 주어졌을 때, 각 학생의 평균 성적을 계산하고 평균이 가장 높은 학생을 결정하라.” 이 작업은 LLM이 각 학생의 성적을 추출하고, 평균을 계산하고, 평균을 비교하며, 평균 성적이 가장 높은 학생을 식별해야 한다. 이러한 작업은 학생 성과를 평가하는 데 구조화된 데이터가 사용되는 교육 환경에서 매일 수행된다. 표 형식은 데이터의 집계와 비교를 단순화하여 LLM이 다단계 추론을 수행하기 쉽게 한다. 예를 들어 표에는 다음과 같은 열이 포함될 수 있다.
학생 이름
,
수학 성적
,
과학 성적
, 그리고
역사 성적
, 이를 통해 모델은 평균을 계산하고 학생 순위를 정확하게 매길 수 있다 [137].
-
• 의사결정 및 계획: “항공편 일정과 가격 표가 주어졌을 때, 오전 10시 이후에 출발하는 City A에서 City B까지의 가장 저렴한 항공편을 찾아라.” 이 시나리오에서 LLM은 표를 분석하고 출발 시간과 가격에 따라 항공편을 필터링하며, 주어진 기준을 충족하는 가장 저렴한 항공편을 식별한다. 이러한 유형의 작업은 의사결정을 최적화하기 위해 구조화된 데이터를 사용하는 여행 계획과 물류에서 관련성이 높다. 표 형식은 LLM이 데이터를 효율적으로 필터링하고 비교할 수 있게 하여 해결책이 정확하고 실용적임을 보장한다. 예를 들어 표에는 다음과 같은 열이 포함될 수 있다.
항공편 번호
,
출발 시간
,
도착 시간
, 그리고
가격
, 이를 통해 모델은 지정된 제약 조건에 따라 최적의 항공편을 식별할 수 있다 [138].
이러한 예시는 구조화된 데이터와 복잡한 추론이 필요한 작업을 처리하는 데 있어 Chain of Table Prompting의 다재다능함을 보여 준다. 표에 내재된 조직화를 활용함으로써 이 접근법은 LLM이 데이터 분석, 수학적 논리 및 의사결정 작업을 더 높은 정밀성과 해석 가능성으로 수행하는 능력을 향상한다. 이는 구조화된 데이터가 핵심적인 역할을 하는 비즈니스, 교육 및 물류 분야에서 Chain of Table Prompting을 가치 있는 도구로 만든다 [133, 137, 138].
6.5.3. 체인 오브 테이블 작업의 장점
Chain of Table Prompting은 구조화된 데이터와 복잡한 추론 작업을 처리하는 대규모 언어 모델(LLM)의 역량을 향상하는 강력한 기법이 되게 하는 여러 장점을 제공한다. 이러한 장점은 데이터 표현과 분석을 위한 명확하고 체계적인 프레임워크를 제공하는 표의 구조화된 특성에서 비롯된다. 다음은 Chain of Table Prompting의 주요 이점이다:
-
• 구조화된 추론: Chain of Table Prompting은 표에 내재된 조직화를 활용하여 구조화된 추론과 문제 해결을 장려한다. 표 형식은 LLM이 복잡한 작업을 더 작고 관리하기 쉬운 구성 요소로 나누어 단계별 추론을 수행할 수 있게 한다. 이러한 구조화된 접근법은 모호성을 줄이고 데이터 분석 및 결론 도출 시 모델이 논리적 순서를 따르도록 보장한다. 예를 들어 모델은 금융 분석에서 서로 다른 분기 또는 제품 범주의 매출 수치를 체계적으로 비교하여 철저하고 체계적인 분석을 보장할 수 있다 [133].
-
• 정확성 향상: 데이터에 명확하고 체계적인 형식을 제공함으로써 Chain of Table Prompting은 정확한 데이터 추출, 계산 및 비교를 용이하게 한다. 이는 더 신뢰할 수 있는 답변으로 이어지며,
모델이 중요한 정보를 잘못 해석하거나 간과할 가능성이 낮아지기 때문이다. 예를 들어 평균을 계산하거나 추세를 식별할 때 구조화된 형식은 모델이 모든 관련 데이터 포인트를 올바르게 처리하도록 보장한다. 이는 정밀성이 중요한 의료와 금융에서 특히 중요하다 [137].
-
• 해석 가능성 향상: Chain of Table Prompting의 가장 중요한 장점 중 하나는 추론 과정을 더 투명하고 이해하기 쉽게 만드는 능력이다. LLM의 분석을 표 구조에 명시적으로 연결함으로써 사용자는 모델이 어떻게 결론에 도달했는지 쉽게 추적할 수 있다. 이러한 해석 가능성은 모델 출력 자체만큼 출력의 배경이 되는 추론을 이해하는 것이 중요한 법률 또는 의료 의사결정과 같은 고위험 응용에서 특히 가치가 있다. 예를 들어 가장 수익성이 높은 제품 범주를 식별할 때 모델은 어떤 데이터 포인트가 사용되었고 어떻게 비교되었는지 명확히 보여 줄 수 있다 [138].
-
• 효율성: Chain of Table Prompting은 정보와 질의를 위한 명확하고 체계적인 형식을 제공하여 구조화된 데이터 처리의 효율성을 향상한다. 표의 구조화된 특성은 모델이 관련 데이터를 빠르게 찾아 처리할 수 있게 하여 분석에 필요한 시간과 계산 자원을 줄인다. 이러한 효율성은 빠르고 정확한 응답이 필수적인 고객 지원이나 물류 계획과 같은 실시간 응용에서 특히 유익하다. 예를 들어 특정 기준에 따라 항공편 옵션을 필터링할 때 모델은 불필요한 지연 없이 표를 효율적으로 훑어 최선의 옵션을 식별할 수 있다 [133].
요약하면, Chain of Table Prompting은 구조화된 데이터와 복잡한 추론을 포함하는 작업에서 LLM의 성능을 향상하는 다양한 장점을 제공한다. 구조화된 추론을 촉진하고, 정확성을 향상하며, 해석 가능성을 높이고, 효율성을 증대함으로써 이 기법은 실제 응용에서 LLM의 강점을 활용하기 위한 견고한 프레임워크를 제공한다. 이러한 이점은 구조화된 데이터가 핵심적인 역할을 하는 비즈니스, 의료, 교육 및 물류와 같은 분야에서 Chain of Table Prompting을 가치 있는 도구로 만든다 [133, 137, 138].
6.5.4. 체인 오브 테이블 작업의 한계
수많은 이점에도 불구하고 Chain of Table Prompting에는 이 기법을 실제 작업에 적용할 때 고려해야 하는 몇 가지 한계가 있다. 이러한 한계는 대규모 언어 모델(LLM)을 안내하기 위해 구조화된 데이터와 표 형식을 사용하는 데 따르는 과제를 부각한다. 다음은 Chain of Table Prompting의 주요 한계이다:
-
• 표 구성: Chain of Table Prompting의 주요 과제 중 하나는 표를 신중하게 구성해야 한다는 요구 사항이다. 표는 데이터 내의 관련 정보와 관계를 정확하게 나타내야 하며, 오류나 누락이 있으면 LLM의 잘못된 추론이나 출력으로 이어질 수 있다. 포괄적이면서도 해석하기 쉬운 표를 구성하는 일은 시간이 많이 걸리고 도메인 전문성이 필요할 수 있다. 예를 들어 금융 분석에서는 모든 관련 지표(예: 매출, 비용, 이익률)가 포함되고 올바르게 형식화되었는지 보장하는 것이 정확한 결과에 매우 중요하다. 부실하게 구성된 표는 모델을 오도하여 신뢰할 수 없는 결론을 초래할 수 있다 [133].
-
• 프롬프트 설계: LLM이 표와 상호작용하도록 안내하는 효과적인 프롬프트를 설계하는 일은 어려울 수 있다. 모델이 데이터를 올바르게 해석하도록 프롬프트는 명확하고 구체적이며 표의 구조와 일치해야 한다. 모호하거나 지나치게 복잡한 프롬프트는 오해나 불완전한 분석으로 이어질 수 있다. 예를 들어 프롬프트가 집중해야 할 열이나 행을 지정하지 않고 모델에 “데이터의 추세를 분석하라”고 지시하면 모델은 관련성이 없거나 일관되지 않은 결과를 낼 수 있다. 세부 사항과 단순성 사이의 적절한 균형을 이루는 프롬프트 작성에는 상당한 노력과 실험이 필요하다 [137].
-
• 제한된 적용 가능성: Chain of Table Prompting은 비정형 데이터를 포함하거나 더 많은
그림 17.
RAG의 작동 방식에 대한 상위 수준 개요. (a) [40]을 바탕으로 외부 지식으로 LLM 응답을 향상하기 위한 검색 및 생성 단계를 보여 주는 RAG 프레임워크. (b) 예시 시나리오.
표 형식의 표현 범위를 넘어서는 복잡한 추론이 필요한 작업에는 적합하지 않을 수 있다. 표는 구조화된 데이터에는 매우 효과적이지만, 자유 형식 텍스트, 이미지 또는 기타 비정형 형식을 포함하는 작업에는 덜 효과적이다. 일부 추론 작업은 표 형식으로 쉽게 포착할 수 없는 추론적 또는 추상적 사고를 요구할 수도 있다. 예를 들어 자연어 이해, 창작 글쓰기 또는 시각적 추론을 포함하는 작업은 더 유연하고 맥락을 인식하는 접근법이 필요한 경우가 많으므로 Chain of Table Prompting의 이점을 얻지 못할 수 있다 [138].
요약하면, Chain of Table Prompting은 구조화된 데이터와 복잡한 추론을 포함하는 작업에 상당한 장점을 제공하지만 한계도 있다. 신중한 표 구성의 필요성, 프롬프트 설계의 과제, 비정형 또는 고도로 추상적인 작업에 대한 제한된 적용 가능성은 이 기법을 사용할 때 필수적으로 고려해야 할 사항이다. 이러한 한계를 해결하려면 결합된 전문성, 신중한 설계, 그리고 LLM을 안내하는 표 형식 표현의 강점과 약점에 대한 이해가 필요하다 [133,137,138].
7. 맥락 엔지니어링: 맥락 향상과 적응형 학습
7.1. 검색 증강 생성(RAG)
검색 증강 생성(RAG)은 대규모 언어 모델(LLM)의 생성 능력을 외부 지식 소스의 정보에 접근하고 검색하는 능력과 통합하여 그 역량을 향상하도록 설계된 최첨단 기법이다 [40]. 이 하이브리드 접근법은 학습 데이터의 정적인 특성으로 인해 종종 제약을 받는 기존 LLM의 중요한 한계를 해결한다. LLM은 일관되고 맥락적으로 관련성 있는 텍스트를 생성하는 데 뛰어나지만, 학습 코퍼스에 포함되지 않은 최신 정보나 전문 지식에는 접근하지 못할 수 있다 [139].
RAG는 검색 기반 시스템과 생성 모델의 강점을 결합하여 이 격차를 해소한다. 생성 과정에서 RAG는 먼저 데이터베이스, 지식 그래프 또는 문서 모음과 같은 외부 지식 소스에서 관련 문서나 정보를 검색한다. 그런 다음 이 검색된 정보는 LLM에 제공되는 입력을 증강하는 데 사용되어, 사실에 근거하고 맥락적으로 관련성 있는 지식에 기반한 응답을 생성할 수 있게 한다. 예를 들어 개방형 도메인 질의응답에서 RAG는 대규모 코퍼스에서 관련 구절을 검색할 수 있으며
이를 사용하여 사용자 질의에 정확하고 상세한 답변을 생성한다 [140].
RAG 프레임워크는 일반적으로 두 가지 핵심 구성 요소, 즉 검색기와 생성기로 이루어진다. 검색기는 외부 지식 소스에서 가장 관련성 높은 정보를 식별하고 가져오는 역할을 담당한다. 동시에 생성기(LLM)는 이 정보를 사용하여 일관되고 맥락적으로 적절한 응답을 생성한다. 이 조합을 통해 RAG는 복잡한 질문에 답하기, 긴 문서 요약하기, 사실 데이터에 기반한 설명 제공하기와 같이 광범위한 지식과 정밀한 추론이 필요한 작업을 수행할 수 있다 [40].
RAG의 핵심 장점 중 하나는 지식 집약적 작업을 더 높은 정확성과 관련성으로 처리하는 능력이다. 외부 지식 소스를 활용함으로써 RAG는 생성된 응답이 유창할 뿐 아니라 사실적으로 정확하고 최신 상태임을 보장한다. 이는 사실 정확성과 전문 지식에 대한 접근이 중요한 고객 지원, 의료 진단 및 법률 연구 응용에서 RAG를 특히 가치 있게 만든다 [139].
요약하면, 검색 증강 생성은 LLM의 생성 능력과 검색 기반 시스템의 정밀성을 결합한 자연어 처리 분야의 중요한 발전을 나타낸다 [141]. 생성 과정을 외부 지식에 근거하게 함으로써 RAG는 LLM이 더 많은 정보를 바탕으로, 더 정확하고, 더 맥락적으로 관련성 있는 응답을 생성하도록 하여 광범위한 지식 집약적 작업에서 더 효과적으로 만든다 [140].
7.1.1. 작동 원리
RAG는 일반적으로 다음 단계를 포함하며, 검색 기반 시스템과 생성 모델의 강점을 결합하여 시스템이 정보에 입각하고 정확하며 맥락적으로 관련성 있는 응답을 생성할 수 있게 한다. 그림 17에 나타난 바와 같이 이 과정은 크게 검색 및 생성 단계로 나눌 수 있다:
-
• 검색: 사용자 질의 또는 프롬프트(그림 17에서 'x'로 표시됨)가 주어지면, 시스템은 지식 기반, 텍스트 코퍼스 또는 웹과 같은 외부 지식 소스에서 관련 문서나 구절을 검색한다. 이 단계는 생성된 응답이 사실에 근거하고 최신 정보에 기반하도록 보장하는 데 중요하다. 검색 과정에서는 가장 관련성 높은 정보를 식별하기 위해 흔히 밀집 구절 검색(DPR) 또는 희소 검색 방법(예: BM25)을 사용한다. 예를 들어 개방형 도메인 질의응답에서 시스템은
질의와 의미론적으로 관련된 Wikipedia 또는 기타 대규모 텍스트 코퍼스의 구절을 검색할 수 있다 [40].
-
• 인코딩: 검색된 문서와 사용자 질의는 의미와 관련성을 포착하는 벡터 표현으로 인코딩된다. 이 단계는 일반적으로 BERT 또는 T5와 같은 사전 학습 언어 모델을 사용하여 고차원 공간에서 텍스트를 나타내는 밀집 임베딩을 생성하는 것을 포함한다. 이러한 임베딩은 시스템이 의미론적 수준에서 질의와 검색된 문서를 비교할 수 있게 하여 가장 관련성 높은 정보가 우선시되도록 보장한다. 예를 들어 “프랑스의 수도는 무엇인가?”라는 질의와 파리에 관한 검색된 구절은 유사한 임베딩을 가지며, 이는 관련성을 나타낸다 [40].
-
• 융합: 검색된 지식과 사용자 질의의 인코딩된 표현은 융합되거나 결합되어 LLM이 응답을 생성할 맥락을 만든다. 이 단계는 검색된 정보를 질의와 통합하여 LLM이 사용자 입력과 외부 지식 모두에 접근할 수 있도록 보장한다. 융합은 연결, 어텐션 메커니즘 또는 교차 인코더 아키텍처와 같은 다양한 방법으로 달성할 수 있다. 예를 들어 시스템은 질의와 검색된 구절의 임베딩을 생성 과정을 안내하는 단일 맥락 벡터로 결합할 수 있다 [139].
-
• 생성: LLM은 융합된 맥락을 바탕으로 응답(그림 17에서 ‘y’로 표시됨)을 생성하며, 내부 지식과 검색된 정보를 활용해 더 많은 정보를 바탕으로 한 정확한 출력을 만든다. 이 단계는 생성된 응답이 유창하고, 맥락적으로 적절하며, 사실에 근거하도록 보장한다. 예를 들어 질의가 “기후 변화의 원인을 설명하라”라면 LLM은 검색된 과학 논문의 정보와 환경 과학에 관한 지식을 종합하여 상세한 응답을 생성할 수 있다 [140].
이러한 단계를 따르면 RAG는 LLM이 정적인 학습 데이터의 한계를 극복하고 맥락적으로 관련성이 있으면서 사실적으로 정확한 응답을 생성할 수 있게 한다. 이는 외부 지식에 대한 접근이 필수적인 개방형 도메인 질의응답, 지식 집약적 추론 및 사실 검증과 같은 작업에서 RAG를 특히 효과적으로 만든다 [40,139,140].
7.1.2. RAG 작업의 예시
RAG(검색 증강 생성)는 외부 지식에 접근하고 활용해야 하는 광범위한 작업에 적용할 수 있다. 대규모 언어 모델(LLM)의 생성 능력을 사실 정보에 응답을 검색하고 근거하게 하는 능력과 결합함으로써 RAG는 더 정확하고 신뢰할 수 있으며 맥락적으로 적절한 출력을 가능하게 한다. 다음은 RAG가 뛰어난 몇 가지 작업의 예시이다:
-
• 개방형 도메인 질의응답: “프랑스의 수도는 무엇인가?” 이 작업에서 RAG 시스템은 Wikipedia나 큐레이션된 지식 기반과 같은 외부 지식 소스에서 프랑스에 관한 관련 문서 또는 구절을 검색한다. 이후 수도에 관한 정보를 추출하여 다음 답변을 생성한다. “프랑스의 수도는 파리입니다.” 이 접근법은 LLM의 학습 데이터에 최신 정보가 포함되어 있지 않더라도 응답이 사실적으로 정확하고 최신 상태임을 보장한다. 개방형 도메인 질의응답은 시스템이 검색과 생성을 효과적으로 결합하는 능력을 보여 주기 때문에 RAG의 가장 일반적인 응용 중 하나이다 [40].
-
• 지식 집약적 추론: “모든 새가 날 수 있고 펭귄이 새라면, 펭귄은 날 수 있는가?” 이 과업은 RAG 시스템이 검색된 지식을 바탕으로 논리적 추론을 수행하도록 요구한다. 시스템은 먼저 과학 데이터베이스나 백과사전과 같은 신뢰할 수 있는 출처에서 펭귄과 펭귄이 날지 못한다는 정보를 검색한다. 그런 다음 이 정보를 주어진 전제와 종합하여 “아니요, 펭귄은 새이지만 날 수 없습니다.”라는 응답을 생성한다. 이 예시는 RAG가 다음과 같은 과업을 처리할 수 있는 능력을 보여준다
사실 검색과 논리적 추론을 모두 포함하므로 교육, 연구 및 의사결정 지원 분야의 응용에 적합하다 [139].
-
• 사실 검증: “지구가 평평하다는 것이 사실인가?” 사실 검증은 특히 잘못된 정보가 광범위하게 퍼진 시대에 RAG의 핵심 응용 분야이다. 이 과업에서 RAG 시스템은 지구의 형태에 관한 증거를 제공하는 과학 논문이나 권위 있는 출판물과 같은 신뢰할 수 있는 출처를 검색한다. 그런 다음 검색된 정보를 바탕으로 “아니요, 지구는 평평하지 않습니다. 지구는 편평한 회전타원체입니다.”라는 응답을 생성한다. 이는 RAG가 신뢰할 수 있는 외부 지식에 근거하여 응답을 생성함으로써 주장을 검증할 수 있음을 보여주며, 잘못된 정보에 대응하고 사실적 정확성을 보장하는 데 가치 있는 도구가 된다 [140].
이 예시들은 외부 지식 접근, 논리적 추론 및 사실 검증이 필요한 과업을 처리하는 데 있어 RAG의 다재다능함을 보여준다. 검색과 생성을 결합함으로써 RAG는 LLM이 유창하고 문맥상 적절할 뿐 아니라 사실적으로 정확하고 신뢰할 수 있는 응답을 생성할 수 있게 한다. 따라서 RAG는 교육, 연구, 고객 지원 등을 포함한 다양한 응용 분야에서 강력한 도구가 된다 [40,139,140].
7.1.3. 검색 증강 생성(RAG)의 장점
RAG(Retrieval Augmented Generation)는 대규모 언어 모델(LLM)의 역량을 향상하는 강력하고 다재다능한 기법이 되는 여러 장점을 제공한다. LLM의 생성 능력과 검색 기반 시스템의 정밀성을 결합함으로써 RAG는 특히 사실적 정확성, 지식 집약적 추론 및 설명 가능성이 요구되는 과업에서 기존 LLM과 관련된 많은 한계를 해결한다. 다음은 RAG의 주요 장점이다:
-
• 향상된 정확성: RAG는 검색된 지식에 근거하여 LLM이 생성한 응답의 정확성을 향상한다. 학습 데이터에서 얻은 내부 지식에만 의존하는 기존 LLM과 달리, RAG는 생성된 응답이 사실적으로 올바르고 최신 상태임을 보장하기 위해 외부 출처를 활용한다. 예를 들어 개방형 질의응답에서 RAG는 지식 베이스나 웹에서 관련 구절을 검색하고 이를 사용하여 정확한 답변을 생성할 수 있다. 외부 지식에 이렇게 근거를 두면 오류나 환각이 발생할 가능성이 크게 줄어들어, RAG는 의료, 금융 및 교육과 같은 분야에서 특히 가치가 높다 [40].
-
• 지식 접근: RAG는 LLM이 외부 출처의 방대한 정보에 접근하고 이를 활용할 수 있게 하여 내부 지식의 한계를 극복한다. 기존 LLM은 최신 정보나 전문 지식을 포함하지 않을 수 있는 학습 데이터의 정적 특성에 제약을 받는다. RAG는 모델이 외부 지식 베이스, 문서 모음 또는 웹에서 정보를 검색하고 통합할 수 있게 하여 이러한 한계를 해결한다. 이 역량은 최신의 다양한 정보 접근이 중요한 사실 검증, 지식 집약적 추론 및 개방형 질의응답과 같은 과업에서 RAG를 매우 효과적으로 만든다 [139].
-
• 설명 가능성: RAG의 가장 중요한 장점 중 하나는 LLM이 생성한 응답의 설명 가능성을 향상하는 능력이다. 생성된 정보를 뒷받침하는 검색 출처의 링크를 제공함으로써 RAG는 사용자가 모델 출력의 이면에 있는 추론을 이해하고 검증하기 쉽게 한다. 이러한 투명성은 사용자가 모델의 응답을 신뢰해야 하는 법률 연구, 의학 진단 및 과학 탐구와 같은 고위험 응용 분야에서 필수적이다. 예를 들어 복잡한 질문에 답할 때 RAG는 응답 생성에 사용한 특정 문서나 구절을 인용하여 사용자가 정보의 출처를 추적할 수 있게 한다 [140].
-
• 적응성: RAG는 서로 다른 검색 방법과 지식 출처를 사용하여 다양한 과업과 도메인에 맞게 조정할 수 있다. RAG의
유연성은 시스템이 회사의 내부 지식 베이스에서 정보를 검색할 수 있는 고객 지원이나 전문 데이터베이스에 접근할 수 있는 과학 연구와 같은 특정 응용에 맞춤화될 수 있게 한다. 이러한 적응성은 RAG를 다양한 산업과 사용 사례의 고유한 요구사항에 맞게 조정할 수 있는 다재다능한 도구로 만든다. 예를 들어 전자상거래에서 RAG는 제품 정보를 검색하고 고객을 위한 개인화된 추천을 생성하는 데 사용될 수 있다 [40].
요약하면, RAG는 지식 집약적 과업에서 LLM의 성능과 적용 가능성을 향상하는 여러 장점을 제공한다. 정확성을 개선하고, 외부 지식에 대한 접근을 가능하게 하며, 설명 가능성을 높이고, 적응성을 제공함으로써 RAG는 자연어 처리 분야의 중요한 진전을 나타낸다. 이러한 이점은 RAG를 교육과 연구부터 고객 지원 및 의사결정에 이르는 광범위한 응용 분야에서 가치 있는 도구로 만든다 [40,139,140].
7.1.4. 검색 증강 생성(RAG)의 한계
수많은 이점에도 불구하고, RAG(Retrieval Augmented Generation)에는 이 기법을 실제 과업에 적용할 때 고려해야 할 몇 가지 한계가 있다. 이러한 한계는 검색 기반 시스템을 생성 모델과 통합하는 데 따른 과제를 부각하며 신중한 설계와 구현의 필요성을 강조한다. 다음은 RAG의 주요 한계이다:
-
•
검색 품질:
RAG의 효과는 검색된 문서의 품질과 관련성에 크게 좌우된다. 검색 시스템이 정확하거나 적절한 정보를 가져오지 못하면 LLM은 부정확하거나 무관한 응답을 생성할 수 있다. 예를 들어 개방형 질의응답에서 오래되었거나 관련 없는 문서를 검색하면 오해의 소지가 있는 답변으로 이어질 수 있다. 검색 품질은 검색 방법의 선택(예: 밀집 검색 대 희소 검색), 지식 출처의 크기와 다양성, 모호하거나 복잡한 질의를 처리하는 능력과 같은 요인의 영향을 받는다. 특히 지식 베이스가 방대하거나 지속적으로 변화하는 도메인에서 검색 품질 개선은 여전히 중요한 과제이다 [40].
-
•
계산 비용:
외부 지식을 검색하고 처리하는 일은 계산 비용이 많이 들 수 있어 응답 시간이 늘어날 가능성이 있다. 검색 과정에는 대규모 지식 출처를 탐색하고, 검색된 문서를 인코딩하며, 이를 사용자 질의와 융합하는 작업이 포함되며, 이 모든 작업에는 상당한 계산 자원이 필요하다. 이는 특히 고객 지원이나 대화형 시스템과 같은 실시간 응용에서 응답 시간을 느리게 할 수 있다. 또한 계산 비용은 지식 출처의 크기와 검색 방법의 복잡성에 따라 증가한다. 예를 들어 신경 임베딩을 사용하여 질의와 문서를 매칭하는 밀집 검색 방법은 BM25와 같은 기존 희소 검색 방법보다 계산 집약적이다 [139].
-
•
편향과 잡음:
검색된 지식에는 편향이나 잡음이 포함될 수 있으며, 이는 LLM이 생성한 응답의 정확성과 신뢰성에 영향을 줄 수 있다. 웹이나 공개 데이터셋과 같은 외부 지식 출처는 흔히 그 기반 데이터에 존재하는 편향을 반영한다. 예를 들어 검색된 문서에 오래되었거나 불완전하거나 편향된 정보가 포함되면 LLM이 이러한 문제를 지속시키는 응답을 생성할 수 있다. 또한 무관하거나 저품질 콘텐츠와 같은 검색 문서의 잡음은 시스템 성능을 저하시킬 수 있다. 이러한 과제를 해결하려면 지식 출처를 신중하게 큐레이션하고, 강력한 필터링 메커니즘을 마련하며, 검색 데이터의 편향을 감지하고 완화하는 기법이 필요하다 [140].
검색, 계산 비용, 그리고 검색된 지식에 존재할 수 있는 편향과 잡음은 실제 응용에서 RAG의 신뢰성과 효과성을 보장하기 위해 해결해야 하는 핵심 고려사항이다. 이러한 한계를 극복하려면 검색 방법 개선, 계산 효율성 최적화, 외부 지식 출처의 편향과 잡음을 완화하는 전략을 포함한 지속적인 연구 개발이 필요하다 [40,139,140].
7.1.5. 캐시 증강 생성(CAG)
캐시 증강 생성(CAG)은 최근 인기를 얻고 있다. CAG는 RAG보다 상당히 빠르며 더 작은 도메인에서 동일한 결과를 낼 수 있다. 누군가 이미 잘 정립된 장비의 고장에 대해 IT 지원이 필요할 때, 답은 대개 잘 알려져 있다. 더욱이 이러한 질문에 답하기 위한 지식 베이스는 대개 작다. 이러한 문제에 RAG를 적용하는 것은 비효율적인 접근 방식이다. CAG는 더 짧은 시간 안에 동일한 해결책을 제공할 수 있다 [142].
CAG에 사전 적재되는 정보는 제한적이다. 이는 몇 가지 추가적인 장점과 단점을 가져온다. CAG의 제한된 정보는 정밀하고 정확할 수 있다. 초기 학습 데이터에 일부 오래된 개념이 포함되었을 가능성이 있다. RAG는 문서 선택과 순위 결정으로 인해 오류가 발생한다. CAG는 실시간으로 문서를 선택할 필요가 없다. CAG는 복잡한 질의에 취약할 수 있다 [96].
7.1.6. GraphRAG
RAG는 LLM이 이전에 보지 못한 문서와 비공개 문서에서 정보를 찾을 수 있게 하는 혁신적인 방법이지만, 문서 전체의 요약을 제공하는 데는 취약하다. 연구자들은 최근 답변의 포괄성을 높여 주는 지식 그래프 기반 RAG(GraphRAG)를 개발했다 [143].
7.1.7. GNN-RAG
연구자들은 최근 GNN의 추론 능력과 LLM의 언어 이해 능력을 결합하고 이 방법을 GNN-RAG라고 명명했다 [144]. 일반적인 GNN-RAG 프레임워크에서 GNN은 관련 그래프 정보를 추출하기 위한 밀집 부분 그래프 추론기 역할을 한다. LLM은 자연어 처리 능력을 통해 궁극적인 지식 그래프 질의응답을 제공한다.
7.1.8. 에이전틱 RAG
에이전틱 RAG는 에이전틱 AI와 RAG의 역량을 결합한다. 에이전틱 RAG는 정보를 동적으로 검색하고 처리할 수 있는 자율적이고 목표 지향적인 소프트웨어 시스템을 활용한다. 에이전틱 RAG 시스템은 질의 라우팅, 단계별 계획 수립 및 의사결정을 수행할 수 있다. 에이전틱 RAG는 더 정확한 결과를 얻기 위해 다른 소프트웨어 도구와 에이전트를 호출할 수 있다. 에이전틱 RAG 시스템에는 계획 수립과 이전 프롬프트 및 개인 속성 회상을 위한 메모리가 흔히 포함된다 [145].
2
에이전틱 RAG는 시스템의 확장성, 유연성 및 문맥 인식 능력을 향상한다.
비판적 종합
검색 증강 생성(RAG)은 출력을 외부 지식 출처에 근거하게 함으로써 환각을 완화한다 [40]. 지식 집약적 QA 벤치마크에서 경험적 개선이 관찰된다.
실패 조건:
검색 잡음, 순위 불안정성 및 컨텍스트 윈도우 포화.
절충:
사실적 근거 대 시스템 복잡성 및 지연 시간.
해결되지 않은 과제:
검색 품질의 표준화된 평가 및 안전한 컨텍스트 통합.
7.2. ReAct 프롬프팅
“추론과 행동(Reasoning and Acting)”의 줄임말인 ReAct 프롬프팅은 LLM의 응답 생성 과정에서 추론과 행동을 결합하는 프롬프팅 기법이다 [42]. 이는 LLM이 CoT 프롬프팅에서처럼 추론 단계를 생성할 뿐 아니라 행동을 수행하고, 상호작용하도록 장려한다
2
출처:
www.coursera.org/learn/retrieval-augmented-generation-rag
.
외부 도구나 환경과 상호작용하며, 그 결과를 다시 추론 과정에 통합하도록 한다 [42]. 이러한 상호작용 방식은 LLM이 더 복잡한 문제를 해결하고, 추가 정보를 수집하며, 실시간 피드백을 기반으로 추론을 조정할 수 있게 한다 [146]. 이는 동적 상호작용과 지식 획득이 필요한 과업에서 더 정확하고 견고한 해결책으로 이어진다 [147].
7.2.1. 작동 원리
ReAct 프롬프팅은 다음과 같은 핵심 측면을 포함한다:
-
• 추론: LLM은 문제를 분석하고 행동 계획을 수립하기 위한 추론 단계를 생성한다 [42].
-
• 행동 수행: LLM은 지식 베이스와 상호작용하거나, 검색 엔진에 질의하거나, 도구를 사용하는 등 자신의 추론에 기반하여 행동을 수행한다 [42].
-
• 관찰: LLM은 자신의 행동에서 나온 결과나 피드백을 관찰한다 [146].
-
• 추론 갱신: LLM은 관찰을 바탕으로 추론을 갱신하며, 잠재적으로 계획을 수정하거나 추가 행동을 수행한다 [147].
7.2.2. ReAct 프롬프팅의 예시
ReAct 프롬프팅은 다음과 같이 동적 상호작용과 지식 획득이 필요한 다양한 과업에 적용할 수 있다:
-
• 대화형 문제 해결: "
당신은 잠긴 상자와 열쇠가 있는 방에 있는 로봇입니다. 상자를 어떻게 열겠습니까?
" LLM은 다음과 같이 추론한다: "
열쇠를 찾아 상자의 잠금을 해제하는 데 사용해야 합니다.
" 그런 다음 다음과 같은 행동을 수행한다: "
방 안을 둘러보며 열쇠를 찾는다. 열쇠를 집는다. 상자에 다가간다. 열쇠를 자물쇠에 넣는다. 열쇠를 돌린다.
" LLM은 결과를 관찰하고 그에 따라 추론을 갱신한다.
-
• 지식 기반 질의응답: "
도쿄의 인구는 얼마입니까?
" LLM은 다음과 같이 추론한다: "
도쿄 인구에 대한 정보를 찾아야 합니다.
" 그런 다음 다음과 같은 행동을 수행한다: "
웹에서 '도쿄 인구'를 검색한다.
" LLM은 검색 결과를 관찰하고 답을 추출한다.
-
• 불확실성이 있는 의사결정: "
당신은 포커 게임을 하고 있습니다. 콜해야 할까요, 폴드해야 할까요?
" LLM은 현재 게임 상태, 자신의 패, 그리고 가능한 결과에 관해 추론한다. 그런 다음 다음과 같은 행동을 수행한다: "
포커 계산기를 사용하여 승리 확률을 추정한다.
" LLM은 계산된 확률을 관찰하고 의사결정을 내리기 위해 추론을 갱신한다.
7.2.3. ReAct 프롬프팅의 장점
ReAct 프롬프팅은 여러 장점을 제공한다:
-
• 동적 문제 해결: LLM이 동적 상호작용과 적응을 요구하는 복잡한 문제를 해결할 수 있게 한다 [42].
-
• 지식 획득: LLM이 외부 소스에서 실시간 정보를 획득하고 활용할 수 있게 한다 [42].
-
• 정확도 향상: 피드백과 관찰 결과를 통합하여 LLM이 생성한 응답의 정확도를 높인다 [146].
-
• 설명 가능성: 추론과 행동을 드러냄으로써 LLM의 의사결정 과정을 통찰할 수 있게 한다 [147].
7.2.4. ReAct 프롬프팅의 한계
이점에도 불구하고, ReAct 프롬프팅에는 몇 가지 한계가 있다:
-
• 복잡성: ReAct 프롬프팅을 구현하려면 외부 도구 및 환경과의 통합이 필요하므로 복잡할 수 있다 [42].
-
• 계산 비용: 행동을 취하고 결과를 관찰하는 것은 계산 비용이 많이 들 수 있으며, 응답 시간을 늘릴 가능성이 있다 [42].
-
• 안전성 우려: LLM이 외부 환경과 상호작용하도록 허용하면 의도하지 않았거나 해로운 행동을 취할 수 있으므로 안전성 우려가 제기된다 [146].
비판적 종합
ReAct는 추론과 도구 사용을 통합하여 외부 시스템과의 동적인 상호작용을 가능하게 한다 [42]. 이는 상호작용형 작업에서 사실 정확성과 의사결정 능력을 향상한다.
실패 조건:
도구 호출 오류와 연쇄적인 추론 결함.
절충:
향상된 적응성 대 오케스트레이션 복잡성.
미해결 과제:
견고한 도구 선택 및 실패 복구 메커니즘.
7.3. 검증 연쇄 (CoVe)
검증 연쇄(Chain-of-Verification, CoVe)는 대규모 언어 모델(LLM)이 출력을 생성하기 전에 자신의 응답을 검증하도록 유도하여 그 신뢰성과 믿을 만함을 높이기 위해 설계된 프롬프팅 기법이다 [129]. 이 접근법은 LLM이 성찰과 비판적 평가 과정에 참여하도록 유도함으로써 그럴듯하지만 잘못되었거나 “환각된” 정보를 생성하는 문제를 해결한다 [146]. CoVe는 모델 자체의 지식과 추론 능력을 활용하는 검증 단계를 통합하여 잠재적 오류를 식별하고 수정함으로써 LLM 생성 콘텐츠의 사실 정확성과 일관성을 개선하는 것을 목표로 한다 [148].
7.3.1. 작동 원리
CoVe 프롬프팅은 일반적으로 다음 단계를 포함한다:
-
• 초기 응답 생성: LLM이 주어진 프롬프트나 질의에 대한 초기 응답을 생성한다 [129].
-
• 검증 프롬프트: 그런 다음 LLM은 “이 답변이 맞습니까?” 또는 “이 정보를 어떻게 검증할 수 있습니까?”와 같은 명시적 지시와 함께 자신의 초기 응답을 검증하도록 프롬프트를 받는다 [146].
-
• 검증 추론: LLM은 초기 응답의 정확성을 평가하기 위해 추론과 성찰 과정에 참여하며, 잠재적으로 외부 지식 소스에 접근하거나 내부 일관성 검사를 사용할 수 있다 [148].
-
• 응답 수정: 검증 과정에 따라 LLM은 초기 응답을 수정하여 오류를 바로잡고, 추가 정보를 덧붙이거나, 검증 결과가 확정적이지 않을 경우 불확실성을 표명할 수 있다 [129].
7.3.2. 검증 연쇄(CoVe)의 예시
CoVe 프롬프팅은 다음과 같이 사실 정확성과 일관성이 중요한 다양한 작업에 적용할 수 있다:
-
• 질의응답: “
프랑스의 수도는 무엇인가?
” LLM은 초기 응답을 생성한다: “
프랑스의 수도는 파리이다.
” 그런 다음 프랑스에 관한 자신의 지식에 접근하여 이 응답을 검증하고 초기 답변의 정확성을 확인한다.
-
• 요약: “
기후 변화에 관한 다음 기사를 요약하시오.
” LLM은 초기 요약을 생성한다. 그런 다음 원본 기사에서 언급된 핵심 사항 및 사실과 비교하여 이를 검증하고, 정확하고 포괄적인지 확인한다.
-
• 코드 생성: “
숫자의 계승을 계산하는 Python 함수를 작성하시오.
” LLM은 초기 함수를 생성한다. 그런 다음 다양한 입력으로 함수를 테스트하고 출력이 올바른지 확인하여, 코드의 오류를 잠재적으로 식별하고 수정한다.
7.3.3. 검증 연쇄(CoVe)의 장점
CoVe 프롬프팅은 여러 장점을 제공한다:
-
• 정확도 향상: 검증 단계를 통합하여 LLM이 생성한 응답의 사실 정확성과 일관성을 높인다 [129].
-
• 환각 감소: 자기 성찰과 비판적 평가를 장려하여 부정확하거나 “환각된” 정보의 생성을 최소화한다 [146].
-
• 신뢰성 향상: LLM이 자신의 응답을 검증하고 타당성을 확인하는 능력을 보여줌으로써 신뢰성을 개선한다 [148].
-
• 적응성: 검증 프롬프트와 응답 평가 기준을 조정하여 다양한 작업과 도메인에 맞게 적용할 수 있다 [129].
7.3.4. 검증 연쇄(CoVe)의 한계
이점에도 불구하고, CoVe 프롬프팅에는 몇 가지 한계가 있다:
-
• 계산 비용: 검증 과정은 계산 비용이 많이 들 수 있으며, 응답 시간과 리소스 사용량을 늘릴 가능성이 있다 [129].
-
• 검증 효과성: 검증 단계의 효과성은 LLM이 자신의 응답을 평가하고 신뢰할 수 있는 지식 소스에 정확하게 접근하는 능력에 달려 있다 [146].
-
• 제한된 범위: CoVe 프롬프팅은 주로 사실 정확성과 일관성에 초점을 맞추므로 편향이나 윤리적 고려 사항과 같은 다른 문제를 다루는 데는 효과가 떨어질 수 있다 [148].
7.4. 노트 연쇄(CoN) 프롬프팅
노트 연쇄(Chain-of-Note, CoN) 프롬프팅은 프롬프팅 과정에 구조화된 일련의 노트나 힌트를 통합하여 대규모 언어 모델(LLM)의 추론 및 문제 해결 능력을 향상하는 것을 목표로 최근 개발된 프롬프팅 기법이다 [149]. 이 접근법은 인간이 사고와 문제 해결 과정을 돕기 위해 노트나 알림을 자주 사용하는 방식에서 영감을 얻어, 복잡한 인지 작업을 지원하는 외부 발판을 제공한다 [133]. 노트 연쇄를 통합함으로써 CoN 프롬프팅은 LLM이 문제를 더 작은 단계로 나누고 중간 결과를 고려하며 일관된 추론 흐름을 유지하도록 안내하여, 다단계 추론, 계획, 의사결정이 필요한 작업에서 성능을 향상한다 [137].
7.4.1. 작동 원리
CoN 프롬프팅은 일반적으로 다음 단계를 포함한다:
-
• 노트 생성: 문제와 관련된 정보, 제안 또는 제약 조건을 각각 제공하는 일련의 노트나 힌트를 만든다 [149].
-
• 프롬프트 통합: 노트를 별도 섹션으로 또는 문제 설명 및 지시사항 사이에 배치하여 프롬프트에 통합한다 [133].
-
• LLM 처리: LLM은 노트 연쇄를 포함한 프롬프트를 처리하고, 노트를 사용하여 추론 및 의사결정 과정을 안내한다 [137].
-
• 응답 생성: LLM은 프롬프트와 노트를 바탕으로 응답을 생성하며, 제공된 힌트를 활용해 문제를 해결하거나 질문에 답하는 능력을 보여준다 [149].
7.4.2. 노트 연쇄(CoN) 프롬프팅의 예시
CoN 프롬프팅은 다음과 같이 구조화된 안내와 단계별 추론의 이점을 얻는 다양한 작업에 적용할 수 있다:
-
• 수학 문제 해결: “밑변이 10cm이고 높이가 5cm인 삼각형의 넓이를 계산하시오.” 프롬프트에는 다음과 같은 노트 연쇄가 포함된다: “노트 1: 삼각형의 넓이 공식은
이다. 노트 2: 주어진 값을 공식에 대입하시오. 노트 3: 계산을 수행하시오.”
-
• 논리적 추론: “모든 새는 날 수 있다. 펭귄은 새이다. 펭귄은 날 수 있는가?” 프롬프트에는 다음과 같은 노트 연쇄가 포함된다: “노트 1: 새에 관한 일반 규칙을 고려하시오. 노트 2: 펭귄이 이 규칙의 예외인지 생각하시오. 노트 3: 정보를 바탕으로 결론을 도출하시오.”
-
• 계획 및 의사결정: “이용 가능한 교통수단과 예산을 고려하여 도시 A에서 도시 C까지의 여행을 계획하시오.” 프롬프트에는 다음과 같은 노트 연쇄가 포함된다: “노트 1: 도시 간 항공편과 기차 시간표를 확인하시오. 노트 2: 이동 시간과 비용을 비교하시오
각 선택지의 비용을 비교하시오. 노트 3: 예산과 일정에 가장 잘 맞는 선택지를 고르시오.”
7.4.3. 노트 연쇄(CoN) 프롬프팅의 장점
CoN 프롬프팅은 여러 장점을 제공한다:
-
• 추론 향상: 구조화된 안내를 제공하여 다단계 추론 및 문제 해결을 수행하는 LLM의 능력을 높인다 [149].
-
• 오류 감소: 명시적인 힌트를 제공하여 핵심 정보를 간과하거나 잘못된 가정을 하는 데서 발생하는 오류를 최소화한다 [133].
-
• 해석 가능성 향상: 중간 단계와 노트의 사용을 드러내 LLM의 추론 과정을 더 투명하고 이해하기 쉽게 만든다 [137].
-
• 적응성: 노트의 내용과 복잡성을 조정하여 다양한 작업과 도메인에 맞게 적용할 수 있다 [149].
7.4.4. 노트 연쇄(CoN) 프롬프팅의 한계
이점에도 불구하고, CoN 프롬프팅에는 몇 가지 과제가 있다:
-
• 노트 생성: 관련성이 있고 유용하며 지나치게 유도적이지 않도록 노트를 신중하게 설계하고 선택해야 한다 [149].
-
• 프롬프트 엔지니어링: 노트를 프롬프트에 효과적으로 통합하는 일은 배치와 표현을 신중히 고려해야 하므로 어려울 수 있다 [133].
-
• 계산 비용: 긴 지식 사슬을 처리하면 LLM의 계산 비용과 응답 시간이 증가할 수 있다 [137].
7.5. 지식 사슬(CoK) 프롬프팅
지식 사슬(Chain-of-Knowledge, CoK) 프롬프팅은 구조화된 지식 또는 정보 사슬을 프롬프팅 과정에 통합하여 대규모 언어 모델(LLM)의 추론 역량을 향상시키는 기법이다 [150]. 이 접근법은 LLM에 관련 지식이나 맥락을 제공하면 추론, 추론적 판단, 문제 해결이 필요한 과제에서 성능을 크게 개선할 수 있다는 개념을 활용한다 [151]. CoK 프롬프팅은 지식 사슬을 명시적으로 제공함으로써 LLM이 이 정보를 효과적으로 접근하고 활용하도록 안내하여, 더 정확하고 일관되며 통찰력 있는 응답을 이끈다 [152].
7.5.1. 작동 원리
CoK 프롬프팅은 일반적으로 다음 단계를 포함한다:
-
• 지식 선택: 특정 과제 또는 질의에 기반하여 지식 베이스, 데이터베이스, 텍스트 코퍼스와 같은 외부 출처에서 관련 지식이나 정보를 선택한다 [150].
-
• 지식 구조화: 선택된 지식을 사슬 또는 순서로 구조화하여 각 정보 조각이 이전 정보에 기반하고 문제에 대한 전반적 이해에 기여하도록 한다 [151].
-
• 프롬프트 통합: 지식 사슬을 별도 섹션으로 또는 문제 설명 및 지침 사이에 배치하여 프롬프트에 통합한다 [152].
-
• LLM 처리: LLM은 지식 사슬을 포함한 프롬프트를 처리하고, 제공된 정보를 사용하여 추론 및 의사결정 과정을 안내한다 [150].
-
• 응답 생성: LLM은 프롬프트와 지식 사슬을 바탕으로 응답을 생성하며, 제공된 정보를 활용하여 문제를 해결하거나 질문에 답하는 능력을 보여준다 [151].
7.5.2. 지식 사슬(CoK) 프롬프팅의 예시
CoK 프롬프팅은 다음과 같이 지식 집약적 추론과 추론적 판단이 필요한 다양한 과제에 적용할 수 있다:
-
• 과학적 추론: "광합성 과정을 설명하라." 프롬프트에는 다음과 같은 지식 사슬이 포함된다: "햇빛은
엽록소에 흡수된다. 물은 뿌리에서 잎으로 운반된다. 이산화탄소는 대기로부터 흡수된다. 반응의 결과로 포도당이 생성된다.
”
-
• 역사적 분석: “
제1차 세계 대전의 원인을 분석하라.
” 프롬프트에는 다음과 같은 지식 사슬이 포함된다: “
프란츠 페르디난트 대공의 암살이 분쟁을 촉발했다. 주요 강대국들은 동맹을 맺고 있었다. 민족주의는 유럽에서 강력한 힘이었다. 군비 경쟁은 긴장과 불신을 조성했다.
”
-
• 의학적 진단: “
환자의 증상을 바탕으로 상태를 진단하라.
” 프롬프트에는 다음과 같은 지식 사슬이 포함된다: “
환자에게 발열, 기침, 호흡 곤란이 있다. 이러한 증상은 폐렴과 일치한다. 흉부 X선으로 진단을 확인할 수 있다.
”
7.5.3. 지식 사슬(CoK) 프롬프팅의 장점
CoK 프롬프팅은 여러 장점을 제공한다:
-
• 향상된 추론: 관련 지식과 맥락을 제공하여 LLM이 복잡한 추론과 추론적 판단을 수행하는 능력을 향상시킨다 [150].
-
• 정확도 향상: 신뢰할 수 있고 구조화된 지식에 기반을 두어 LLM이 생성한 응답의 정확도를 개선한다 [151].
-
• 설명 가능성 향상: LLM이 활용한 지식을 드러내어 그 추론 과정을 더 투명하고 이해하기 쉽게 만든다 [152].
-
• 적응성: 적절한 지식 출처를 선택하고 구조화함으로써 다양한 과제와 도메인에 맞게 적용할 수 있다 [150].
7.5.4. 지식 사슬(CoK) 프롬프팅의 한계
장점에도 불구하고 CoK 프롬프팅에는 몇 가지 한계가 있다:
-
• 지식 선택: 관련성이 높고 신뢰할 수 있는 지식 출처를 신중하게 선택해야 하며, 이는 어렵고 시간이 많이 걸릴 수 있다 [151].
-
• 지식 구조화: 지식을 일관되고 효과적인 사슬로 구조화하는 일은 복잡할 수 있으며, 도메인 전문성과 신중한 고려가 필요하다 [152].
-
• 계산 비용: 긴 지식 사슬을 처리하면 LLM의 계산 비용과 응답 시간이 증가할 수 있다 [150].
8. 대화형 및 인간-AI 협업 기법
(사용자 입력, 피드백 또는 수정을 포함하는 기법)
8.1. 액티브 프롬프트
액티브 프롬프트(Active-Prompt)는 복잡한 추론을 처리하는 대규모 언어 모델(LLM)의 효율성을 개선하는 고급 방법이다. 이 기법은 불확실성에 기반한 능동 학습 전략을 통합하면서 가장 불확실하거나 중요한 질문을 식별하고 레이블링하는 방식으로 작동한다 [152]. 불확실성 기반 능동 학습 기법을 활용하여 가장 불확실하거나 유익한 질문을 능동적으로 선택하고 주석을 추가함으로써 이를 달성한다 [152–154]. 액티브 프롬프트는 중간 추론 단계를 제공하면 LLM 성능을 크게 향상시킬 수 있음을 보여준 사고 사슬(Chain-of-Thought, CoT) 프롬프팅 [2]의 성공을 기반으로 한다. 액티브 프롬프트의 주요 특징:
-
• 적응형 학습: 전통적인 고정 프롬프트 [5] 또는 퓨샷 학습 접근법과 달리, 액티브 프롬프트는 주석을 위해 가장 도전적이고 모호한 질문을 동적으로 식별하고 선택한다 [152]. 이는 미리 정해진 프롬프트 집합에 의존하는 방법과 대조된다.
-
• 인간 주도 정제: 이 접근법은 선택된 질문에 사고 사슬(CoT) 추론을 주석으로 달기 위해 인간의 전문성을 통합한다 [2]. 이 접근법은 능동 학습을 통해 선택된 가장 가치 있는 예시에 중점을 두면서, 사고 사슬(CoT) 프롬프팅의 원리에 따라 LLM이 추론 전략을 점진적으로 학습하도록 돕는다 [152].
-
• 불확실성 기반 선택: 액티브 프롬프트는 엔트로피, 불일치(예: LLM에서 여러 번 샘플링한 출력 간의 불일치), 분산과 같은 지표를 사용하여 가장 불확실한 질문을 식별한다 [152,155]. 이는 딥러닝 모델의 불확실성 추정을 위한 확립된 기법 [155]에 기반하며, 모델의 학습이 가장 큰 불확실성이나 비일관성을 보이는 영역에 집중되도록 보장한다.
-
• 모델 정확도 향상: 능동 학습 원리 [152,154]에 따라 프롬프트를 정제함으로써, 액티브 프롬프트는 산술 및 상식 추론과 같은 다양한 추론 과제의 정확도를 크게 향상시킨다 [152]. 이는 능동 학습 전략과 LLM을 위한 프롬프트 기반 학습을 결합하는 효과를 보여준다.
8.1.1. 작동 원리
액티브 프롬프트의 작동 원리는 표적 주석을 통해 LLM 추론을 전략적으로 개선하는 데 중점을 둔다. 그림 18은 다음과 같이 작동하는 이 과정을 보여준다:
-
• 불확실성 추정: 첫 번째 단계는 모델이 가장 어려워하는 질문이 무엇인지 식별하는 것이다(그림 18, 섹션 (1) 참조). 모델에 일련의 질문을 제시하고, 그 답변을 평가하여 불확실성 수준을 평가한다 [152]. 하나의 질문에 대해 여러 샘플링 응답을 자주 사용한다 [97]. 답변의 높은 분산은 더 높은 불확실성을 나타낸다. 불일치(서로 다른 답변의 빈도)와 엔트로피(응답 예측 불가능성의 척도) 같은 지표를 사용하여 이 불확실성을 정량화한다 [152,155]. 더 높은 불확실성 점수는 모델 개선에 중요한 질문을 부각한다.
-
• 질문 선택: 불확실성을 정량화한 후, 불확실성 점수에 따라 질문의 순위를 매긴다(그림 18, 섹션 (2)). 가장 도전적이고 모호한 질문(불확실성이 가장 높은 질문)을 인간 주석 대상으로 선택한다 [152]. 이는 모델의 학습이 오류를 범하기 가장 쉬운 영역을 대상으로 하도록 보장한다. 무작위 샘플링과 달리 이 능동적 선택 과정은 능동 학습의 핵심 원칙 [154]이며, 주석이 달린 각 예시의 영향을 극대화한다.
-
• 인간 주석: 인간 전문가는 선택된 질문에 대해 정답과 함께 포괄적이고 순차적인 설명(사고 사슬 또는 CoT 추론)을 제공한다(그림 18, 섹션 (3)) [2,152]. 이 주석 예시는 고품질 학습 데이터로 기능하며, 모델이 복잡한 추론 과정을 이해하고 재현하도록 안내한다. 이 조직적이고 체계적인 접근법은 모델이 문제를 세분화하고 체계적으로 해결하도록 하여 인간의 문제 해결 전략을 모방하게 한다.
-
• 추론 및 학습: 새로 획득한 주석 예시를 바탕으로 모델의 학습이 정제된다. 추론 중에(그림 18, 섹션 (4)), 모델은 주석 데이터에서 학습한 추론 패턴을 활용하여 새로운 질문에 대해 더 정확하고 논리적으로 타당한 답변을 생성한다 [152]. 불확실성 추정, 선택적 주석, 모델 정제의 이 반복 과정은 지속적인 성능 향상을 가져오며, 모델이 복잡한 추론 과제를 더 잘 처리하고 오류를 최소화하게 한다.
8.1.2. 액티브 프롬프트의 예시
액티브 프롬프트는 다음과 같이 복잡한 추론이 필요하고 인간의 안내로 이점을 얻는 다양한 과제에 적용할 수 있다:
-
• 산술 추론: 산술 추론은 논리적 단계를 필요로 하는 수학 문제를 푸는 것을 포함한다. 예를 들어, 다음 문제를 생각해 보자: “한 농부에게 사과 20개가 있고, 친구 4명에게 각각 3개씩 준다. 남은 사과는 몇 개인가?” 표준 LLM은 여러 단계의 계산이 어렵기 때문에 일관되지 않은 답을 제공할 수 있다 [5]. 액티브 프롬프트는 이러한 불확실한 사례를 식별하고 인간이 주석을 단 단계별 해법을 통해 모델의 접근법을 정제하여 도움을 준다 [152]. 사고 사슬(CoT)을 통합함으로써
그림 18.
액티브 프롬프트 프레임워크: (1) 불확실성 추정은 여러 LLM 출력을 사용하여 도전적인 질문을 식별한다; (2) 질문 선택은 불확실성에 따라 질문의 순위를 매긴다; (3) 인간 주석은 선택된 질문에 상세한 CoT 설명을 제공한다; (4) 추론은 새로운 예시를 활용하여 모델 성능을 향상시킨다 [152].
추론 [2]을 통합함으로써 모델은 여러 단계의 산술 연산을 수행하는 능력을 개선하여 더 정확하고 논리적인 응답으로 이어진다.
-
•
상식 추론:
상식 추론은 모델이 일상적인 인간 경험에 기반하여 논리적인 결정을 내릴 수 있게 한다. 예를 들어, 모델은 다음 질문에서 어려움을 겪을 수 있다: "John이 우산을 가져오는 것을 잊었는데 비가 내리기 시작하면, 어떤 일이 일어날 가능성이 높은가?" 구조화된 추론이 없으면 모델은 불명확하거나 지나치게 단순한 답변을 제공할 수 있다 [5]. 액티브 프롬프트는 불확실성이 높은 이러한 사례를 식별하고 다음과 같은 상세한 설명을 통합한다: "우산이 없으면 John은 피할 곳을 찾지 않는 한 젖을 가능성이 높다." 유사한 모호한 사례를 선택하고 주석을 달아 [152], 모델은 실제 세계의 결과를 더 효과적으로 예측하는 능력을 향상시킨다. 이는 CoT 프롬프팅 [2]이 보여준 역량을 기반으로 하지만, 주석을 가장 큰 불확실성 영역에 집중한다.
-
•
기호 추론:
기호 추론에는 논리적 패턴을 감지하고 적용하는 능력이 필요하다. 일반적인 예는 다음과 같은 암호 해독 질문이다: "'CAT'이 'DBU'로 암호화된다면, 'DOG'는 어떻게 암호화되는가?" LLM은 패턴 인식의 어려움으로 인해 일관되지 않은 응답을 생성할 수 있다 [5]. 액티브 프롬프트는 불확실한 사례를 식별하고 다음과 같이 주석이 달린 패턴 기반 추론을 추가하여 이를 해결한다: "각 문자는 알파벳에서 한 칸씩 앞으로 이동하므로, 'DOG'는 'EPH'가 된다." 인간 주석에 의해 주도되는 이 조직적 학습 과정은 모델이 기호 변환을 식별하고 활용하는 역량을 향상시킨다 [152].
-
•
과학적 추론:
과학적 추론은 모델이 자연 현상을 설명하기 위해 기본 원리를 적용할 것을 요구한다. 예를 들어, "얼음은 왜 물에 뜨는가?"라는 질문을 받으면 LLM은 과학적 추론을 상세히 설명하지 않은 일반적인 응답을 생성할 수 있다 [5]. 액티브 프롬프트는 불확실한 사례를 선택하고 다음과 같은 단계별 물리학 기반 설명을 사용해 모델의 응답을 정제함으로써 이해를 향상시킨다: "얼음은 분자가 결정 구조로 배열되어 있어 물보다 밀도가 낮으므로 뜬다." 과학적 설명의 명확성과 정확성을 개선함으로써, 액티브 프롬프트는 LLM이 학술 및 연구 기반 질의에서 더 나은 성과를 내도록 돕는다 [152,156]. 이는 표적 주석이 복잡하고 도메인 특화된 추론 과제의 성능을 어떻게 향상시킬 수 있는지 보여준다.
-
•
다단계 의사결정:
액티브 프롬프트는 "로봇이 장애물이 있는 격자를 탐색해야 한다면, 최적의 경로는 무엇인가?"와 같이 순차적 추론이 필요한 과제에서 LLM을 향상시킨다. 이러한 문제를 선택하고 단계별 논리로 응답을 정제함으로써, 모델은 의사결정 정확도를 개선한다 [152]. 이는 단순한 질의응답을 넘어 계획과 순차적 의사결정을 필요로 하는 과제를 포괄하는 문제에 액티브 프롬프트를 적용할 수 있음을 보여준다.
8.1.3. 액티브 프롬프트의 장점
액티브 프롬프트는 불확실하고 복잡한 추론 과제에 집중하여 대규모 언어 모델(LLM)을 향상시킨다. 주요 장점은 다음과 같다:
-
• 향상된 모델 정확도: 가장 불확실한 질문을 선택함으로써, 액티브 프롬프트는 LLM이 추론 능력을 향상시키도록 돕는다. 이러한 표적 학습은 모델이 가장 어려워하는 영역에 집중하도록 하여 다양한 과제에서 더 높은 정확도로 이어진다 [152]. 이는 유익한 예시를 우선시하는 능동 학습 접근법의 직접적인 결과이다 [154].
-
• 인간 주석의 효율적 활용: 무작위 질문에 주석을 다는 대신, Active-Prompt는 인간의 개입이 필요한 가장 불확실한 질문만 선택합니다. 이는 모델에 미치는 학습 효과를 극대화하면서 수작업을 줄입니다 [152]. 이러한 효율성은 레이블된 데이터를 획득하는 비용을 최소화하므로 능동 학습의 핵심 이점입니다 [154].
-
• 복잡한 추론 강화: 구조화된 사고 사슬(Chain-of-Thought, CoT) 추론을 제공하여 다단계 사고를 향상합니다. 이는 LLM이 수학, 논리, 과학적 설명에서 복잡한 문제를 더 효과적으로 처리하도록 돕습니다 [2,152]. Active-Prompt는 CoT의 이점과 능동 학습의 표적화된 개선을 결합합니다.
-
• 다양한 작업에 대한 적응성: Active-Prompt는 산술, 상식, 기호적 및 과학적 추론을 포함한 다양한 도메인에 적용할 수 있습니다. 이러한 유연성은 여러 실제 응용 분야에서 유용하게 합니다 [152]. 능동 학습과 불확실성 기반 선택의 일반 원칙은 특정 추론 작업과 관계없이 적용할 수 있습니다.
-
• 모델 불확실성 감소: 높은 불확실성을 지닌 질문에 집중함으로써 모델은 점차 답변에 대해 더 자신감 있고 일관된 모습을 보입니다. 이는 여러 추론 작업 전반에서 더 신뢰할 수 있고 안정적인 응답으로 이어집니다 [152,155]. 이러한 불확실성 감소는 모델의 약점을 식별하고 해결하는 반복 과정의 직접적인 결과입니다.
8.1.4. active-prompt의 한계
효과적임에도 불구하고 Active-Prompt에는 몇 가지 한계가 있습니다:
-
• 인간 주석에 대한 의존성: Active-Prompt는 선택된 질문에 사고 사슬 추론으로 주석을 달기 위해 인간의 개입을 필요로 합니다. 이는 정확도를 향상하지만 추가 노력과 비용을 발생시켜 대규모 데이터셋에서의 확장성을 제한합니다 [152]. 인간 전문성에 대한 이러한 의존은 능동 학습 접근법의 일반적인 과제입니다 [154].
-
• 불확실성 지표에 대한 민감성: Active-Prompt의 효과는 불확실성을 측정하는 방식에 따라 달라집니다. 서로 다른 불확실성 지표(예: 엔트로피, 불일치)는 선택 품질에 영향을 미칠 수 있으며, 최선의 지표를 선택하는 것이 항상 간단하지는 않습니다 [152,155]. 이상적인 지표는 특정 작업과 모델 아키텍처에 따라 달라질 수 있습니다.
-
• 작업별 성능 변동성: 추론 작업에서는 잘 작동하지만, 그 효과는 도메인에 따라 달라질 수 있습니다 [152]. 일부 작업은 최적으로 수행하기 위해 프롬프팅 전략이나 불확실성 추정 방법의 추가 미세 조정 또는 수정이 필요할 수 있습니다. 이는 프롬프트 기반 학습 접근법의 일반적인 한계입니다.
-
• 계산 비용: 불확실성을 추정하기 위해 질문당 여러 번 추론을 실행하려면 상당한 계산 자원이 필요합니다 [97,152]. 이로 인해 특히 상당한 규모의 모델과 데이터셋에서 Active-Prompt의 비용이 높아질 수 있습니다. 불확실성 추정의 계산 비용은 능동 학습에서 일반적인 트레이드오프입니다.
-
• 제한된 전이 가능성: 주석이 달린 예시는 서로 다른 모델이나 데이터셋 전반에 항상 잘 일반화되지는 않을 수 있습니다 [152]. 모델은 학습 데이터와 크게 다른 새로운 작업에서는 여전히 어려움을 겪을 수 있으며, 이는 학습된 추론 패턴의 전이 가능성에 잠재적 한계가 있음을 보여 줍니다. 이는 퓨샷 및 메타 학습에서 알려진 과제입니다.
비판적 종합
능동 프롬프팅은 불확실성 기반 샘플 선택과 인간 주석을 통해 추론을 개선합니다 [152]. 자동화된 프롬프트 최적화 프레임워크는 수작업 시행착오 설계를 줄이는 것을 목표로 합니다.
실패 조건:
주석 비용 및 도메인 간 불안정성.
트레이드오프:
성능 향상 대 추가적인 인간 또는 계산 오버헤드.
미해결 과제:
이론적 보장을 갖춘 확장 가능한 자동화 프롬프트 개선.
8.2. 자동 프롬프트 엔지니어(APE)
자동 프롬프트 엔지니어(Automatic Prompt Engineer, APE)는 대규모 언어 모델(LLM)을 위한 효과적인 프롬프트의 생성과 선택을 자동화하는 방법입니다 [157]. 시간이 많이 들고 상당한 전문 지식이 필요한 수작업으로 작성된 프롬프트에 의존하는 대신 [5], APE는 프롬프트 생성을 최적화 문제로 취급합니다. LLM을 활용해 여러 후보 프롬프트를 제안하고, 점수 함수에 따라 그 성능을 평가합니다 [157]. 이후 가장 성능이 좋은 프롬프트를 사용하도록 선택합니다. 이 과정은 모델의 출력 정확도와 관련성을 향상하도록 지시문(또는 프롬프트)을 최적화하는 프로그램 합성에서 영감을 받았습니다. APE는 여러 작업에서 인간이 설계한 프롬프트보다 뛰어난 성능을 보였으며, LLM 기반 애플리케이션의 효율성과 효과를 높였습니다 [70].
8.2.1. 작동 원리
자동 프롬프트 엔지니어(APE)는 그림 19에 나타난 바와 같이 구조화된 과정을 통해 대규모 언어 모델(LLM)을 위한 최적화된 프롬프트를 체계적으로 생성하고 선택하여 작동합니다. 다음 핵심 단계를 따릅니다:
-
• 지시문 제안: APE는 입력–출력 예시를 바탕으로 LLM(대개 프롬프트를 받을 동일한 LLM 또는 유사한 모델)을 사용해 여러 후보 프롬프트를 생성합니다 [157]. 이러한 프롬프트는 대상 모델의 동작을 안내하는 지시문 역할을 합니다. 목표는 시간이 많이 들고 상당한 도메인 전문 지식이 필요할 수 있는 사람이 작성한 프롬프트에 의존하는 대신, 다양하고 의미 있는 프롬프트를 자동으로 만드는 것입니다 [5]. (그림 19(a), 1단계 참조)
-
• 점수화 및 평가: 생성된 각 프롬프트는 점수 함수를 사용하여 대상 모델(최적화 대상 LLM)에서 테스트됩니다 [157]. 실행 정확도(즉, 주어진 입력에 대해 LLM의 출력이 원하는 출력과 일치하는지 여부)와 프롬프트가 주어졌을 때 대상 출력의 로그 확률은 프롬프트가 모델의 응답에 얼마나 잘 영향을 미치는지 측정하는 데 흔히 사용되는 지표입니다 [157,158]. 이는 특정 작업에 가장 효과적인 프롬프트를 식별하는 데 도움이 됩니다. (그림 19(a), 2 및 3단계 참조)
-
• 필터링 및 선택: 성능이 낮은 프롬프트(점수 함수에 따라 낮은 점수를 받은 프롬프트)는 버리고, 최고 점수를 받은 프롬프트만 유지합니다 [157]. 이 과정은 선택된 프롬프트가 높은 품질을 갖고 더 나은 모델 성능에 기여하도록 보장하며, 진화 알고리즘의 선택 과정과 유사합니다. (그림 19(a)의 체크 표시와 X 표시 참조)
-
• 반복적 개선: 선택된 프롬프트가 충분히 잘 작동하지 않는 경우(예: 원하는 정확도 임계값에 도달하지 못한 경우), APE는 반복적 몬테카를로 탐색을 통해 새 변형을 생성하여 이를 개선합니다 [157]. 이 과정은 만족스러운 프롬프트를 찾거나 계산 예산이 소진될 때까지 프롬프트를 미세 조정하며 반복적으로 향상합니다. 이러한 반복적 접근법은 APE가 가능한 프롬프트 공간을 탐색하고 고품질 해법으로 수렴할 수 있게 합니다. (그림 19(a), 4 및 5단계 참조)
8.2.2. 자동 프롬프트 엔지니어(APE)의 예시
APE는 다음과 같이 프롬프트 엔지니어링을 자동화하기 위해 다양한 작업과 도메인에 적용할 수 있습니다:
-
• 반의어 생성: 모델에 단어를 제공하고 그 반대말을 생성하도록 요청합니다(예: hot → cold). 이는 단어 간 의미 관계에 대한 모델의 이해를 시험합니다 [159].
-
• 복수형 만들기: 모델은 단수 단어를 복수형으로 변환합니다(예: cat → cats). 이는 기본적인 형태론 규칙에 대한 모델의 이해를 평가합니다 [5].
그림 19.
자동 프롬프트 엔지니어링(APE) 워크플로의 예시입니다. 이 그림은 [157]의 정보를 바탕으로 작성했습니다. LLM 추론 모델은 관찰을 바탕으로 프롬프트를 제안합니다. 모든 제안은 LLM 재샘플링 모델에 의해 점수화됩니다. 높은 점수를 받은 프롬프트 제안은 다른 LLM 재샘플링 모델로 전달됩니다. 해당 재샘플링 모델은 동일한 의미를 유지하면서 입력의 다른 변형을 생성합니다. 종종 이 변형은 처음 제안된 프롬프트보다 더 높은 점수를 얻습니다.
-
• 문장 부정: 모델은 문장을 부정형으로 다시 작성합니다(예: "The sky is blue" → "The sky is not blue"). 이는 문장 구조와 논리적 부정을 조작하는 모델의 능력을 평가합니다 [160].
-
• 요약: 모델은 주어진 단락을 더 짧은 버전으로 요약합니다. 이를 위해 모델은 텍스트의 핵심 요점을 이해하고 효과적으로 압축해야 합니다 [161].
-
• 번역: 모델은 단어나 문장을 다른 언어로 번역합니다(예: 스페인어에서 "Hello" → "Hola"). 이는 모델의 다국어 능력과 언어 간 의미 관계에 대한 이해를 시험합니다 [162].
-
• 수학 연산: 모델은 덧셈이나 뺄셈과 같은 산술 연산을 수행합니다(예:
). 이는 기호 조작과 수치 추론을 수행하는 모델의 능력을 평가합니다 [2].
-
• 원인과 결과 식별: 모델은 어떤 문장이 원인을 설명하고 어떤 문장이 결과를 설명하는지 판단합니다. 이는 인과 관계에 대한 모델의 이해와 사건에 대해 추론하는 능력을 평가합니다 [163].
특정 작업에 관련성이 있거나 최적일 수 있습니다. 이러한 표적화된 접근법은 프롬프트 엔지니어링의 핵심 이점입니다 [158].
-
• 모델 불가지론적: 논문에서 설명한 방법은 다양한 대규모 언어 모델(LLM)에 적합합니다. 서로 다른 LLM에 적용할 수 있습니다 [157]. 이러한 일반성은 APE를 프롬프트 최적화를 위한 다목적 도구로 만듭니다.
-
• 전이 가능성: 하나의 LLM에 대해 APE가 찾은 최선의 지시문은 동일한 작업에서 다른 LLM의 성능을 향상하는 데 흔히 사용할 수 있습니다 [157]. 이는 최적화된 프롬프트가 서로 다른 모델 아키텍처 전반에서 유용한 작업 관련 정보를 포착함을 시사합니다. 핵심 아이디어는 불확실성이 특정 모델이 아니라 작업에서 비롯된다는 것입니다.
8.2.4. 자동 프롬프트 엔지니어(APE)의 한계
이점에도 불구하고 APE에는 몇 가지 한계가 있습니다:
8.2.3. 자동 프롬프트 엔지니어(APE)의 장점
APE는 수많은 장점을 제공합니다:
-
• 성능 향상: APE는 사람이 작성했거나 더 단순한 방법으로 생성된 지시문을 사용하는 경우와 비교해, 추론 작업에서 더 나은 LLM 성능(더 높은 정확도)으로 이어지는 지시문을 흔히 찾습니다 [157]. 이는 APE가 더 넓은 범위의 가능한 지시문을 탐색하고 체계적인 검색 과정을 통해 최선의 지시문을 선택하기 때문입니다.
-
• 인간 노력 감소: APE는 일반적으로 많은 수작업 시행착오가 필요한 좋은 프롬프트를 찾는 과정을 자동화합니다 [5,70]. 이는 LLM을 다루는 연구자와 개발자의 상당한 시간과 노력을 절약하여, 프로젝트의 다른 측면에 집중할 수 있게 합니다.
-
• 작업 적응: APE는 제공된 예시를 바탕으로 당면한 작업에 맞게 특별히 조정된 지시문을 생성합니다 [157]. 이는 그렇지 않을 수 있는 일반적인 지시문을 사용하는 것보다 더 효과적입니다
-
• 높은 계산 비용: 후보 지시문을 점수화하려면 대상 LLM을 여러 번 실행해야 하므로, 특히 더 큰 모델이나 데이터셋에서는 APE의 계산 비용이 높습니다 [157]. 이는 광범위한 탐색이나 샘플링에 의존하는 방법에서 공통적인 과제입니다.
-
• 제안 LLM 의존성: APE의 성공은 제안 LLM이 생성한 초기 지시문 제안의 품질에 의해 제한됩니다 [157]. 성능이 약한 제안 LLM이나 부실하게 설계된 메타 프롬프트(후보 프롬프트를 생성하는 데 사용되는 프롬프트)는 APE가 제공된 후보 중에서만 선택할 수 있으므로 성능을 저해합니다.
-
• 중요한 점수 함수 선택: 선택한 점수 함수(예: 실행 정확도, 대상 출력의 로그 확률)는 원하는 작업 동작과 잘 부합해야 합니다 [157,158]. 부적절한 점수 함수는 작업에 대한 프롬프트의 실제 품질을 정확히 반영하지 못할 수 있으므로 최적이 아닌 지시문 선택으로 이어집니다.
-
• 제한된 지시문 전이 가능성: 하나의 대상 LLM에 맞게 최적화된 지시문은 다른 LLM과 함께 사용할 때 잘 작동하지 않을 수 있으며, 이는 모델별 최적화를 나타냅니다 [157]. 이는 APE가 좋은 프롬프트를 찾을 수는 있지만, 그러한 프롬프트가 서로 다른 모델 아키텍처나 크기 전반에서 보편적으로 효과적이지는 않을 수 있음을 시사합니다.
그림 20.
ART 프레임워크. 고정된 LLM은 시연으로 이루어진 작업 라이브러리를 바탕으로 다단계 추론 프로그램을 생성합니다. 구조화된 질의 언어로 작성된 이 프로그램은 실행되며, 외부 도구(예: 검색, 코드 실행)의 출력을 통합하여 LLM 미세 조정 없이 복잡한 작업을 해결합니다 [164].
-
• 반복으로 인한 미미한 향상: 반복적 개선 과정은 때때로 도움이 되지만, 초기 지시문 제안에 비해 약간의 개선만 제공하는 경우가 많습니다 [157]. 이는 초기 제안 단계가 중요하며 반복적 탐색의 수익이 감소할 수 있음을 시사합니다.
8.3. 자동 추론 및 도구 사용(ART)
자동 추론 및 도구 사용(Automatic Reasoning and Tool-use, ART)은 고정된 대규모 언어 모델(LLM)이 다단계 추론 “프로그램”을 자동으로 생성하여 복잡한 작업을 수행할 수 있게 하는 프레임워크입니다 [164]. ART는 관련 작업의 시연으로 이루어진 작업 라이브러리를 활용하여, 문제를 분해하고 외부 도구(검색이나 코드 실행 등)를 사용하는 방법을 보여 줍니다 [164]. LLM은 단순한 구조화된 질의 언어로 프로그램을 생성하고, 이 프로그램은 도구 출력을 통합하며 실행됩니다 [164]. 이 접근법은 LLM 자체를 미세 조정하지 않고도 새로운 작업에 대한 강력한 일반화를 달성합니다. 결정적으로, ART는 생성된 프로그램을 사람이 쉽게 루프 내에서 편집하고 새 도구/작업을 추가할 수 있게 하여 성능과 유연성을 향상합니다 [164]. 이는 새로운 작업이나 도구에 광범위한 모델 재학습을 요구하는 접근법과 대조됩니다 [5]. (그림 20 참조)
8.3.1. 작동 원리
ART는 일반적으로 다음 단계를 포함합니다:
-
• 프롬프트 구성: 새 작업이 주어지면 ART는 LLM을 안내할 프롬프트를 구성하여 과정을 시작합니다 [164]. ART는 작업 라이브러리에서 유사한 작업의 시연을 검색합니다. 순차적 추론 단계와 도구 호출을 포함한 프로그램 형식의 이러한 시연은 프롬프트에 추가되어,
LLM이 관련 하위 단계와 도구를 활용하여 작업 간 일반화를 활용할 수 있게 합니다 [164]. 이는 개념적으로 퓨샷 학습과 유사하지만, 단순한 입력-출력 예시 대신 구조화된 프로그램을 사용합니다 [5].
-
• 생성 및 파싱: 프롬프트가 구성되면 LLM은 작업을 해결하는 단계를 개괄하면서 프로그램 생성을 시작합니다 [164]. 동시에 ART는 이 프로그램을 실시간으로 파싱하여 LLM이 지정한 의도된 동작과 도구 사용을 이해합니다. 이 파싱 단계는 LLM과 외부 도구 간 상호작용을 가능하게 하는 데 중요합니다.
-
• 도구 사용 및 통합: ART 기능의 핵심 측면은 외부 도구를 활용하는 능력입니다 [164]. 프로그램 생성 중 ART가 도구 호출(예: 검색 엔진 또는 코드 인터프리터 호출)을 만나면 LLM의 생성을 일시 중지합니다. 그런 다음 ART는 지정된 도구를 실행하고 출력을 얻어, 이를 다시 프로그램에 통합합니다 [164]. 이는 LLM이 추론 과정을 계속하고 후속 단계를 안내할 새 정보(도구의 출력)를 제공합니다. 도구와의 이러한 동적 상호작용은 ART의 구별되는 특징입니다.
-
• 인간 피드백(선택 사항): ART는 성능을 더욱 향상하기 위해 선택적인 인간 참여 구성 요소를 통합합니다 [164]. 인간은 작업 라이브러리에 새 시연을 추가하고, 시스템이 처리할 수 있는 시나리오 범위를 확장하며, 식별된 오류를 수정함으로써 ART의 역량을 개선할 수 있습니다. 또한 인간은 도구 라이브러리에 도구를 추가하거나 편집하여 ART가 더 폭넓은 기능에 접근하고 새로운 작업 요구 사항에 적응할 수 있게 할 수 있습니다. 이러한 인간 참여 측면은 시스템의 지속적인 개선과 적응을 가능하게 합니다.
8.3.2. 자동 추론 및 도구 사용(ART)의 예시
ART는 다음과 같이 추론과 도구 사용을 모두 요구하는 다양한 작업에 적용될 수 있다:
-
• 물리학 질의응답(PQA): 물리 문제를 해결하기 위해 ART는 먼저 주어진 질문과 관련된 공식을 검색한다 [164]. 여기에는 지식 베이스를 조회하거나 검색 엔진을 사용하는 일이 포함될 수 있다 [165]. 올바른 공식을 찾으면 주어진 수치를 방정식에 대입하는 Python 스크립트를 생성한다. 이어서 생성된 스크립트를 실행하여 최종 답을 계산한다. 필요할 경우 결과를 반환하기 전에 단위 변환이나 반올림과 같은 추가 단계를 수행한다. 이는 ART가 공식 검색이라는 정보 검색을 코드 생성 및 실행과 결합하는 능력을 보여 주며, LLM과 기호 추론을 결합하는 시스템과 유사하다 [166].
-
• 시대착오 탐지: 어떤 진술에서 시대착오를 분석할 때 ART는 역사적 인물이나 사건의 연표와 같은 역사적 사실을 먼저 검색한다 [164]. 구조화된 지식 그래프나 역사 데이터베이스에서 관련 정보를 검색할 수 있으며 [167], 언급된 개체들이 공존할 수 있었는지 판단하기 위해 날짜를 비교한다. 이 비교를 바탕으로 모델은 해당 진술에 시대착오가 포함되어 있는지 여부를 밝히는 응답을 생성한다. 이는 많은 지식 집약적 NLP 작업의 핵심 측면인 추론을 위해 외부 지식(역사적 사실)을 활용하는 ART의 능력을 보여 준다 [168].
-
• 산술 문장제: 수학 문장제를 해결하기 위해 ART는 먼저 핵심 수치를 추출하고 필요한 연산을 식별한다 [164]. 그런 다음 필요한 계산을 수행하는 Python 프로그램을 생성한다. 산술 추론의 정밀성을 보장하기 위해 코드를 실행하여 최종 답을 계산한다. 이후 모델은 최종 수치 결과를 답으로 형식화하여 제시한다. 이는 자연어 설명을 실행 가능한 코드로 변환하는 ART의 능력, 즉 프로그램 합성의 한 형태를 잘 보여 준다 [169]. 이는 수학적 추론에 LLM을 사용하는 더 넓은 분야와도 관련된다 [2].
-
• 단어 재배열: 단어 재배열 작업에서 ART는 먼저 주어진 뒤섞인 단어를 글자로 분리한다 [164]. 그런 다음 가능한 모든 글자 순열을 생성하고, 조회 함수(외부 도구 역할을 함)를 사용해 영어 사전과 대조한다. 모델은 목록에서 가장 가능성이 높은 유효 단어를 식별하여 올바른 답으로 반환한다. 이는 ART가 절차적 지식과 선언적 지식을 모두 활용하면서 알고리즘 처리(순열 생성)와 외부 지식(사전 조회)을 결합할 수 있음을 보여 준다.
-
• 피그 라틴으로 번역: 문장을 피그 라틴으로 번역하기 위해 ART는 먼저 피그 라틴 변환을 지배하는 언어 규칙을 검색한다 [164,170]. 이는 예시로부터 규칙을 학습하거나 귀납하는 한 형태를 보여 준다. 그런 다음 문장의 각 단어에 이 규칙을 적용하는 Python 프로그램을 생성한다. 생성된 코드를 실행하여 그에 따라 단어를 변환하고, 최종 번역 문장을 반환한다. 이는 코드 생성을 통해 절차적 규칙을 학습하고 적용하는 ART의 역량을 보여 주며, 기호 조작의 한 형태를 드러낸다.
8.3.3. 자동 추론 및 도구 사용(ART)의 장점
ART는 여러 가지 장점을 제공한다:
-
• 자동화: ART는 추가 학습이나 사람의 개입 없이 복잡한 작업을 구조화된 추론 단계로 자동 분해하여 [164], 문제 해결을 더 체계적이고 효율적으로 만든다. 이는 새로운 작업마다 수동 프롬프트 엔지니어링이나 광범위한 미세 조정에 의존하는 접근법과 대조된다 [5].
-
• 도구 사용: ART는 검색 엔진, 코드 실행, 계산기와 같은 외부 도구를 원활하게 통합하여 대규모 언어 모델이 고급 계산을 수행하고 실시간 정보를 검색할 수 있게 한다 [164]. 이는 LLM의 내재된 지식과 추론 능력을 넘어 그 역량을 확장한다 [166].
일반화: 추론 예시가 포함된 작업 라이브러리를 사용함으로써 ART는 작업별 프롬프트 엔지니어링이나 추가 미세 조정 없이 새롭고 미지의 작업으로 일반화할 수 있다 [164]. 이러한 작업 간 일반화 능력은 특정 작업이나 도메인에 맞추어진 방법보다 중요한 장점이다.
-
• 적응성: 사용자는 작업 프로그램을 수정하고 오류를 바로잡거나 새 도구를 추가할 수 있으므로, ART는 최소한의 노력으로 다양한 도메인에 지속적으로 개선 및 적응할 수 있다 [164]. 이러한 인간 개입형 측면은 반복적 개선과 맞춤화를 촉진한다.
-
• 성능: ART는 BigBench 및 MMLU와 같은 벤치마크에서 표준 퓨샷 학습과 자동 사고 사슬(CoT) 프롬프팅을 크게 능가하여 추론 작업의 정확도를 높인다 [164]. 이는 LLM 성능 향상에 있어 ART 접근법의 효과를 보여 준다.
-
• 효율성: 작업 분해를 자동화하고 도구 사용을 최적화함으로써 ART는 리소스 소비를 최소화하면서 계산 오버헤드를 줄이고 문제 해결 속도를 높인다 [164]. 이는 여러 LLM 호출이나 광범위한 검색 절차를 요구할 수 있는 다른 방법과 대조된다.
8.3.4. 자동 추론 및 도구 사용(ART)의 한계
장점에도 불구하고 ART에는 몇 가지 한계가 있다:
-
• 도구 의존성: ART는 검색 엔진과 코드 실행 같은 외부 도구에 의존하며, 이러한 도구는 항상 사용 가능하거나 올바르게 작동하는 것은 아닐 수 있다 [164]. 도구가 실패하거나 부정확한 데이터를 제공하면 ART의 성능은 부정적인 영향을 받는다. 외부 리소스에 대한 이러한 의존성은 외부 도구와 LLM을 통합하는 시스템에서 흔한 우려인 잠재적 실패 지점을 도입한다 [166].
-
• 작업 라이브러리 제약: ART는 미리 정의된 작업 라이브러리에서 추론 시연을 선택하므로, 완전히 새로운 작업으로 일반화하는 능력은 이 라이브러리의 다양성과 완전성에 좌우된다 [164]. 작업에 라이브러리가 다루지 않는 추론 기술이나 지식이 필요하면 ART는 어려움을 겪을 수 있다. 이는 제로샷 일반화 역량을 제한하며, 다른 퓨샷 및 메타 학습 접근법도 마주하는 과제다 [171].
-
• 오류 전파: 초기 추론 단계에서 오류(예: 잘못된 도구 호출이나 작업의 오해)가 발생하면 후속 단계를 따라 연쇄적으로 전파되어 잘못된 최종 답으로 이어질 수 있다 [164]. 이는 여러 의존적인 추론 단계를 요구하는 복잡한 작업에서 특히 문제가 된다. 오류 전파는 다단계 추론 시스템과 순차적 의사결정에서 흔한 과제다 [172].
-
• 계산 오버헤드: 작업 시연을 검색하고 중간 단계를 생성하며 외부 도구를 실행하는 과정은 더 직접적인 프롬프팅 기법에 비해 계산 비용이 클 수 있다 [164]. 이로 인해 특히 대규모 작업 라이브러리나 복잡한 도구 상호작용을 다룰 때 ART가 특정 시나리오에서는 더 느려질 수 있다. 성능과 계산 비용 간의 이러한 절충은 LLM 연구에서 반복적으로 나타나는 주제다 [5].
-
• 개선을 위한 수동 개입: ART는 오류를 수정하거나 새 도구를 추가하기 위해 사람의 피드백을 지원하지만, 이는 수동 노력이 필요하다 [164]. 지속적인 성능 향상은 사용자가 작업 및 도구 라이브러리를 적극적으로 개선하는 데 달려 있다. 사람의 개입에 대한 이러한 의존성은 완전 자동화된 추론이라는 목표와 대조적으로 시스템의 확장성과 자율성을 제한할 수 있다.
-
• 개방형 작업의 어려움: ART는 구조화된 추론 문제에서는 잘 수행하지만, 명확한 다단계 분해 패턴이 없거나 주관적 판단이 필요한 개방형, 추상적 또는 창의적 작업에서는 어려움을 겪을 수 있다 [164]. 이는 ART가 추론 과정을 구조화된 프로그램과 유사한 표현에 의존하기 때문이며, 이것이 모든 유형의 작업에 적합하지 않을 수 있다. 이 한계는 창의성이나 상식 추론이 필요한 작업에 LLM을 적용하는 데 계속되는 과제를 부각한다 [50].
8.4. 대조적 사고 사슬 프롬프팅(CCoT)
대조적 사고 사슬(CCoT) 프롬프팅은 유효한 추론 예시와 유효하지 않은 추론 예시를 모두 제공하여 LLM 추론을 향상한다 [173]. 긍정적 및 부정적 예시로부터 학습하는 인간의 방식에서 영감을 받은 CCoT는 실수를 줄이면서 모델이 단계별로 추론하도록 이끈다 [173]. 표준 CoT [2]와 달리, 피해야 할 오류를 모델에 알려 준다. CCoT는 일반화를 개선하기 위해 자동으로 구성된 대조적 시연을 활용한다 [173]. 유효하지 않은 추론 유형을 분석하여 CCoT는 긍정적 시연과 부정적 시연을 결합해 CoT의 효과를 높인다. 추론 벤치마크 실험은 기존 CoT와 비교해 유의미한 향상을 보인다 [173]. 이 접근법은 작업 불가지론적이며 자기 일관성과 같은 방법 [97]과 호환되어, 사고 사슬 프롬프팅을 전반적으로 향상한다.
8.4.1. 작동 원리
CCoT 프롬프팅은 일반적으로 다음 단계를 포함한다:
-
• 인간 학습에서의 영감: CCoT는 사람들이 학습하는 방식에서 영감을 받았으며, 이 방식에는 무엇을 해야 하는지(긍정적 예시)와 무엇을 *하지 말아야* 하는지(부정적 예시)를 모두 이해하는 일이 포함된다 [173]. 이 접근법은 긍정적 강화와 오류 교정을 통해 이해를 다듬는 인간의 방식을 반영한다.
-
• 대조적 시연: 올바른 추론 예시만 제공하는 대신(표준 CoT [2]와 같이), CCoT는 프롬프트 내에 *유효한*(올바른) 추론 시연과 *유효하지 않은*(잘못된) 추론 시연을 모두 제공한다 [173]. 논문의 그림 1은 이를 보여 주며, “설명”(올바른 것)과 “잘못된 설명”(잘못된 것)이 모두 있는 질문을 제시한다. 이러한 명시적 대조가 이 방법의 핵심이다.
-
• 모델 안내: 대조적 시연은 LLM이 단계별로 추론하도록 안내하는 동시에 피해야 할 잠재적 실수를 강조한다 [173]. 이는 모델이 올바른 추론 경로뿐 아니라 잘못된 결론으로 이어질 수 있는 함정도 학습하도록 돕는다. 이는 로드맵과 흔한 우회로에 대한 경고를 함께 제공하는 것과 같다.
-
• 대조적 시연의 자동 구성: 일반화를 개선하고 부정적 예시를 만드는 수작업을 줄이기 위해, 논문은 기존의 유효한 추론 사슬로부터 이러한 대조적 시연을 구성하는 자동 방법을 도입한다 [173]. 이로써 접근법의 확장성과 실용성이 높아진다.
-
• 유효하지 않은 추론 유형 활용: 저자들은 효과적인 대조적 시연 생성 방법을 설계하기 위해 다양한 유형의 유효하지 않은 추론을 분석한다 [173]. 흔한 오류를 이해함으로써 모델에 도움이 될 가능성이 더 높은 표적화된 부정적 예시를 만들 수 있다.
-
• 일반적 향상: CCoT는 작업 불가지론적이며 자기 일관성 같은 사고 사슬 프롬프팅 향상 방법과 호환되도록 설계되었다 [97,173]. 따라서 서로 다른 작업 전반과 다른 기법과의 조합에서 LLM 추론을 개선하는 다목적 도구가 된다.
8.4.2. 대조적 사고 사슬 프롬프팅(CCoT)의 예시
CCoT 프롬프팅은 다음과 같이 대조적 추론과 논리적 연역의 이점을 얻는 다양한 작업에 적용될 수 있다:
-
• 수학 계산: “James는 서로 다른 친구 2명에게 주 2회 각각 3쪽짜리 편지를 쓴다. 그는 1년에 몇 쪽을 쓰는가?”
“유효한 CoT 답변: James는 한 번에
쪽을 쓴다. 그는 주 2회 편지를 쓰므로, 이는
쪽/주이다. 1년에는 52주가 있으므로, 그는
쪽을 1년에 쓴다.”
유효하지 않은 CoT 답변(잘못된 설명): James가
쪽을 매주 쓴다고 잘못 진술한다. 이어 그가 1년에 겨우 12쪽만 쓴다고 결론 내리며 스스로 모순된다.” 이 예시는
잘못된 추론의 예시를 보여 줌으로써 CCoT가 모델이 다단계 계산에서 오류를 피하도록 어떻게 도울 수 있는지를 보여 준다. 이는 LLM이 다단계 산술을 수행할 때의 알려진 한계를 다룬다 [2,173]. (올바른 추론과 잘못된 추론이 모두 어떻게 제시되는지에 대한 예시는 그림 21, 대조적 사고 사슬을 참조하라.)
-
• 사실 추론: “Dambar Shah의 손자는 누구인가?”
유효한 CoT 답변: “Dambar Shah는 Krishna Shah의 아버지였다. Krishna Shah는 Rudra Shah의 아버지였으므로, Rudra Shah는 그의 손자이다.”
유효하지 않은 CoT 답변(잘못된 추론): “Dambar Shah는 질문과 무관한 Gorkha 왕국의 왕이었다. Krishna Shah가 아니라 Dravya Shah가 Rudra Shah의 아버지였다고 잘못 진술한다.”
유효하지 않은 CoT 답변(일관성 없는 언어): “Krishna Shah는 Rudra Shah의 아버지였다. 이어서 Dambar Shah가 Krishna Shah의 자녀였다고 잘못 진술한다.” 이 예시는 CCoT가 잘못되고 일관성 없는 추론의 예시를 모두 제공하여 모델이 추론에서 사실 오류와 불일치를 피하도록 어떻게 도울 수 있는지를 보여 준다. 이는 LLM이 사실적으로 올바르고 논리적으로 타당한 출력을 생성하도록 보장하는 과제와 관련된다 [20,173]. (이 원리의 일반적 예시는 그림 21, 대조적 사고 사슬을 참조하라.)
-
• 산술 추론: “Leah는 초콜릿 32개를 가지고 있었고, 그녀의 여동생은 42개를 가지고 있었다. 그들이 35개를 먹었다면, 총 몇 개가 남았는가?”
유효한 CoT 답변: “Leah는 초콜릿 32개, 그녀의 여동생은 42개를 가지고 있었으므로 총
개였다. 35개를 먹은 뒤 남은 초콜릿은
개였다.”
유효하지 않은 CoT 답변(잘못된 추론): “Leah의 여동생은 Leah보다 초콜릿을 42 - 32 = 10개 더 가지고 있었다. 35개를 먹은 뒤
를 잘못 더하고 6을 빼서 39를 얻는다.”
유효하지 않은 CoT 답변(일관성 없는 객체): “Leah는 32 + 42 = 74개의 초콜릿을 가지고 있었지만, 잘못해서 32개만 배정받았다. 35개를 뺀 뒤에도 초콜릿 42개가 남아 있다고 잘못 주장한다.” 이 예시는 객체 일관성 및 잘못된 연산과 관련된 오류를 포함하는 대조적 예시를 제공하면 LLM이 그러한 오류를 피하게 할 수 있음을 보여 준다. 이는 LLM이 객체와 수량에 관한 추론에서 일관성을 유지하도록 보장하는 더 넓은 문제와 관련된다 [173,174]. (대조적 추론 사용의 시각적 예시는 그림 21, 대조적 사고 사슬을 참조하라.)
8.4.3. 대조적 사고 사슬 프롬프팅(CCoT)의 장점
CCoT 프롬프팅은 여러 가지 장점을 제공한다:
-
• 향상된 추론 정확도: CCoT는 유효한 추론 시연과 유효하지 않은 추론 시연을 모두 제공하여, 모델이 올바른 추론을 학습할 뿐 아니라 흔한 실수를 인식하고 피하도록 돕는다 [173]. 이는 LLM의 흔한 과제인 다단계 추론 작업에서 오류 전파를 줄인다 [172].
-
• 작업 전반의 향상된 일반화: 올바른 추론 예시만 제공하는 표준 CoT [2]와 달리, CCoT는 모델을 잘못된 것을 포함한 다양한 추론 패턴에 노출한다 [173]. 이는 산술 및 사실 QA 작업과 같은 서로 다른 추론 벤치마크 전반에서 더 나은 일반화로 이어진다. 서로 다른 추론 스타일에 대한 이러한 더 폭넓은 노출은 견고성을 향상할 수 있다.
-
• 자동화: 잘못된 추론 예시가 자동으로 생성되어 수동 주석의 필요성을 줄인다 [173]. 이로 인해 사람의 손으로 만든 예시에 의존하는 방법보다 접근법의 확장성과 효율성이 높아진다.
-
• 벤치마크에서의 높은 성능: CCoT는 추론 작업에서 기존 CoT를 크게 능가한다 [173]. 예를 들어 GPT-3.5-Turbo에서 평가했을 때 GSM-8K(산술 추론)에서는 정확도를 9.8포인트, Bamboogle(사실 추론)에서는 16.0포인트 향상한다. 이 결과는 접근법의 실질적 효과를 보여 준다.
-
• 자기 일관성 방법과의 호환성: CCoT는 자기 일관성 디코딩과 잘 작동하며 [97,173], 여러 추론 경로를 집계하여 성능을 더욱 향상한다. 이는
그림 21.
표준 프롬프팅, 사고 사슬(CoT) 프롬프팅 및 대조적 사고 사슬(CCoT) 프롬프팅의 비교. 특히 CCoT는 모델 성능을 향상하기 위해 유효한 추론 예시와 유효하지 않은 추론 예시를 모두 사용하는 것을 보여 준다 [173].
이 접근법을, 특히 논리적 정밀성이 요구되는 작업에서 더 신뢰할 수 있게 만든다. 대조적 예시와 자기 일관성의 결합은 명시적인 오류 지침과 앙상블 방법을 모두 활용한다.
-
• 작업 불가지론적이며 쉽게 적응 가능: CCoT는 특정 추론 유형에 제한되지 않으므로 산술 문제, 사실 질의응답, 더 복잡한 문제 해결 작업을 포함한 다양한 도메인에 적용될 수 있다 [173]. 이러한 다용도성은 광범위한 응용 분야에서 LLM 성능을 개선하는 가치 있는 도구가 되게 한다.
8.4.4. 대조적 사고 사슬 프롬프팅(CCoT)의 한계
장점에도 불구하고 CCoT 프롬프팅에는 몇 가지 한계가 있다:
-
• 시연의 품질: CCoT의 성공은 제공되는 긍정적 시연과 부정적 시연 모두의 품질과 관련성에 달려 있다 [173]. 잘 설계되지 않았거나 관련 없는 시연은 모델의 학습을 방해하고 성능을 저하시킬 수 있다. 이는 프롬프트 기반 학습에서 일반적인 과제다 [158].
-
• 계산 비용: CCoT는 표준 CoT와 비교하여 주석 비용을 높이지는 않지만, 더 복잡한 프롬프트와 추론 중 더 많은 생성 토큰이 필요할 가능성 때문에 계산 비용을 약간 높일 수 있다 [173]. 이는 프롬프트에 유효한 추론 사슬과 유효하지 않은 추론 사슬이 모두 포함되기 때문이다. 성능과 계산 비용 간의 이러한 절충은 일반적인 고려 사항이다 [5].
-
• 부정적 예시의 복잡성: 유익하면서도 혼란스럽지 않은, 진정으로 효과적인 부정적 예시를 생성하는 것은 어려울 수 있다 [173]. 부정적 예시는 도움이 될 만큼 올바른 추론 경로와 충분히 가까워야 하지만, 잘못된 것으로 명확히 식별될 수 있을 만큼 충분히 구별되어야 한다.
-
• LLM 역량 의존성: CCoT는 대조 정보를 이해하고 활용하는 LLM의 능력에 의존하며, 이는 LLM의 내재적 역량 또는 학습 데이터에 의해 제한될 수 있다 [173]. 성능이 약한 LLM은 유효한 추론 사슬과 유효하지 않은 추론 사슬을 효과적으로 구분하지 못할 수 있다.
-
• CoT 이해의 한계: CoT 자체의 기저 프로세스에 대한 포괄적인 이해는 여전히 부족하다 [2]. 따라서 CCoT 프롬프트를 효과적으로 설계하고 최적화하기 어렵다. CoT가 *왜* 작동하는지에 관한 추가 연구가 그 잠재력을 완전히 활용하는 데 필요하며, 이는 CCoT에도 적용된다.
-
• 유효하지 않은 추론 유형의 예측 불가능성: 서로 다른 유형의 유효하지 않은 추론(예: 일관성 없는 객체, 관련 없는 언어)이 모델 성능에 미치는 영향은 예측하기 어려울 수 있다 [173]. 서로 다른 오류 유형이 학습에 어떤 영향을 미치는지, 그리고 부정적 예제를 어떻게 가장 잘 맞춤화할지 이해하기 위한 추가 연구가 필요하다.
9. 감정 인식 및 심리학적 기법(인간과 유사한 추론과 감성 지능을 통합하는 방법)
9.1. 감정 프롬프팅
감정 촉진은 감정적 자극을 통합하여 인지 기능, 의사결정 및 문제 해결 능력을 향상하는 것을 의미한다. 이 개념은 감정이 주의, 학습 및 행동 조절을 이끄는 데 중요한 역할을 한다고 제시하는 심리학 이론에 뿌리를 두고 있다. 연구에 따르면 감정을 인식하고 이해하며 관리하는 능력을 포함하는 감성 지능은 교육과 건강 등 다양한 영역에서 인간의 행동과 성공에 상당한 영향을 미친다.
인공지능, 특히 대규모 언어 모델(LLM)의 맥락에서 감정 촉진은 모델 성능을 개선하기 위해 프롬프트에 감정 단서를 삽입하는 것을 포함한다. EmotionPrompt로 알려진 이 방법은 감정이 담긴 문구를 통합하여 AI가 생성한 응답의 효과를 향상한다. 연구는 EmotionPrompt가 AI 작업에서 상당한 개선을 가져와 출력물을 더 정확하고, 진실하며, 책임감 있게 만들 수 있음을 보여주었다. 자기 모니터링, 사회 인지 이론 및 인지적 감정 조절과 같은 심리학 원리에서 차용함으로써, 감정 촉진은 인간과 AI의 상호작용을 모두 형성하여 더 통찰력 있고 의미 있는 관여로 이어질 수 있다.
9.1.1. 작동 원리
감정 프롬프팅은 일반적으로 다음 단계를 포함한다:
-
• 감정 선택: 특정 응용 또는 목표에 따라 원하는 감정이나 정서를 선택한다 [175]. 이는 기쁨, 슬픔, 분노 또는 공포 같은 기본 감정일 수도 있고, 향수, 희망 또는 아이러니 같은 더 복잡한 감정일 수도 있다 [176].
-
• 프롬프트 설계: LLM이 원하는 감정을 불러일으키는 텍스트를 생성하도록 안내하는 감정 단서나 지침을 포함하도록 프롬프트를 설계한다 [175]. 감정이 담긴 단어, 문구 또는 묘사를 사용하거나, 특정 감정적 어조나 관점을 채택하도록 LLM에 명시적으로 지시할 수 있다 [177].
-
• LLM 처리: LLM은 감정 단서를 포함한 프롬프트를 처리하고, 언어와 감정에 대한 이해를 활용하여 원하는 감정 표현에 부합하는 텍스트를 생성한다 [178].
-
• 응답 평가: 생성된 응답은 독자에게 원하는 감정을 불러일으키는 정서적 영향과 효과를 기준으로 평가된다 [176]. 이 평가는 인간 피드백 또는 자동화된 감성 분석 도구를 통해 수행할 수 있다 [175].
9.1.2. 감정 프롬프팅의 예시
감정 프롬프팅은 다음과 같이 감정 표현과 몰입을 요구하는 다양한 작업에 적용할 수 있다:
-
• 스토리텔링: "사랑하는 개를 잃은 어린 소년에 관한 짧은 이야기를 작성하라." 프롬프트에는 다음 감정 단서가 포함된다: "슬픔, 비탄, 그리움의 감정에 초점을 맞춰라. 소년이 개와 함께한 기억과 상실을 극복하려는 그의 고군분투를 묘사하라."
-
• 시 생성: "자연의 아름다움에 관한 시를 작성하라." 프롬프트에는 다음 감정 단서가 포함된다: "경외감, 경이로움, 감사의 감정을 불러일으켜라. 생생한 심상과 은유를 사용해 자연의 장엄함의 본질을 포착하라."
-
• 대화 생성: "어려운 개인적 문제를 논의하는 두 친구 사이의 대화를 생성하라." 프롬프트에는 다음 감정 단서가 포함된다: "한 친구는 불안과 스트레스의 감정을 표현하고, 다른 친구는 지지와 격려를 제공한다."
9.1.3. 감정 프롬프팅의 장점
감정 프롬프팅은 여러 장점을 제공한다:
-
• 표현력 향상: LLM이 더 표현력이 풍부하고 정서적으로 몰입감 있는 콘텐츠를 생성할 수 있게 한다 [175].
-
• 창의성 향상: LLM이 서로 다른 감정적 어조와 관점을 탐색하도록 장려하여 더 창의적이고 다양한 출력으로 이어진다 [177].
-
• 몰입도 증가: 독자에게 감정을 불러일으켜 LLM 생성 콘텐츠를 더 몰입감 있고 공감할 수 있게 만든다 [178].
-
• 적응성: 적절한 감정을 선택하고 효과적인 프롬프트를 설계함으로써 다양한 작업과 도메인에 맞게 조정할 수 있다 [176].
9.1.4. 감정 프롬프팅의 한계
장점에도 불구하고 감정 프롬프팅에는 몇 가지 한계가 있다:
-
• 주관성: LLM 생성 콘텐츠의 정서적 영향을 평가하는 것은 주관적이고 어려울 수 있다 [175].
-
• 윤리적 고려 사항: 사용자에게 강한 감정을 유발하는 것은 잠재적인 조작이나 해악에 관한 윤리적 우려를 제기한다 [175].
-
• 제한된 이해: LLM은 인간 감정의 뉘앙스와 복잡성을 완전히 이해하지 못할 수 있으며, 이는 부정확하거나 부적절한 감정 표현으로 이어질 수 있다 [177].
9.2. 스크래치패드 프롬프팅
스크래치패드 프롬프팅은 대규모 언어 모델(LLM)이
추론 과정에서 중간 결과, 메모 또는 정보를 저장하고 조작하기 위해 외부 "스크래치패드" 또는 메모리를 사용할 수 있도록 하여 문제 해결 능력을 향상하는 기법이다 [124]. 이 접근법은 인간이 복잡한 문제를 해결할 때 흔히 스크래치패드나 외부 메모리 보조 도구를 사용하여 인지적 부담을 덜고 중간 단계의 기록을 유지하는 방식에서 영감을 얻었다 [132]. LLM에 스크래치패드를 제공함으로써 이 기법은 복잡한 작업을 더 작고 관리하기 쉬운 단계로 나누고, 중간 계산이나 결과를 추적하며, 이전 정보를 다시 참조할 수 있게 하여 다단계 추론, 계획 및 의사결정을 요구하는 작업에서 성능을 향상한다 [76].
9.2.1. 작동 원리
스크래치패드 프롬프팅은 일반적으로 다음 단계를 포함한다:
-
• 스크래치패드 초기화: 작업과 저장할 정보의 유형에 따라 단순한 목록, 사전 또는 더 복잡한 데이터 구조일 수 있는 스크래치패드나 외부 메모리를 초기화한다 [124].
-
• 프롬프트 통합: 프롬프트는 LLM이 추론 과정에서 정보를 저장하고 조작하기 위해 스크래치패드를 사용하도록 지시한다 [132]. 여기에는 "중간 계산을 스크래치패드에 기록하라" 또는 "스크래치패드를 사용해 학습한 사실을 추적하라"와 같이 스크래치패드와 상호작용하는 방법에 관한 명시적 지침이 포함될 수 있다 [76].
-
• LLM 처리: LLM은 프롬프트를 처리하고 필요에 따라 스크래치패드를 사용해 정보를 저장하고 검색하며, 중간 결과를 바탕으로 계산을 수행하고, 메모를 작성하거나, 지식을 갱신한다 [124].
-
• 응답 생성: LLM은 프롬프트와 스크래치패드에 저장된 정보를 바탕으로 응답을 생성하여, 문제를 해결하거나 질문에 답하기 위해 외부 메모리를 활용하는 능력을 보여준다 [132].
9.2.2. 스크래치패드 프롬프팅의 예시
스크래치패드 프롬프팅은 다음과 같이 외부 메모리와 다단계 추론의 이점을 얻는 다양한 작업에 적용할 수 있다:
-
• 수학 문제 해결: "반지름이 5cm이고 높이가 10cm인 원뿔의 부피를 계산하라." LLM은 스크래치패드를 사용하여 원뿔 부피 공식, 중간 계산 및 최종 결과를 저장한다.
-
• 논리적 추론: "모든 인간은 죽고, 소크라테스는 인간이라면, 소크라테스는 죽는가?" LLM은 스크래치패드를 사용하여 전제와 논리 규칙을 저장하고 결론을 단계별로 도출한다.
-
• 계획 및 의사결정: "이용 가능한 교통수단, 예산 및 선호하는 이동 시간을 고려하여 도시 A에서 도시 C까지의 여행을 계획하라." LLM은 스크래치패드를 사용하여 서로 다른 경로, 비용 및 일정에 관한 정보를 저장하고, 결정을 내리기 전에 선택지를 비교하고 평가한다.
9.2.3. 스크래치패드 프롬프팅의 장점
스크래치패드 프롬프팅은 여러 장점을 제공한다:
-
• 추론 개선: 외부 메모리와 스캐폴딩을 제공하여 LLM의 복잡한 추론 및 문제 해결 수행 능력을 향상한다 [124].
-
• 오류 감소: LLM이 정보를 스크래치패드로 오프로드할 수 있게 하여 메모리 한계나 인지 과부하로 인한 오류를 최소화한다 [132].
-
• 해석 가능성 향상: 중간 단계와 스크래치패드 사용을 드러내 LLM의 추론 과정을 더 투명하고 이해하기 쉽게 만든다 [76].
-
• 적응성: 스크래치패드의 구조와 내용, 그리고 프롬프트의 지침을 조정하여 다양한 작업과 도메인에 맞게 조정할 수 있다 [124].
9.2.4. 스크래치패드 프롬프팅의 한계
장점에도 불구하고 스크래치패드 프롬프팅에는 몇 가지 한계가 있다:
-
• 스크래치패드 관리: 혼잡을 피하고 관련 정보에 효율적으로 접근하려면 스크래치패드를 효과적으로 관리해야 한다 [132].
-
• 프롬프트 엔지니어링: 스크래치패드와의 LLM 상호작용을 안내하는 프롬프트를 설계하는 일은 어려울 수 있다 [76].
-
• 계산 비용: 외부 스크래치패드를 유지하고 접근하면 LLM의 계산 비용과 응답 시간이 증가할 수 있다 [124].
9.3. 생각의 프로그램(PoT) 프롬프팅
생각의 프로그램(PoT) 프롬프팅은 추론 과정을 프로그램으로 표현하여 대규모 언어 모델(LLM)의 추론 역량을 개선하는 것을 목표로 하는 새로운 프롬프팅 기법이다 [179]. 이 접근법은 복잡한 작업을 더 작고 관리하기 쉬운 모듈이나 함수로 나누는 컴퓨터 프로그래밍 분야에서 영감을 얻었다 [179]. 추론을 프로그램으로 표현함으로써 PoT 프롬프팅은 LLM이 일련의 지침을 실행하고, 중간 변수를 조작하며, 추론 과정에서 정보 흐름을 제어할 수 있게 하여 더 체계적이고 정확한 문제 해결로 이어진다 [179].
9.3.1. 작동 원리
PoT 프롬프팅은 일반적으로 다음 단계를 포함한다:
-
• 프로그램 생성: LLM은 주어진 작업이나 질문에 대한 추론 과정을 나타내는 프로그램을 생성하도록 프롬프트된다 [179]. 이 프로그램은 작업의 복잡성과 LLM의 역량에 따라 자연어 형식이나 더 형식적인 프로그래밍 언어로 표현될 수 있다 [28].
-
• 프로그램 실행: LLM은 생성된 프로그램을 실행하고, 지침을 따르며 프로그램에 정의된 대로 중간 변수나 데이터 구조를 조작한다 [179].
-
• 답변 추출: 최종 답변이나 해법은 프로그램 실행의 출력에서 추출된다 [179].
9.3.2. 생각의 프로그램(PoT) 프롬프팅의 예시
PoT 프롬프팅은 다음과 같이 구조화된 추론과 프로그램과 유사한 실행의 이점을 얻는 다양한 작업에 적용할 수 있다:
-
• 수학 문제 해결: "밑변이 10cm이고 높이가 5cm인 삼각형의 넓이를 계산하라." LLM은 다음 프로그램을 생성한다:
function calculate_triangle_area
(base, height):
area = (1/2) * base * height
return area
그런 다음 주어진 값으로 프로그램을 실행하고 답을 추출한다.
-
• 논리적 추론: "모든 새가 날 수 있고 펭귄이 새라면, 펭귄은 날 수 있는가?" LLM은 다음 프로그램을 생성한다:
function can_penguin_fly():
if all birds can fly and penguin is a bird:
return True
else:
return False
그런 다음 프로그램을 실행하고 논리 규칙에 따라 답을 추출합니다.
-
• 계획 및 의사결정: "이용 가능한 교통수단, 예산, 선호하는 이동 시간을 고려하여 도시 A에서 도시 C까지의 여행을 계획하세요." LLM은 다음을 정의하는 프로그램을 생성합니다.
다양한 선택지, 제약 조건 및 의사결정 기준을 정의하고, 이를 실행하여 최적의 계획을 찾습니다.
9.3.3. 프로그램 사고(PoT) 프롬프팅의 장점
PoT 프롬프팅은 다음과 같은 여러 장점을 제공합니다:
-
• 구조화된 추론: 추론 과정을 프로그램으로 표현하여 구조적이고 체계적인 추론을 장려합니다 [179].
-
• 정확도 향상: 지시사항의 정밀한 실행과 중간 변수 조작을 가능하게 하여 LLM이 생성한 응답의 정확도를 높입니다 [28].
-
• 해석 가능성 향상: LLM이 생성하고 실행한 프로그램을 보여줌으로써 LLM의 추론 과정을 더 투명하고 이해하기 쉽게 만듭니다 [179].
-
• 다목적성: 적절한 프로그램을 설계하고 도메인별 지식을 통합하여 다양한 작업과 도메인에 맞게 조정할 수 있습니다 [179].
9.3.4. 프로그램 사고(PoT) 프롬프팅의 한계
장점에도 불구하고, PoT 프롬프팅에는 몇 가지 한계가 있습니다:
-
• 프로그램 생성: 추론 과정을 정확하게 나타내는 효과적인 프로그램을 생성하는 일은 어려울 수 있으며, 프로그래밍 기술과 도메인 전문성이 필요합니다 [179].
-
• 계산 비용: 복잡한 프로그램을 실행하는 데는 계산 비용이 많이 들 수 있어 응답 시간과 자원 사용량이 증가할 수 있습니다 [179].
-
• 디버깅 및 오류 처리: 생성된 프로그램에서 오류를 디버깅하고 처리하는 일은 복잡할 수 있으며, 검증과 타당성 확인을 위한 추가 메커니즘이 필요합니다 [28].
9.4. 구조화된 사고 연쇄(Scot) 프롬프팅
구조화된 사고 연쇄(SCoT) 프롬프팅은 중간 추론 단계에 구조화된 형식을 통합하여 대규모 언어 모델(LLM)의 추론 능력을 향상하는 것을 목표로 하는 고급 프롬프팅 기법입니다 [89]. 이 접근법은 전통적인 사고 연쇄(CoT) 프롬프팅 방법을 기반으로 하지만, 흔히 템플릿, 다이어그램 또는 기타 구조화된 형식을 사용하여 추론 과정을 더 조직적이고 체계적으로 표현하는 방식을 도입합니다 [132]. SCoT 프롬프팅은 추론 단계에 명확한 구조를 제공함으로써 LLM이 복잡한 추론, 다단계 문제 해결 및 논리적 추론이 필요한 작업에서 더 일관되고, 해석 가능하며, 정확한 응답을 생성하도록 안내합니다 [76].
9.4.1. 작동 원리
SCoT 프롬프팅은 일반적으로 다음 단계를 포함합니다:
-
• 구조 선택: 특정 작업 또는 문제에 따라 적합한 구조나 템플릿을 선택합니다 [89]. 이는 단순한 목록, 트리 다이어그램, 순서도 또는 관련된 추론의 성격에 따라 더 복잡한 표현일 수 있습니다 [132].
-
• 프롬프트 통합: 선택한 구조를 원래의 문제 또는 질문과 함께 프롬프트에 통합합니다 [76]. 또한 프롬프트에는 선택한 구조에 따라 LLM이 추론 단계를 생성하도록 안내하는 지시사항이나 힌트가 포함될 수 있습니다 [89].
-
• LLM 처리: LLM은 구조화된 형식을 포함한 프롬프트를 처리하고, 제공된 구조를 사용하여 추론 단계를 구성하고 생성합니다 [132].
-
• 응답 생성: LLM은 프롬프트와 구조화된 추론 단계를 기반으로 응답을 생성하며, 제공된 구조를 활용하여 문제를 해결하거나 질문에 더 조직적이고 체계적인 방식으로 답하는 능력을 보여줍니다 [76].
9.4.2. 구조화된 사고 연쇄(Scot) 프롬프팅의 예시
-
• 수학 문제 해결: “밑변이 10cm이고 높이가 5cm인 삼각형의 넓이를 계산하세요.” 프롬프트에는 다음과 같은 구조화된 템플릿이 포함됩니다:
1단계: 공식을 식별합니다:
2단계: 값을 대입합니다:
3단계: 결과를 계산합니다:
-
• 논리적 추론: “모든 새가 날 수 있고 펭귄이 새라면, 펭귄은 날 수 있나요?” 프롬프트에는 다음과 같은 구조화된 형식이 포함됩니다: “전제 1: 모든 새는 날 수 있다. 전제 2: 펭귄은 새다. 결론: 펭귄은 날 수 없다(모순).”
-
• 계획 및 의사결정: “이용 가능한 교통수단, 예산, 선호하는 이동 시간을 고려하여 도시 A에서 도시 C까지의 여행을 계획하세요.” 프롬프트에는 서로 다른 경로, 비용 및 일정을 나타내는 트리 다이어그램이 포함되어, LLM이 선택지를 체계적으로 탐색하고 비교하도록 안내합니다.
9.4.3. 구조화된 사고 연쇄(Scot) 프롬프팅의 장점 SCoT 프롬프팅은 다음과 같은 여러 장점을 제공합니다:
-
• 추론 향상: 구조화되고 조직적인 접근 방식을 제공하여 LLM의 복잡한 추론 및 문제 해결 능력을 강화합니다 [89].
-
• 오류 감소: 추론 단계에 구조화된 형식을 강제함으로써 조직화되지 않았거나 불완전한 추론으로 인한 오류를 최소화합니다 [132].
-
• 해석 가능성 향상: 추론 단계를 명확하고 조직적인 방식으로 제시하여 LLM의 추론 과정을 더 투명하고 이해하기 쉽게 만듭니다 [76].
-
• 적응성: 적절한 구조를 선택하고 이를 프롬프트에 통합하여 다양한 작업과 도메인에 맞게 조정할 수 있습니다 [89].
9.4.4. 구조화된 사고 연쇄(Scot) 프롬프팅의 한계 장점에도 불구하고, SCoT 프롬프팅에는 몇 가지 한계가 있습니다:
-
• 구조 선택: 주어진 작업에 가장 효과적인 구조를 선택하는 일은 어려울 수 있으며, 추론 과정과 LLM의 역량을 신중하게 고려해야 합니다 [132].
-
• 프롬프트 엔지니어링: 구조화된 형식을 효과적으로 통합하고 LLM의 추론을 안내하는 프롬프트를 설계하는 일은 복잡할 수 있습니다 [76].
-
• 계산 비용: 구조화된 추론 단계를 처리하고 생성하면 LLM의 계산 비용과 응답 시간이 증가할 수 있습니다 [89].
9.5. 코드 연쇄(CoC) 프롬프팅
코드 연쇄(CoC)는 코드와 자연어의 강점을 결합하여 추론을 향상하는 대규모 언어 모델(LLM)을 위한 프롬프팅 기법입니다. 자연어에만 의존하는 방법과 달리, CoC는 LLM이 잘 정의된 알고리즘에는 실행 가능한 코드를 사용하고 의미적 이해가 필요한 작업에는 언어 모델 에뮬레이터인 “LMulator”를 사용하여 해결책을 프로그램으로 표현하도록 유도합니다 [180]. 이 접근법은 복잡한 문제를 관리 가능한 하위 작업으로 나누고, 실행 가능한 코드와 LM이 시뮬레이션한 코드를 결합하여 프로그램적 정밀성과 자연어 유연성의 장점을 활용함으로써 LLM이 효과적으로 다룰 수 있는 추론 질문의 범위를 확장합니다 [34].
9.5.1. 작동 원리
CoC의 작동 원리는 LM 추론을 향상하기 위한 코드 생성과 실행의 통합을 중심으로 합니다. 이 접근법은 기호적(코드 기반) 방법과 신경망적(LM 기반) 방법의 상호 보완적인 강점을 활용합니다. 그림 22에 제시된 Least-to-Most 프롬프팅과 같은 관련 기법과의 연관성을 포함한 자세한 설명은 다음과 같습니다.
-
• 생성: LM은 실행 가능한 코드(예: Python), 의사 코드 또는 자연어 설명의 형태를 취할 수 있는 추론 하위 단계를 생성합니다. 이러한 하위 단계는 인간 프로그래머가 복잡한 작업을 분해하거나 Least-to-Most 프롬프팅에서 문제가 하위 질문으로 나뉘는 방식(그림 22 참조)과 유사하게, 주어진 문제를 구조적이고 단계적인 방식으로 해결하는 것을 목표로 합니다. 이 접근법은 사고 연쇄 프롬프팅 [2]의 아이디어를 기반으로 하지만, 핵심적으로 실행 가능한 코드를 통합하여 이를 확장합니다. 그 밖의 관련 기법으로는 Least-to-Most 프롬프팅 [125]과 중간 계산을 위한 스크래치패드 사용 [130]이 있습니다.
-
• 실행: 생성된 코드는 표준 코드 인터프리터(예: Python 인터프리터)를 사용하여 실행됩니다. 이는 추론 과정의 계산 부분에 대해 정확하고 검증 가능한 결과를 제공합니다. 그러나 본질적으로 의미적이거나 알고리즘으로 표현하기 어려운 작업(예: 자연어 뉘앙스 이해, 상식적 추론 수행)의 경우, LM 자체가 실행을 시뮬레이션하고 프로그램 상태를 업데이트하기 위해 LMulator [76]라고 하는 “코드 에뮬레이터” 역할을 합니다. 그림 22에서 하위 질문에 답하는 LM의 역할은 LMulator의 기능과 유사합니다. 이는 역시 코드 생성을 사용하지만 실행 불가능한 부분을 다르게 처리할 수 있는 PAL과 같은 접근법과 대조됩니다. LM에서의 추론에 대한 더 넓은 맥락은 [6]과 같은 설문조사에서 다룹니다.
-
• 교차 추론: 실행 과정은 코드 인터프리터(잘 정의된 계산용)와 LMulator(의미적이고 덜 형식화 가능한 단계용) 사이를 번갈아 오갑니다. 이러한 “두 세계의 장점” 접근법 [76]은 시스템이 코드 실행의 알고리즘적 정밀성과 LM의 유연하고 미묘한 추론 능력을 결합할 수 있게 합니다. 개념적으로 그림 22에서 하위 질문을 순차적으로 푸는 것과 유사한 이러한 교차 방식은 수치 계산과 자연어 이해를 모두 요구하는 복잡한 문제를 처리할 수 있게 합니다. 흥미롭게도 코드로 훈련된 LM조차 상식적 추론에서 놀라운 능력을 보여주었으며 [7], 이는 LMulator의 역할과 관련이 있습니다. 기호적 접근법과 신경망적 접근법을 통합하는 더 넓은 추세는 LM과 지식 그래프의 통합에 관한 연구 [18]에서 강조됩니다.
9.5.2. 코드 연쇄(CoC) 프롬프팅의 예시
CoC 프롬프팅은 다음과 같이 계산적 또는 프로그램적 해결책이 필요한 다양한 작업에 적용할 수 있습니다:
-
• 코드 에뮬레이션을 통한 의미적 추론: 이 작업은 문단에서 빈정거림이 몇 번 나타나는지 세는 것을 포함합니다. 이 접근법은 LM이 직접 실행할 수 없는 is-sarcastic(sentence)와 같은 함수를 포함한 코드를 작성하는 데 사용됩니다. 대신 에뮬레이터가 출력을 시뮬레이션하고 그에 따라 프로그램 상태를 업데이트하여, 의미적 추론 과제를 원활하게 처리할 수 있게 합니다 [76].
-
• 객체 개수 세기: 이 작업의 목표는 혼합된 객체 목록에 과일이 몇 개 있는지 세는 것입니다. LM은 is-fruit(object)와 같은 함수를 사용하여 각 객체를 확인하는 루프를 작성하고, 목록을 반복하면서 개수를 동적으로 업데이트합니다. 이 방법은 객체 분류 및 개수 세기 작업을 효율적으로 처리하는 방식을 제공합니다 [181].
-
• 로보틱스 응용: 로보틱스에서 흔한 작업은 객체를 퇴비통과 재활용 통으로 분류하는 것입니다. LM은 객체를 탐지하고 is-compostable(obj)와 같은 함수를 사용하여 분류하며 robots. pick-place(obj, compost-bin)와 같은 로봇 명령을 실행하는 코드를 생성합니다. 이 접근법은 자율 분류 작업을 위해 기계 지각과 작동을 통합합니다 [182].
단계 1: 질문을 하위 질문으로 분해
단계 2: 하위 질문을 순차적으로 해결
그림 22.
코드 연쇄와 관련된 기법인 Least-to-Most 프롬프팅의 예시입니다. 문제는 하위 질문으로 분해되고, 이들은 순차적으로 해결됩니다. 이는 문제 분해와 반복적 추론의 원리를 보여줍니다. 이 그림은 [125]의 정보를 바탕으로 작성했습니다.
-
• 작업 간 추론: 이 다목적 작업은 단일 추론 프레임워크 내에서 산술, 논리적 연역, 의미적 질의 등 여러 서로 다른 문제를 해결하는 것을 포함합니다. CoC는 수학 작업을 위한 알고리즘적 정밀성과 상식적 추론을 위한 의미적 유연성을 결합하고, 교차 코드 실행과 LM 시뮬레이션을 사용하여 강건한 문제 해결 능력을 달성합니다 [183].
9.5.3. 코드 연쇄(CoC) 프롬프팅의 장점
CoC의 주요 장점은 다음과 같습니다:
-
• 코드로 의미적 이해 가능: CoC는 코드(정확한 알고리즘 계산용)의 강점과 언어 모델(LLM)의 의미적 이해를 결합하여, 모델이 둘 다 필요한 작업을 처리할 수 있게 합니다 [76].
-
• 추론 성능 향상: CoC는 추론 과정을 코드로 구조화하고(필요할 때 코드 실행을 에뮬레이션하여), 자연어 추론에만 의존하는 방법과 비교해 복잡한 추론 작업의 성능을 크게 향상할 수 있습니다 [184].
-
• 새로운 영역으로 코드 사용 확장: 이는 코드의 강점과 상식 지식에 대한 LLM의 강점을 결합하며, 논리를 찾거나 상식 지식을 통해 추론하는 것처럼 코드로 표현하기 어려운 작업에 적용됩니다 [185].
-
• 활용 범위 확대: 다양한 디코딩 전략을 포함한다. 이러한 기법은 원래 방법에서 파생된 일부 방법을 사용하여 텍스트 요약, 지식 그래프, 대규모 언어 모델과 같은 기능을 포함한다 [186].
-
• 해석 가능성 향상: 코드가 부여하는 구조는 추론 과정을 더 투명하게 만들어, 사용자가 모델이 결론에 도달한 방식을 이해할 수 있게 한다 [187].
9.5.4. 코드 체인(CoC) 프롬프팅의 한계
-
• LMulator에 대한 의존성은 특히 정확하고 결정론적인 출력을 요구하는 작업에서 오류나 불일치를 초래할 수 있다 [76].
-
• 코드 해석과 LM 시뮬레이션 사이를 전환하는 반복적 특성 때문에 실행 속도가 느려질 수 있다 [34].
-
• 언어 모델의 학습 데이터에 의해 제한되므로 부정확한 추론이나 오래된 지식으로 이어질 가능성이 있다 [185].
-
• 기존 코딩 접근 방식과 비교해 CoC 프로세스의 디버깅과 문제 해결은 더 복잡할 수 있다 [186].
9.6. 프롬프팅을 통한 최적화
“프롬프팅을 통한 최적화”(OPRO)는 대규모 언어 모델(LLM)을 범용 최적화기로 활용하는 새로운 프레임워크이다 [188]. OPRO는 전통적이고 흔히 특수화된 최적화 알고리즘에 의존하는 대신, 최적화 문제를 자연어로 구성한다 [2]. 신중하게 작성된 “메타 프롬프트”가 LLM(“최적화기 LLM”)에 제공된다. 이 메타 프롬프트에는 최적화 작업에 대한 설명, 예시, 그리고 결정적으로 이전에 생성된 해법과 그에 대응하는 점수의 이력(“최적화 궤적”)이 포함된다. LLM은 이 정보를 사용하여 새로운 후보 해법을 반복적으로 제안한다. 이어서 이러한 해법은 별도의 목적 함수 평가기(코드일 수도 있고, 프롬프트 최적화의 경우 또 다른 LLM일 수도 있음)가 평가한다. 새 해법과 점수는 궤적에 추가되고, 이 과정이 반복된다. OPRO의 주요 설계 선택에는 탐색과 활용의 균형 조정(예: LLM의 온도 설정을 통해), 메타 프롬프트의 신중한 작성(해법의 순서 및 작업 예시의 포함 등), 그리고 프롬프트 최적화의 경우 생성된 지시문의 프롬프트 내 위치 선택이 포함된다. OPRO의 장점으로는 자연어 인터페이스, 다양한 작업에 대한 적응성, 그리고 LLM의 패턴 인식 및 생성 능력 활용이 있다. 한계는 계산 비용, 메타 프롬프트 민감성, 그리고 지역 최적점에 갇힐 가능성과 관련된다. 이는 전통적인 최적화에서 크게 전환한 방식으로, 특히 기울기 정보를 사용할 수 없거나 새로운 작업에 신속히 적응해야 하는 문제에 적합한 더 직관적이고 유연한 접근법을 제공한다.
9.6.1. 작동 원리
-
• OPRO의 작동 원리는 그림 23에 제시되어 있으며, 아래에 자세히 설명한다:
-
• 초기화: 최적화 과정은 초기 후보 해법 집합으로 시작한다 [190]. 이들은 무작위, 휴리스틱 기반,
그림 23.
프롬프팅을 통한 최적화(OPRO) 과정. LLM은 최적화기로 작동하며, 작업 설명과 해법 및 그 점수의 이력이 포함된 메타 프롬프트를 바탕으로 해법을 반복적으로 생성한다. 목적 함수 평가기는 생성된 해법을 평가하고, 그 결과는 다음 반복을 위해 메타 프롬프트를 업데이트하는 데 사용된다 [189].
또는 빈 문자열일 수도 있다(특히 프롬프트 최적화에서). 이 초기 집합은 반복적 정제의 출발점을 제공한다.
-
•
메타 프롬프트 구성:
핵심 요소는 최적화기 LLM에 대한 입력인 “메타 프롬프트” [125]이다(그림 23 참조). 메타 프롬프트에는 다음이 포함된다:
-
– 최적화 문제(목적 및 제약 조건)에 대한 자연어 설명.
-
– “최적화 궤적”: 이전에 생성된 해법과 그에 대응하는 점수(해법-점수 쌍)의 이력.
-
– 새 해법을 생성하는 방법을 LLM에 안내하는 “메타 지시문”.
-
•
해법 생성(최적화기로서의 LLM):
OPRO의 핵심 엔진인 “최적화기 LLM” [97](그림 23의 “최적화기로서의 LLM” 상자로 표현됨)은 메타 프롬프트를 받는다. 인컨텍스트 학습을 사용하여 문제 설명, 메타 지시문, 최적화 궤적을 분석하고, 패턴을 식별하여 새로운 후보 해법을 생성한다.
-
•
해법 평가(목적 함수):
외부 “목적 함수 평가기” [191](그림 23 참조)는 정의된 목적에 따라 생성된 각 해법의 품질을 평가한다. 이 평가기는 전통적인 코드일 수도 있고 또 다른 LLM일 수도 있다(프롬프트 최적화의 경우).
-
•
궤적 업데이트:
새 해법과 그 점수는 메타 프롬프트 내 최적화 궤적에 추가되어 [49], 다음 반복을 위한 이력을 풍부하게 한다(그림 23의 피드백 루프로 표현됨).
-
•
반복:
단계 3–5를 반복한다. 업데이트된 메타 프롬프트는 LLM에 다시 입력되어, 축적되는 피드백을 바탕으로 해법을 점진적으로 정제할 수 있게 한다.
-
•
중지 기준:
최대 반복 횟수, 만족스러운 성능 수준, 또는 성능 정체와 같은 사전 정의된 중지 기준이 충족될 때까지 과정이 계속된다 [27]. 이는 그림 23의 “완료 시 최상위 해법 반환” 부분에 해당한다.
9.6.2. 프롬프팅을 통한 최적화의 예시
프롬프팅을 통한 최적화는 다음을 포함하여 LLM의 성능을 향상하기 위해 다양한 작업과 도메인에서 활용할 수 있다:
-
•
선형 회귀:
입력–출력 쌍으로 이루어진 데이터셋이 주어졌을 때, 목표는 데이터에 가장 잘 맞는 선형 방정식의 계수를 찾는 것이다
[27]. “프롬프트”(LLM에 대한)는 선형 회귀 설명, 여러 예시 데이터 포인트(가령 “입력: [x 값], 출력: [y 값]” 형식), 그리고 새로운 계수 집합을 생성하라는 요청(예: “오차를 최소화하는 새로운 w와 b를 생성하라.”)을 포함한다. “점수”는 제공된 데이터 포인트에 대한 평균 제곱 오차(MSE)와 같은 오차 측정값이다. 프롬프트는 모델에 제공된 값과 다른 값을 제안하고 코드를 출력하지 않도록 명시적으로 지시한다.
-
•
외판원 문제(TSP):
도시 목록과 각 도시 쌍 간의 거리가 주어졌을 때, 각 도시를 정확히 한 번 방문하고 출발 도시로 돌아오는 가장 짧은 경로를 찾는다 [190]. “프롬프트”에는 TSP 설명, 도시 목록(좌표 또는 거리 행렬을 포함할 수 있음), 그리고 총거리가 포함된 여러 예시 경로(예: “경로: [city1, city2, city3], 거리: [총거리]”)가 포함된다. LLM은 새 경로를 생성하도록 요청받는다(예: “예시보다 더 짧은 새 경로를 생성하라.”). “점수”는 생성된 경로의 총거리이다. 프롬프트에는 엄격한 입력 및 출력 형식이 필요하다.
-
•
프롬프트 최적화(메타 최적화):
프롬프트 최적화는 한 LLM(“최적화기”)을 사용하여 다른 LLM(“채점기”)이 특정 작업을 수행하도록 하는 최상의 지시문(프롬프트)을 자동으로 찾는다 [125]. 최적화기 LLM에는 작업 설명, 예시, 점수와 함께한 프롬프트 이력이 제공되며, 채점기 LLM의 성능을 향상하는 새 프롬프트를 생성하도록 지시받는다. 생성된 지시문의 위치도 알려진다.
-
•
조합 최적화(예: 배낭 문제):
각각 무게와 가치를 가진 항목 집합이 주어졌을 때, 배낭에 담긴 항목의 총가치가 최대가 되도록 제한된 용량의 배낭에 포함할 항목 부분집합을 결정한다. “프롬프트”에는 배낭 문제 설명, 항목의 무게와 가치 목록(예: “항목: [item1, item2], 무게: [w1, w2], 가치: [v1, v2]”), 그리고 총가치가 포함된 여러 예시 해법이 포함된다. LLM은 포함할 새 항목 집합을 생성하도록 요청받는다(예: “배낭 용량을 초과하지 않으면서 총가치가 더 높은 새 항목 집합을 생성하라.”). “점수”는 생성된 집합의 총가치이다. 프롬프트는 용량을 명시해야 한다.
-
•
하이퍼파라미터 최적화:
간단한 모델의 드롭아웃 및 학습률과 같은 최적의 하이퍼파라미터를 찾는다 [49]. 프롬프트에는 모델 설명과 여러
성능을 개선하는 새 설정을 요청하기 위한 성능별 하이퍼파라미터 설정이 포함되어야 한다.
-
• 함수 최소화: 함수 입력의 최적값을 찾는다. 프롬프트에는 이 함수의 여러 입력–출력 쌍이 포함되어야 하며, 최적화기 LLM이 더 낮은 함수값을 제공하는 이 함수의 새 입력을 생성하도록 요구해야 한다 [188].
9.6.3. 프롬프팅을 통한 최적화의 장점
프롬프팅을 통한 최적화는 여러 이점을 제공한다 [2,188,191]:
-
• 미분 없는 최적화: OPRO는 기울기를 요구하지 않으므로 프롬프트 최적화와 API를 통한 LLM 상호작용에서 접하는 것과 같은 이산적, 블랙박스, 비미분 가능 목적 함수를 최적화하는 데 적합하다 [188].
-
• LLM의 강점 활용: OPRO는 LLM의 자연어 이해, 최적화 궤적에서의 패턴 인식, 창의적 해법 생성 능력을 활용하여 해법 공간을 효과적으로 탐색하고 고성능 프롬프트를 찾는다 [2].
-
• 신속한 적응: 최적화 작업을 변경하거나 제약 조건을 통합하는 일은 메타 프롬프트 내 자연어 설명을 수정하기만 하면 되므로 쉽고 빠르다 [125].
-
• 입증된 효과: OPRO는 특히 프롬프트 최적화에서 강력한 실증적 결과를 보이며, 다양한 벤치마크에서 사람이 설계한 프롬프트와 다른 기준선을 능가한다.
-
• 접근성: OPRO는 LLM API에 접근할 수 있다면 쉽게 구현할 수 있다.
-
• 편집 기반 방법보다 우수: OPRO는 전체 최적화 이력을 활용하여 최적 프롬프트를 더 정보에 기반해 효과적으로 탐색함으로써 편집 기반 방법을 능가한다 [188].
9.6.4. 프롬프팅을 통한 최적화의 한계
장점에도 불구하고, 프롬프팅을 통한 최적화에는 다음과 같은 한계도 있다:
-
• 초기화 민감성: 성능은 메타 프롬프트의 초기 해법 품질에 따라 달라질 수 있다 [49].
-
• 복잡한 지형: 매우 복잡하거나 “울퉁불퉁한” 목적 함수를 최적화하기 어렵다 [191].
-
• 학습 집합 의존성(프롬프트 최적화의 경우): 프롬프트 품질을 평가하려면 학습 집합이 필요하다 [2].
-
• 계산 비용: 단계당 여러 번의 LLM 호출로 인해 비용이 많이 들 수 있다.
-
• 컨텍스트 길이 제한: LLM 컨텍스트 창의 크기는 문제 크기와 궤적 길이를 제한한다 [125].
-
• 이론적 보장 부재: 수렴이나 최적성에 대한 형식적 보장이 부족하다 [97].
9.7. 다시 표현하고 응답하기(RaR) 프롬프팅
다시 표현하고 응답하기(Rephrase and Respond, RaR)는 인간과 LLM 간의 오해를 해결하여 대규모 언어 모델(LLM)의 성능을 향상하도록 설계된 제로샷 프롬프팅 기법이다. 이 기법은 LLM에 먼저 사용자의 질문을 다시 표현하고 상세히 설명한 다음, 다시 표현된 버전을 바탕으로 응답하도록 지시함으로써 자기 명료화 단계를 효과적으로 통합해 의사소통을 개선한다 [26]. RaR의 기본 아이디어는 LLM도 인간과 마찬가지로 사용자의 것과 다른 내부 “사고 틀”에 근거해 질문을 해석할 수 있다는 것이다. 이는 오해로 이어질 수 있다. RaR은 명확성을 보장하도록 질문을 명시적으로 다시 표현하여 이러한 사고 틀을 정렬하며, 그 결과 더 정확한 이해와 응답을 낳는다 [30]. 이 과정은 더 나은 이해를 위해 사람이 질문을 바꾸어 표현해 모호성을 줄이는 것과 유사하다. 또한 RaR의 2단계 변형이 도입된다. 이 변형에서 LLM은 먼저 질문을 다시 표현한 뒤, 원래 버전과 다시 표현한 버전을 모두 별도의 응답 LLM에 전달한다 [192]. 이 접근법은 추가적인 검증 및 정제 계층을 도입하여 응답 정확도를 더욱 향상한다.
9.7.1. 작동 원리
재구성 후 응답(Rephrase and Respond, RaR) 프롬프팅은 일반적으로 다음 단계로 구성된다:
-
• 입력 통합: 이 과정은 LLM에 하나의 결합된 프롬프트를 제시하는 것으로 시작된다. 이 프롬프트에는 사용자가 제기한 원래 질문 뒤에 명시적인 지시가 바로 이어진다. 이 지시는 LLM이 두 가지 작업을 순차적으로 수행하도록 한다. 즉, 원래 질문을 재구성하고 확장한 다음, 명확해진 버전을 바탕으로 응답을 제공하도록 한다. 이 통합된 접근법은 재구성과 응답 단계가 긴밀하게 결합되어 동일한 처리 맥락에서 이루어지도록 보장한다 [26].
-
• 명확화를 위한 재구성: 결합된 프롬프트를 받은 LLM은 먼저 재구성 지시에 집중한다. 원래 질문을 분석하여 잠재적인 모호성이나 자신의 내부 이해가 사용자의 의도와 어긋날 수 있는 영역을 식별한다. 이어 LLM은 질문을 더 명시적이고 상세하게 만들며 자신의 내부 “사고 틀”에 부합시키기 위한 새로운 버전을 생성한다. 이렇게 재구성된 질문에는 원래 질문에서 암묵적으로 가정되었지만 명시적으로 언급되지 않은 추가 맥락이나 명세가 포함되는 경우가 많다 [30].
-
• 응답 생성: 재구성 후 LLM은 지시의 두 번째 부분인 응답으로 초점을 전환한다. 재구성된 질문을 답변 생성의 기반으로 사용한다. 재구성된 질문은 (이상적으로) 더 명확하고 LLM의 이해와 더 잘 부합하므로, 응답은 사용자의 원래 의도에 정확하고 관련될 가능성이 더 높다. LLM은 명확해진 질의를 다루기 위해 자신의 지식과 추론 능력을 활용한다 [192].
-
• 단일 턴 처리(또는 2단계): 핵심적으로 재구성과 응답의 전체 과정은 LLM과의 단일 상호작용 턴 내에서 이루어진다(또는 2단계 RaR에서는 두 LLM을 사용한다). 이는 여러 차례의 피드백과 개선을 수반하는 반복적 프롬프팅 방법과 RaR을 구별한다. 단일 턴(또는 2단계) 특성은 RaR을 효율적이고 실시간 애플리케이션에 적합하게 만든다. 외부 평가 또는 점수화 메커니즘이 없다는 점도 단순성과 속도에 기여한다 [192].
-
• LLM의 내재적 역량 활용: 효과성은 자연어를 이해하고 생성하는 LLM의 내재적 능력에 의존한다 [193]. LLM은 작업별 미세 조정에 의존하지 않는다 [30].
-
• 다른 기법과의 상호 보완성: RaR은 사고 연쇄와 같은 다른 프롬프팅 방법과 상호 배타적이지 않다 [26].
9.7.2. 재구성 후 응답(RaR) 프롬프팅의 예시
RaR 프롬프팅은 입력을 다듬는 것이 응답의 정확성과 관련성을 향상시키는 다음과 같은 다양한 작업에 적용할 수 있다:
-
• 사실 확인 및 지식 검색: 역사적 날짜나 전기적 세부 정보처럼 사실 정확성이 요구되는 작업에서 LLM은 모호한 질의를 잘못 해석할 수 있다. 예를 들어 “에이브러햄 링컨은 짝수 달에 태어났는가?”라고 묻는 경우, 그림 24에 나타난 것처럼 “짝수 달”의 해석에 모호성이 생길 수 있다. RaR 프롬프팅을 사용하면 질문을 “에이브러햄 링컨은 2월, 4월, 6월, 8월, 10월 또는 12월처럼 숫자 값이 짝수인 달에 태어났는가?”로 다듬을 수 있다. 이 명확화는 모델이 혼동 없이 올바른 정보를 검색하도록 보장한다 [194].
-
• 상식 추론: 개연성 점검과 같은 상식 지식 관련 질문은 추가 맥락이 필요한 경우가 많다. 예컨대 “물고기는 육지에서 살 수 있는가?”와 같은 질문은 단순해 보이지만 기간이나 조건에 대한 명확성이 부족하다. RaR 프롬프팅은 이를 “물고기는 물 보존 방법과 같은 외부 지원 없이 장기간 물 밖에서 생존할 수 있는가?”로 변환할 수 있으며,
그림 24.
GPT-4가 해석한 “[인물]은 짝수 달에 태어났는가?”라는 질문의 모호성 예시. “짝수 달”에 대한 서로 다른 해석으로 인해 서로 다른 응답이 제공되며, 이는 RaR 프롬프팅과 같은 기법의 필요성을 부각한다 [26].
이러한 재구성은 지나치게 단순화되거나 오해를 불러일으키는 답변을 방지한다 [195].
-
•
수학 및 논리 추론:
수치 또는 논리 계산이 필요한 작업에서는 모호한 표현이 잘못된 결과로 이어질 수 있다. “12와 13의 합은 무엇인가?”와 같은 프롬프트는 단순하지만, 더 복잡한 작업에서는 모호성이 발생할 수 있다. “5보다 크고 10보다 작은 두 수의 곱은 무엇인가?”와 같은 불명확한 질문은 “5보다 크고 10보다 작은 두 수의 곱은 무엇인가? 계산하기 전에 가능한 수를 나열하라.”로 재구성할 수 있다. 이는 제약 조건과 기대되는 추론을 명확히 보장한다 [195].
-
•
언어 번역 및 해석:
언어 간 번역에서는 직역이 의도한 의미를 항상 정확하게 전달하지는 않을 수 있다. “light를 프랑스어로 번역하라”와 같은 모호한 요청은 RaR을 사용하여 “light라는 단어를 프랑스어로 번역하되, 밝기(lumière)를 의미하는지 무게(léger)를 의미하는지 명시하라.”로 다듬을 수 있다. 이는 맥락을 명시적으로 정의함으로써 번역 오류를 방지한다 [196].
-
•
기호 및 패턴 인식 작업:
패턴 기반 작업에서는 지시를 잘못 해석하면 정확도가 저하될 수 있다. “John Doe의 마지막 글자를 가져와 연결하라”와 같은 질문은 명확하지 않을 수 있다. RaR을 사용하면 이를 “John Doe라는 이름의 각 단어에서 마지막 글자를 식별하고 하나의 문자열로 결합하라.”로 재구성한다. 이는 모델이 올바른 패턴을 따르고 프롬프트를 오해하지 않도록 보장한다 [197].
-
•
시간 추론 명확화:
날짜와 시간이 관련된 질문은 오해를 피하기 위해 흔히 정밀성이 필요하다. “2020년 1월 31일 이틀 후의 날짜는 무엇인가?”와 같은 질문은 윤년이나 월 전환을 고려하지 않을 수 있다. RaR 프롬프팅은 이를 “2020년 1월 31일이 그달의 마지막 날이었다면, 그해 2월이 28일인지 29일인지 고려할 때 정확히 이틀 후의 날짜는 무엇인가?”라고 물어 개선할 수 있다. 이 구조화된 접근법은 잠재적인 혼동을 제거한다 [198].
-
•
의료 및 과학 질의 해석:
의료 또는 과학 질문을 다룰 때는 오해를 유발하는 응답을 피하기 위해 정밀성이 필수적이다. “설탕을 먹으면 당뇨병이 생길 수 있는가?”와 같은 모호한 질문은 지나치게 단순화된 답변을 낳을 수 있다. RaR 프롬프팅을 사용하면 이를 “과도한 설탕 섭취가 직접 당뇨병을 유발하는가, 아니면 유전과 생활 방식 같은 다른 기여 요인도 있는가?”로 재구성할 수 있다. 이는 충분한 정보를 갖추고 미묘한 차이를 반영한 응답을 보장한다 [199,200].
9.7.3. 재구성 후 응답(RaR) 프롬프팅의 장점 RaR 프롬프팅은 다음과 같은 몇 가지 핵심 이점을 제공한다:
-
•
정확도 향상:
RaR의 주된 장점은 LLM 응답의 정확도를 크게 향상시키는 능력이다. 답변하기 전에 질문을 명확히 하도록 LLM에 프롬프트함으로써, RaR은 사용자와 모델 간의 모호성이나 이해 차이로 인한 오해 가능성을 줄인다. 재구성된 질문은 일반적으로 더 명시적이며 LLM의 내부 표현과 일치하므로 더 올바른 답변으로 이어진다 [201].
-
•
제로샷 적용성:
RaR은 작업별 훈련 데이터나 LLM의 미세 조정을 필요로 하지 않는 제로샷 기법이다. 따라서 매우 다재다능하며 광범위한 작업과 도메인에 적용할 수 있다. 충분한 언어 이해 및 생성 능력을 갖춘 모든 LLM에서 즉시 사용할 수 있다 [73].
-
•
단순성 및 효율성:
RaR은 개념적으로 단순하고 구현하기 쉽다. 프롬프트에 단일 지시를 추가하는 방식이므로 오버헤드가 낮은 기법이다. 재구성과 응답의 전체 과정은 일반적으로 LLM과의 단일 상호작용 턴 내에서 이루어지며(2단계 변형에서는 두 턴), 계산 자원과 응답 시간 측면에서 효율적이다 [17].
-
•
비지도 방식:
RaR은 외부 평가 지표, 피드백 루프 또는 사람이 레이블링한 데이터에 의존하지 않는다. 언어를 재구성하고 이해하는 LLM의 내재적 능력을 활용한다. 이러한 비지도 특성은 확장 가능하게 하며 지도 방식과 관련된 비용과 노력을 피한다 [74].
-
•
모호성 완화:
RaR은 사용자 질의의 모호성 문제를 직접 다룬다. 자연어는 흔히 본질적으로 모호하며, LLM은 발전했음에도 미묘한 뉘앙스나 암묵적 가정을 해석하는 데 여전히 어려움을 겪을 수 있다. RaR은 재구성 단계에서 LLM이 이러한 모호성을 명시적으로 다루도록 한다 [202].
-
•
견고성 강화:
LLM이 질문을 명확히 하도록 장려함으로써 RaR은 표현이나 문구의 변형에 대해 시스템을 더 견고하게 만든다. LLM이 근본 의도를 적극적으로 이해하려 시도하므로 질문하는 방식의 사소한 차이가 잘못된 답변으로 이어질 가능성이 낮아진다 [202].
-
•
투명성 및 해석 가능성(부분적):
LLM은 흔히 “블랙박스”로 간주되지만, RaR은 질문에 대한 LLM의 해석을 다음을 통해 드러냄으로써 어느 정도의 투명성을 제공한다
재구성된 버전. 이는 사용자가 LLM이 어떻게 답변에 도달했는지 이해하고 잠재적인 오해를 식별하는 데 도움이 될 수 있다 [45].
-
• 전이 가능성(2단계 RaR): 한 LLM이 재구성하고 다른 LLM이 응답하는 RaR의 2단계 변형은 전이 가능성이라는 장점을 제공한다. 더 유능한 LLM(예: GPT-4)이 생성한 재구성된 질문을 사용하여 덜 유능한 LLM의 성능을 향상시킬 수 있다. 이를 통해 서로 다른 모델의 강점을 활용할 수 있다 [26].
9.7.4. 재구성 후 응답(RaR) 프롬프팅의 한계
장점에도 불구하고 RaR 프롬프팅에는 몇 가지 한계가 있다:
-
• LLM의 재구성 능력 의존성: RaR의 효과성은 질문을 정확하고 효과적으로 재구성하는 LLM의 능력에 달려 있다. LLM의 재구성이 부실하거나 새로운 오류를 도입하거나 원래 의도를 잘못 해석하면 RaR은 실제로 성능을 저하시킬 수 있다. 성능이 낮은 LLM은 고품질 재구성을 생성하는 데 어려움을 겪을 수 있다 [26].
-
• 보편적 해결책이 아님: RaR은 모든 유형의 LLM 오류에 대한 보장된 해결책이 아니다. 모호성과 오해에는 도움이 되지만, LLM 지식 기반의 사실 부정확성, 추론 능력의 한계 또는 훈련 데이터의 편향과 관련된 문제에는 효과적이지 않을 수 있다 [26].
-
• 과도한 명확화 가능성: 경우에 따라 LLM은 질문을 과도하게 명확화하여 불필요한 세부 정보를 추가하거나 재구성된 버전을 지나치게 복잡하게 만들 수 있다. 이는 LLM 자체를 혼란스럽게 하거나 덜 간결하고 집중되지 않은 응답으로 이어질 수 있다 [203].
-
• 해석 가능성 개선의 한계: RaR은 재구성된 질문을 통해 LLM의 이해에 대한 일부 통찰을 제공하지만, LLM의 추론 과정을 완전히 설명하지는 않는다. 답변에 도달하는 데 수반되는 단계를 명시적으로 추적하는 방법과 비교하면 여전히 제한적인 형태의 해석 가능성이다 [45].
-
• 계산 비용 증가(경미함): 일반적으로 효율적이지만, RaR은 원래 질문에 직접 답하는 것과 비교하여 작은 계산 오버헤드를 추가한다. LLM은 응답을 생성하기 전에 추가 처리 단계(재구성)를 수행해야 한다. 이 차이는 일반적으로 무시할 수 있지만, 매우 길거나 복잡한 프롬프트에서는 눈에 띄게 될 수 있다 [204].
9.8. 한 걸음 물러서기 프롬프팅
한 걸음 물러서기 프롬프팅은 대규모 언어 모델(LLM)을 위한 프롬프팅 기법으로, 먼저 LLM이 특정 질문에서 “한 걸음 물러서” 고수준 개념, 원리 또는 관련 사실을 도출하도록 프롬프트한 다음, 이 추상화된 정보를 사용하여 원래 질문에 대한 답변을 안내함으로써 추론을 강화한다. 이 2단계 과정에는 LLM이 원래 질의와 관련된 더 광범위하고 일반적인 “한 걸음 물러선 질문”을 생성하고 답하는 추상화 단계가 포함되며, 그 뒤에는 LLM이 추상화된 정보를 활용하여 초기의 구체적 질문에 더 효과적이고 정확하게 답하는 추론 단계가 이어진다. 이 접근법은 세부 사항에 뛰어들기 전에 더 큰 그림을 고려하도록 모델을 장려함으로써 인간의 문제 해결을 모방하며, 이를 통해 초점을 개선하고 오류를 줄이며 관련 고수준 지식에 추론의 근거를 둔다.
9.8.1. 작동 원리
그림 25에 나타난 것처럼, 한 걸음 물러서기 프롬프팅은 일반적으로 다음 단계를 포함한다:
-
• 초기 질문 분해(암묵적 또는 명시적): 이 과정은 원래 질문이 복잡성 때문에 구조화된 접근법을 필요로 한다는 인식에서 시작된다. 이는 각 “원래 질문”에 대해 “한 걸음 물러선 질문”이 존재한다는 점으로 그림 25에 암묵적으로 나타난다.
-
• 고수준 개념/원리로의 추상화: 핵심 원리는 LLM의 초점을 더 높은 추상화 수준으로 옮기는 것이다. 하나의
기본 개념 또는 원리를 대상으로 하는 “한 걸음 물러선 질문”이 생성된다. 그림 25는 각 예시의 “한 걸음 물러선 질문”을 통해 이를 명확히 보여 준다.
-
• 추상화된 정보의 검색/생성: LLM은 한 걸음 물러선 질문에 답하며 관련 정보를 검색하거나 생성한다. 그림 25의 각 예시에 있는 “한 걸음 물러선 답변”이 이 단계를 나타낸다.
-
• 추상화된 맥락에 근거한 추론: LLM에는 원래 질문, 한 걸음 물러선 질문, 한 걸음 물러선 답변이 제시된다. 그런 다음 추상화된 정보를 맥락으로 사용하여 원래 질문에 답한다. 그림 25의 “최종 답변”과 정보 흐름을 보여 주는 화살표는 이러한 근거 기반 추론을 보여 준다. 잘못된 사고 연쇄 결과와의 비교는 이 접근법의 이점을 부각한다.
-
• 추상화를 위한 퓨샷 학습: 모델은 흔히 퓨샷 예시를 활용한 인컨텍스트 학습을 통해 한 걸음 물러선 질문을 생성하도록 학습한다 [206]. 그림 25에 명시적으로 나타나지는 않지만, 관련된 한 걸음 물러선 질문의 성공적인 생성은 이러한 학습을 시사한다.
9.8.2. 한 걸음 물러서기 프롬프팅의 예시
한 걸음 물러서기 프롬프팅은 입력을 명확히 하면 더 나은 응답으로 이어질 수 있는 다음과 같은 다양한 작업에 적용할 수 있다:
-
• MMLU 물리학(이상 기체 법칙): 이 예시는 한 걸음 물러서기 프롬프팅이 공식 적용이 필요한 물리 문제를 푸는 데 어떻게 도움이 되는지 보여 준다 [27]. 원래 질문은 이상 기체의 온도와 부피 변화가 관련된 시나리오를 제시하고, 그에 따른 압력 변화를 묻는다. 이를 직접 다루려면 이상 기체 법칙 방정식을 신중하게 조작해야 하므로 계산 오류의 위험이 커진다. “이 질문의 배경이 되는 물리 원리는 무엇인가?”라는 한 걸음 물러선 질문은 모델이 먼저 관련 원리인 이상 기체 법칙(PV = nRT)을 서술하도록 한다. 계산을 시도하기 전에 지배 법칙을 명시적으로 진술함으로써 모델은 이후 추론을 잘 정의된 틀에 근거하게 하며, 정답에 도달하는 데 필요한 대수 조작과 수치 대입에서 실수할 가능성을 크게 줄인다 [2].
-
• MMLU 물리학(일반): 이 항목은 이상 기체 법칙 예시에서 사용된 접근법을 MMLU 벤치마크 내의 더 광범위한 물리 문제에 일반화한다 [174]. 이 논문은 모델이 문제와 관련된 근본 물리학 또는 화학 원리와 개념을 식별하도록 유도하는 한 걸음 물러선 질문의 사용을 제안한다. 예를 들어 운동에 관한 질문은 뉴턴 운동 법칙을 나열하는 한 걸음 물러선 응답을 이끌어 낼 수 있으며, 화학 반응에 관한 질문은 화학양론이나 평형 같은 개념의 식별을 유도할 수 있다. 이 초기 추상화 단계는 모델이 문제에 제시된 구체적 세부 정보와 수치에 관여하기 전에 관련 지식 영역을 활성화하고 개념적 토대를 확립하도록 장려하여, 더 견고하고 정확한 추론으로 이어진다.
-
• TimeQA(Estella Leopold의 교육): 이 예시는 특히 시간 제약을 다룰 때 한 걸음 물러서기 프롬프팅이 사실 기반 질의응답의 성능을 어떻게 향상하는지 부각한다 [206]. 원래 질문은 매우 구체적인 정보를 요구한다. Estella Leopold는 좁은 4개월 기간 동안 어느 학교에 다녔는가? 이에 직접 답하려면 정확한 사실을 찾는다는 보장 없이 수많은 출처를 검색해야 할 수 있다. “Estella Leopold의 교육 이력은 무엇인가?”라는 한 걸음 물러선 질문은 질의를 더 광범위하고 쉽게 이용할 수 있는 정보 집합, 즉 그녀의 전체 교육 배경을 찾도록 재구성한다. 이를 얻으면 원래의 시간 제약 질문에 대한 답을 정확히 찾아내는 일은 사소해지며, 추상화가 어려운 구체적 질의를 더 단순하고 관리하기 쉬운 질의로 변환할 수 있음을 보여 준다.
그림 25.
표준 Chain-of-Thought와 비교한 Step-Back 프롬프팅의 예시. 왼쪽은 표준 Chain-of-Thought의 잘못된 결과를 보여준다. 오른쪽은 Step-Back 과정, 즉 (1) 더 높은 수준의 질문으로 추상화, (2) 추상 질문에 답변, (3) 추상 답변을 사용하여 원래 질문에 대한 추론을 안내하는 과정을 보여준다. 이 그림은 [205]의 정보를 바탕으로 작성하였다.
-
• 지식 QA(TimeQA 및 SituatedQA) 일반: 이는 Estella Leopold 예시의 원칙을 더 광범위한 지식 집약적 QA 작업으로 확장한다 [205]. 모델은 Step-Back 프롬프팅을 사용해 보다 일반적이고 답하기 쉬운 질문을 생성하며, 이는 검색 증강 생성(RAG)의 효과를 향상시킨다. 스텝백 질문은 외부 소스에서 관련 사실을 검색하여 QA에 중요한 추가 맥락을 제공한다
-
• 모델의 내부 파라미터가 아닌 외부 지식에 의존하는 작업. 원래 질의를 확장하면 검색 과정에서 관련 구절을 찾을 가능성이 높아지고, 이는 모델 추론의 더 견고한 기반이 된다.
-
• 다중 홉 추론(일반): 이 범주는 여러 단계의 추론이 필요한 작업에 Step-Back 프롬프팅 기법을 적용한다 [205]. 지식 QA 시나리오와 마찬가지로 모델은
원래 질의를 단순화하는 스텝백 질문을 생성하도록 프롬프트된다. 이 추상 질문은 원래 질문과 함께 관련 정보를 검색하는 데 사용된다(RAG를 사용하는 경우). 핵심 아이디어는 복잡한 추론 과정을 초기 추상화 단계와 그 추상화에 근거한 후속 추론으로 분해하면 다중 홉 추론을 더 관리하기 쉽고 오류가 덜 발생하게 만든다는 것이다.
-
• GSM8K: 이 절은 대조점을 제시한다. 저자들은 Step-Back 프롬프팅이 동일한 개선을 제공하지 않았음을 발견했다 [207]. GSM8K 내 문제는 상대적으로 단순하기 때문에, 이 기법은 결과를 유의미하게 개선하지 못했지만 성능을 저해하지도 않았다.
9.8.3. 한 걸음 물러서기 프롬프팅의 장점
-
• 복잡한 추론 작업에서의 정확도 향상: 이는 다양한 벤치마크에서 일관되게 입증된 주요 장점이다 [2,208]. 모델이 먼저 고수준 개념과 원칙을 고려하도록 강제함으로써, 이후의 세부 추론 단계에서 오류가 발생할 가능성을 줄인다.
-
• 향상된 지식 검색: 검색 증강 생성(RAG)의 이점을 얻는 작업에서 스텝백 질문은 더 나은 검색 질의로 작용한다 [121,209]. 더 일반적이고 추상적인 질문은 지식 기반의 관련 구절과 일치할 가능성이 높아, 더 정확하고 관련성 높은 정보로 이어진다.
-
• 환각 감소: 확립된 원칙과 검색된 사실에 추론을 근거하게 함으로써, 모델이 잘못된 정보를 환각할 가능성이 낮아진다 [210].
-
• 더 견고한 추론: 기본 원칙을 명시적으로 기술하면 모델의 추론 과정이 더 견고해진다 [28].
-
• 샘플 효율적인 추상화 학습: 모델은 최소한의 예시로 스텝백 질문을 생성하는 방법을 학습할 수 있으며, 강력한 퓨샷 학습 능력을 보여준다 [208].
-
• 병목으로서의 추론 식별: 추상화는 LLM에 더 쉽지만, 추론은 여전히 중요한 과제이다 [2]. 이는 LLM 역량 개선의 필요성을 강조한다.
9.8.4. 한 걸음 물러서기 프롬프팅의 한계
-
•
추상화 품질에 대한 의존성:
이 방법의 성공은 LLM이 의미 있는 스텝백 질문을 생성하는 데 달려 있다 [28,208]. 모호하거나 관련 없거나 잘못된 부실한 추상화는, 모델이 핵심 원칙을 식별하지 못하는 "원칙 오류" 사례에서 볼 수 있듯이 성능을 저해할 수 있다.
-
•
과도한 일반화 가능성:
추상화는 지나치게 광범위한 스텝백 질문으로 이어져, 추론 중 모델을 혼란스럽게 하는 관련 없는 세부 사항을 도입할 수 있다 [2].
-
•
계산 오버헤드:
Step-Back 프롬프팅은 추가 질문 생성, 정보 검색 및 추론을 요구하여 지연 시간과 리소스 사용량을 증가시킨다 [209].
-
• 추론은 여전히 병목: 추상화 단계를 거쳐도 LLM의 추론 능력은 여전히 주요 한계이다 [210]. 오류 분석에 따르면, 최종 추론 단계에서 스텝백 질문에 성공적으로 답한 후에 많은 오류가 발생한다.
9.9. 텍스트-이미지 생성용 프롬프트 엔지니어링
LLM으로 좋은 원하는 이미지를 생성하려면 사용자는 흔히 반복적인 개선이 필요하다. 이미지의 일부나 특성이 사용자에게 바람직하지 않을 때 사용자는 원하는 개선 사항을 언급하며 다시 요청해야 한다 [211]. 또한 좋은 결과를 위해 프롬프트는 상세하고 이해하기 쉬우며 간결해야 한다 [78]. 그림 1의 이미지 생성 과정은 프롬프트 엔지니어링을 통해 원하는 이미지를 생성하는 예시이다. 연구자들은 이미지 생성에도 RAG를 사용하고 있다. 사슴에는 서로 다른 유형이 존재하므로, 다른 많은 객체도 서로 다른 이미지를 가질 수 있다. 예를 들어, "차 안의 강아지"는 사용자가 선호하지 않는 특별한 유형의 차를 생성할 수 있다. 원하는 차의 이미지를 제공하면
생성된 이미지를 사용자가 더 수용할 수 있게 된다 [212].
10. 프롬프트 엔지니어링 기법의 정성적 비교
프롬프트 엔지니어링은 다양한 기법을 포괄하며, 각 기법은 뚜렷한 장점, 한계 및 최적의 적용 분야를 지닌다. 다양한 작업에서 대규모 언어 모델의 성능을 극대화하려면 적절한 기법을 선택하는 것이 중요하다. 이 절에서는 주요 프롬프팅 방법을 정성적으로 비교하고, 구현 용이성, 계산 효율성 및 다양한 도메인에서의 효과를 평가한다. 표 6은 이러한 기법을 요약하여 장점, 제약 사항 및 일반적인 사용 사례를 제시한다.
이러한 기법을 더 잘 이해하기 위해 단순성 대 복잡성, 정확도와 제어, 지식 통합 등 여러 핵심 차원을 기준으로 분류할 수 있다. 아래에서는 프롬프트 엔지니어링에서 단순성과 복잡성 간의 상충 관계부터 시작해 이러한 차원을 자세히 살펴본다.
-
• 구조화된 데이터 처리: 전통적인 언어 기반 프롬프트는 구조화된 데이터 추론에 어려움을 겪는 경우가 많다. Chain-of-Table [133]은 중간 표 형식 추론 단계를 활용하여 LLM의 구조화된 정보 해석 능력을 향상시키고, 수치 및 관계 추론을 개선한다. 마찬가지로 CoS [104]는 자연어를 기호 표현으로 대체하여 데이터 분석, 논리적 추론 및 관계 추론을 개선한다. 이러한 접근 방식은 모호성을 줄이고 해석 가능성을 높여 재무 기록, 관계형 데이터베이스 및 과학 표와 같은 구조화된 데이터셋을 더 효과적으로 처리할 수 있게 한다. 또한 이러한 기법을 SQL 기반 질의 및 구조화된 스키마…와 같은 프롬프팅 전략과 통합하면
-
• 해석 가능성: 고위험 응용 분야에서는 LLM의 추론 과정을 이해하는 것이 필수적이다. Chain-of-Thought (CoT) [2], Logical CoT [213], S2A [115]와 같은 기법은 추론 단계를 구조화하고 관련 없는 내용을 필터링하여 투명성을 높인다. 이러한 방법은 설명 가능성을 개선하여 의료, 금융, 법률과 같은 중요한 도메인에서 신뢰와 신뢰성을 증진한다.
-
• 구조화된 프레임워크: 서로 다른 프롬프팅 전략이 복잡성, 정확도 및 적응성 측면에서 어떻게 비교되는지 이해하려면 구조화된 프레임워크가 필수적이다. 아래에서는 주요 기법을 정의적 속성에 따라 분류한다.
-
• 단순성 대 복잡성: Zero-Shot [1] 및 Few-Shot 프롬프팅 [5]과 같은 기초적 접근 방식은 비교적 간단하며 최소한의 도메인 전문 지식만 필요로 한다. 반면 Chain-of-Thought (CoT) [2], Tree-of-Thoughts (ToT) [105], Graph-of-Thought (GoT) [109]와 같은 고급 방법은 복잡한 프롬프트 설계와 작업에 대한 더 깊은 이해를 요구하며, 종종 더 많은 계산 리소스가 필요하다.
-
• 정확도와 제어: Zero-Shot 프롬프팅은 다용성을 제공하지만, 더 구조화된 기법의 정밀도가 부족한 경우가 많다 [27]. Few-Shot 프롬프팅은 예시를 포함하여 정확도를 향상시키지만 [5], 그 효과는 신중한 예시 선택에 달려 있다 [214]. CoT와 그 확장은 체계적인 문제 해결을 통해 모델을 안내하여 추론 정확도를 높인다 [2]. 또한 Logical CoT [213] 및 Chain-of-Verification [129]과 같은 방법은 복잡성이 증가하는 대신 논리적 일관성을 높이고 환각을 완화하도록 특별히 설계되었다.
-
• 지식 통합: 지식 집약적 응용을 위해 검색 증강 생성(RAG) [40]은 LLM이 외부 소스에서 정보를 얻도록 하여 정적 학습 데이터의 한계를 극복하게 한다. Chain-of-Knowledge [215]는 외부 소스를 더욱 구조화하여 전문 도메인 전반에서 성능을 향상시킨다.
표 6
기법 비교: 장점, 한계 및 사용 사례.
|
기법
|
장점
|
한계
|
사용 사례
|
|
Zero-Shot 프롬프팅
|
유연성 작업별 학습 불필요 신속한 배포 일반화 테스트
|
Few-Shot보다 낮은 성능 사전 학습 지식 의존 성능 변동성
|
분류 번역 생성 분석
|
|
Few-Shot 프롬프팅
|
향상된 정확도 더 나은 적응성 출력에 대한 더 많은 제어
|
예시 민감성 토큰 사용량 증가 항상 최적은 아님
|
텍스트 분류 번역 코드 생성 질의응답
|
|
Chain-of-Thought (CoT) 프롬프팅
|
향상된 추론 더 나은 해석 가능성
|
토큰 사용량 증가 품질 의존성
|
수학 문제 해결 논리적 추론 상식적 추론
|
|
자동 CoT (Auto-CoT)
|
향상된 정확도 일반화
|
불필요함
|
수학적 추론 논리적 연역
|
|
자동 CoT (LogiCoT)
|
자동화 향상된 일반화
|
잘못된 추론 가능성 계산 비용 증가 데이터 품질 의존성
|
사실 기반 질의응답 수학적 논리 연역적 추론
|
|
논리적 CoT (LogiCoT)
|
향상된 논리적 추론 정확도 향상 해석 가능성 향상 지식 통합
|
복잡성 계산 비용 지식 의존성
|
제약 조건 기반 추론
|
|
Self-Consistency
|
향상된 정확도 견고성 다목적성 해석 가능성
|
계산 비용 다양성 의존성
|
다단계 산술 상식 추론 기호 추론
|
|
Retrieval Augmented Generation (RAG)
|
향상된 정확도 지식 접근성
|
검색 품질 계산 비용 편향 및 잡음
|
개방형 도메인 QA 지식 집약적 추론 사실 검증
|
|
ReAct
|
동적 문제 해결 지식 습득 향상된 정확도 설명 가능성
|
복잡성 계산 비용 안전성 우려
|
대화형 문제 해결 지식 기반 QA 불확실성을 고려한 의사 결정
|
|
Chain-of-Verification (CoVe)
|
향상된 정확도 감소한 환각
|
계산 비용 검증 효과성
|
질의응답 요약 코드 생성
|
|
Automatic Prompt Engineer (APE)
|
향상된 신뢰성 적응성 자동화 효율성 적응성 성능 향상
|
제한된 범위 평가 과제 계산 비용 편향 및 일반화
|
질의응답 텍스트 요약 코드 생성 대화 생성
|
-
• 적응성 및 자동화: 정적 프롬프트의 제약을 해결하기 위해 Active Prompting [152] 및 Automatic Prompt Engineer (APE) [216]와 같은 동적 접근법은 LLM이 프롬프트를 반복적으로 개선하여 성능을 최적화하고 프롬프트 설계를 자동화할 수 있게 한다. 프롬프트 엔지니어링의 효과성은 본질적으로 작업 의존적이므로 정확도, 계산 효율성 및 적응성을 기반으로 신중하게 선택해야 한다. 프롬프트 구성은 LLM 성능에 상당한 영향을 미치므로 서로 다른 작업에는 맞춤형 전략이 요구된다. 이 정성적 비교는 연구자와 실무자가 자신의 전략을 LLM의 구체적 역량에 맞출 수 있도록 정보에 기반한 의사 결정의 토대를 제공한다. 향후 연구는 이러한 방법론의 개선, 표준화된 평가 프레임워크 개발, 그리고 보다 효율적인 프롬프트 최적화를 위한 자동화 기법 탐구에 초점을 맞춰야 한다 [217].
10.1. 평가 지표
프롬프트 효과성은 일반적으로 다운스트림 작업 정확도(예: GSM8K, MMLU)를 사용하여 측정된다. 그러나 사소한 프롬프트 변형도 추론 성능에 상당한 영향을 미치므로 정확도만으로는 추론 안정성이나 견고성을 포착할 수 없다 [218]. 향후 평가에는 안정성, 토큰 효율성 및 일관성 지표가 포함되어야 한다.
10.2. 견고성 및 재현성
견고성이란 작은 프롬프트 교란에도 출력이 안정적으로 유지되는 것을 의미한다. 실증 연구는 프롬프트의 순서와 표현 방식에 대한 높은 민감도를 보여준다 [219]. 확률적 디코딩과 문서화되지 않은 하이퍼파라미터는 재현성에도 영향을 미치므로 표준화된 보고 프로토콜이 필요하다.
11. 프롬프트 엔지니어링 기법의 응용 기반 분류체계
프롬프트 엔지니어링은 대규모 언어 모델(LLM)의 성능을 최적화하는 핵심 분야로 빠르게 부상했다. 프롬프팅 기법의 다양성은 다양한 응용 영역에서 뚜렷한 장점을 제공하며, 각 기법은 특정한 계산 및 추론 요구를 충족한다. 이러한 방법론의 체계적인 분류는 연구자와 실무자의 정보에 기반한 의사 결정을 촉진하여 각자의 작업에 가장 효과적인 접근법을 선택할 수 있게 한다. 표 7은 프롬프트의 체계적인 분류체계를 제시한다
표 7
프롬프트 엔지니어링의 기술적 지형.
|
구현 영역
|
효율적인 프롬프팅 전략
|
|
자동화된 텍스트 분류
|
Zero-Shot Prompting, Few-Shot Prompting
|
|
신경망 기계 번역 (NMT)
|
Zero-Shot Prompting, Few-Shot Prompting
|
|
콘텐츠 생성 및 확장
|
Zero-Shot Prompting, Few-Shot Prompting, Tree-of-Thoughts (ToT)
|
|
데이터 해석 및 요약
|
Zero-Shot Prompting
|
|
수학적 모델 추론
|
Chain-of-Thought (CoT), Auto-CoT, Chain-of-Note (CoN), Active-Prompt
|
|
기호 및 논리적 연역
|
Chain-of-Thought (CoT), Auto-CoT, Logical CoT (LogiCoT), Chain-of-Note (CoN), Active-Prompt
|
|
상식적 의사 결정
|
Chain-of-Thought (CoT), Self-Consistency, Thread-of-Thought (ThoT), Active-Prompt
|
|
다단계 계산 추론
|
Self-Consistency
|
|
전략적 게임 계획
|
Tree-of-Thoughts (ToT)
|
|
AI 지원 코드 합성
|
Few-Shot Prompting, Tree-of-Thoughts (ToT), Chain-of-Verification (CoVe), Auto Prompt Engineer (APE)
|
|
인지적 의사 결정 최적화
|
System 2 Attention
|
|
복잡한 질의응답 (QA)
|
Chain-of-Verification (CoVe)
|
|
구조화된 데이터 분석
|
Chain-of-Table
|
|
QA를 위한 정보 검색
|
Retrieval Augmented Generation (RAG)
|
|
작업 지향적 문제 해결
|
ReAct
|
|
계산 정리 증명
|
Chain-of-Note (CoN)
|
|
과학 지식 종합
|
Chain-of-Knowledge (CoK)
|
엔지니어링 전략을 최적의 사용 사례에 매핑한다. 이러한 분류는 각 기법의 기능적 범위를 명확하게 이해하도록 하여, 더욱 효율적이고 맥락적으로 적합한 NLP 솔루션 개발을 돕는다. Zero-Shot 및 Few-Shot Prompting과 같은 기본 접근법은 사전 맥락화가 거의 필요하지 않은 분류 및 번역 작업에서 뛰어난 효능을 보인다 [1,5]. 더 복잡한 문제 해결 시나리오에서는 Chain-of-Thought (CoT) [220], Logical CoT (LogiCoT) [213], Active-Prompt [152]와 같은 구조화된 방법론이 추론 정확도를 크게 향상한다. 이러한 기법은 복잡한 질의를 중간 인지 단계로 분해하여 인간의 분석 과정을 모방한다. LogiCoT는 연역적 추론을 강화하기 위해 논리적 제약을 통합하고, Active-Prompt는 응답을 동적으로 정제한다
반복적 피드백 메커니즘을 통해 대화형 애플리케이션에서 효과적임이 입증된다.
Tree-of-Thoughts (ToT) [105] 및 Graph-of-Thought (GoT) [109]와 같은 최첨단 프롬프팅 패러다임은 창의성, 과학적 추론, 협업 지능이 요구되는 분야에서 핵심적인 역할을 한다. Retrieval-Augmented Generation (RAG)은 외부 지식 소스를 통합하여 개방형 질의에 대한 응답을 혁신했으며, Chain-of-Verification (CoVe)는 요약 및 코드 생성에서 사실적 일관성을 향상한다. 이러한 기법은 LLM의 추론 역량을 크게 증대하여 다양한 애플리케이션 전반에서 더 정밀하고 맥락 인식적이며 신뢰할 수 있는 출력을 가능하게 한다. 또한 구조화된 데이터 분석은 표 형식 및 기호 데이터에 대한 논리 연산을 용이하게 하는 Chain-of-Table [133] 및 Chain-of-Symbol (CoS) [104]과 같은 전문 프레임워크의 이점을 얻는다. 불확실한 환경의 의사결정 모델은 추론과 실시간 행동 수행을 원활하게 통합하는 ReAct [42]와 같은 방법론을 활용한다. 이러한 발전은 종합적으로 LLM을 더 높은 적응성, 정밀성 및 맥락 이해로 이끌며, 광범위한 계산 작업 전반에 적용할 수 있음을 강화했다. 이러한 기법을 체계적으로 분류함으로써 연구자와 실무자는 효율성, 해석 가능성 및 도메인별 정확도의 균형을 맞추면서 성능을 극대화하는 프롬프팅 방법론을 전략적으로 배포할 수 있다. 구조화된 참고를 위해 표 7은 기법을 각 도메인에 매핑하여 언어 모델 성능 최적화를 위한 의사결정을 돕는다. 이 표는 Chain-of-Thought, Retrieval-Augmented Generation 및 Tree-of-Thoughts와 같은 기법이 추론, 생성 및 문제 해결을 어떻게 향상하는지 강조하며, 계산 도메인 전반에서 더 효율적이고 정확한 LLM 배포에 기여한다. 각 방법의 강점과 한계를 이해함으로써 사용자는 효율성, 해석 가능성 및 정확성의 균형을 맞춰 다양한 NLP 작업에 맞는 프롬프트 선택을 최적화할 수 있다.
12. 비판적 종합 및 절충
프롬프팅 기법은 구조가 서로 다르지만, 그 효과는 추론 제어, 견고성, 계산 비용이라는 세 가지 핵심 요인에 의해 좌우된다.
Zero-shot 프롬프팅은 신속한 배포를 가능하게 하지만 다단계 추론 작업에서 불안정성을 보인다 [27]. Few-shot 프롬프팅은 시연을 통해 작업 정렬을 개선하지만 토큰 오버헤드를 증가시키며 예시 선택에 여전히 민감하다 [5,100].
Chain-of-Thought (CoT)는 중간 단계를 유도하여 추론 정확도를 크게 향상한다 [2]. 그러나 오류 전파 위험과 추론 지연 시간 증가를 초래한다. Self-consistency는 여러 추론 체인을 집계하여 단일 경로 추론 오류를 완화하지만 [97], 계산 비용이 상당히 더 높다.
Tree-of-Thoughts는 추론을 구조화된 탐색 공간으로 확장하여 계획 집약적 작업의 성능을 개선한다 [105]. 그럼에도 확장성 및 메모리 제약은 실제 배포를 제한한다.
전반적으로 어떤 단일 프롬프팅 패러다임도 보편적으로 최적은 아니다. 프롬프트 설계는 작업 복잡도와 자원 제약에 따라 해석 가능성, 안정성 및 효율성의 균형을 요구한다.
12.1. 자동화된 프롬프트 최적화
수동 프롬프트 설계는 휴리스틱적이며 불안정하다. Automatic Prompt Engineer (APE)와 같은 자동화 방법은 모델 기반 탐색을 통해 프롬프트를 생성하고 정제한다 [157]. 강화 학습 접근법은 작업별 목표에 맞춰 프롬프트를 추가로 최적화한다. 그러나 이러한 방법은 여전히 계산 비용이 높고 이론적 안정성 보장이 없다.
13. 결론 및 연구 의제
이 조사는 기초 프롬프팅(zero-shot, few-shot), 추론 중심 방법(CoT, Self-Consistency, ToT, GoT)을 아우르는 구조화된 분류 체계를 통해 프롬프트 및 컨텍스트 엔지니어링을 종합했다.
검증 기반 프레임워크(CoVe) 및 시스템 수준의 컨텍스트 오케스트레이션(RAG, ReAct, 메모리 증강 시스템).
GSM8K, MMLU 및 지식 집약적 QA와 같은 벤치마크 전반의 증거는 추론 구조화 프롬프팅(예: CoT, Self-Consistency, ToT)이 다단계 추론 정확도를 일관되게 개선함을 보여준다. 그러나 이러한 이득에는 토큰 소비 증가, 추론 지연 시간 및 프롬프트 문구에 대한 민감성이 수반된다. 검색 기반 방법은 외부 지식에 생성을 근거화하여 환각을 줄이지만, 검색 잡음, 순위 불안정성 및 컨텍스트 윈도우 포화 문제를 초래한다.
문헌의 핵심 공백은 표준화된 평가 프로토콜의 부재이다. 현재 연구는 주로 작업 수준 정확도를 보고하는 반면, 프롬프트 교란에 대한 견고성, 토큰 효율성, 디코딩 전략 전반의 재현성 및 장기 상호작용에서의 배포 안정성을 간과한다. 따라서 안정성, 효율성 및 사실적 일관성 지표를 통합한 벤치마크 표준을 수립하는 것이 필수적이다.
프롬프트 엔지니어링의 궤적은 자동화와 시스템 수준 오케스트레이션으로 이동하고 있다. 자동화된 프롬프트 최적화, 검색 근거화 파이프라인 및 에이전트형 추론 프레임워크는 수동 언어 정제에서 구조화된 제어 아키텍처로의 전환을 나타낸다. 그러나 자동화는 계산 오버헤드, 평가 잡음, 프롬프트 인젝션 및 탈옥 공격과 같은 보안 취약성을 포함한 새로운 제약을 도입한다.
배포 관점에서 컨텍스트 윈도우 제한, 추론 비용, 검색 지연 시간 및 정렬 안전장치와 같은 실용적 제약은 통제된 벤치마킹 환경에서 여전히 충분히 연구되지 않았다. 이 격차를 해소하려면 고립된 프롬프트-출력 테스트가 아니라 실제 파이프라인 제약을 반영하는 평가 환경이 필요하다.
제안된 분류 체계에 맞춰 향후 연구는 다음에 초점을 맞춰야 한다: (i) 견고성 인식 프롬프팅 전략, (ii) 토큰 효율적 추론 메커니즘, (iii) 표준화된 교차 모델 벤치마킹 프레임워크, (iv) 안전한 컨텍스트 관리, (v) 이론적 보장에 기반한 확장 가능한 자동화 방법.
프롬프트 엔지니어링은 입력 수준의 지시 조정에서 전체 컨텍스트 수명 주기 오케스트레이션으로 진화하고 있다. 그 다음 단계는 개선된 추론 기법뿐 아니라 원칙에 기반한 표준화, 재현 가능한 평가 및 배포 인식 시스템 설계에도 달려 있다.
이해관계 충돌 선언
저자들은 본 논문에 보고된 연구에 영향을 미친 것으로 보일 수 있는 알려진 경쟁적 재정적 이해관계 또는 개인적 관계가 없음을 선언한다. 저자는 이 저널의 편집위원/편집장/부편집장/객원 편집자이며, 본 논문의 편집 검토 또는 게재 결정에 관여하지 않았다.
데이터 가용성
본 논문에서 설명한 연구에는 데이터가 사용되지 않았다.
참고문헌
-
[1] A. Radford, J. Wu, R. Child, D. Luan, D. Amodei, I. Sutskever, et al., Language models are unsupervised multitask learners,
OpenAI blog
1 (8) (2019) 9.
-
[2] J. Wei, X. Wang, D. Schuurmans, M. Bosma, F. Xia, E. Chi, Q.V. Le, D. Zhou, et al., Chain-of-thought prompting elicits reasoning in large language models,
Adv. Neural Inf. Process. Syst.
35 (2022) 24824–24837.
-
[3] F. Eskandari, Z. Roozbahani, A review of prompt engineering methods in large language models,
Eng. Manag. Soft Comput.
10 (2) (2025) 1–35.
-
[4] J. Wang, Z. Liu, L. Zhao, Z. Wu, C. Ma, S. Yu, H. Dai, Q. Yang, Y. Liu, S. Zhang, et al., Review of large vision models and visual prompt engineering,
Meta-Radiol.
1 (3) (2023) 100047.
-
[5] T. Brown, B. Mann, N. Ryder, M. Subbiah, J.D. Kaplan, P. Dhariwal, A. Neelakantan, P. Shyam, G. Sastry, A. Askell, et al., Language models are few-shot learners,
Adv. Neural Inf. Process. Syst.
33 (2020) 1877–1901.
-
[6] J. Huang, K.C.C. Chang, Towards reasoning in large language models: a survey, in: Findings of the Association for Computational Linguistics: ACL 2023, 2023, pp. 1049–1065.
-
[7] A. Madaan, S. Zhou, U. Alon, Y. Yang, G. Neubig, Language models of code are few-shot commonsense learners, in: Proceedings of the 2022 Conference on Empirical Methods in Natural Language Processing, 2022, pp. 1384–1403.
-
[8] M.N.A. Siddiky, M.E. Rahman, M. Hossen, M.R. Rahman, M.S. Jaman, Optimizing AI language models: a study of ChatGPT-4 vs. ChatGPT-4o. Preprints org, 2025.
-
[9] G. Macilenti, A. Stellato, M. Fiorelli, Prompting is not all you need evaluating GPT-4 performance on a real-world ontology alignment use case, Procedia Comput. Sci. 246 (2024) 1289–1298.
-
[10] K. Shanuka, J. Wijayanayake, K. Vidanage, Systematic literature review on analyzing the impact of prompt engineering on efficiency, code quality, and security in CRUD application development, J. Desk Res. Rev. Anal. 2 (1) (2024).
-
[11] D. Lee, J. Lee, D. Shin, GPT prompt engineering for a large language model-based process improvement generation system, Korean J. Chem. Eng. 41 (12) (2024) 3263–3286.
-
[12] Q. Ma, W. Peng, C. Yang, H. Shen, K. Koedinger, T. Wu, What should we engineer in prompts? Training humans in requirement-driven LLM use, ACM Trans. Comput.-Hum. Interact. 32 (4) (2025) 1–27.
-
[13] P. Sriphon, P. Khunwipusit, B.M. Emmanuel, I. Sereewatthanawut, Evaluating the impact of model scale and prompting strategies on corruption allegation classification using Thai-specialized Typhoon2 language models, Mach. Learn. Appl. (2025) 100743.
-
[14] S. Sun, X. Pan, S. Qi, J. Gao, Knowledge enhanced prompt learning framework for financial news recommendation, Pattern Recognit. 163 (2025) 111461.
-
[15] R. Deshmukh, R. Raut, M. Bhavsar, S. Gurav, Y. Patil, Optimizing human-ai interaction: innovations in prompt engineering, in: 2025 3rd International Conference on Intelligent Data Communication Technologies and Internet of Things (IDCIoT), IEEE, 2025, pp. 1240–1246.
-
[16] H. Guo, L. Zhang, X. Feng, Q. Zheng, A review of the application of prompt engineering in the safety of large language models, in: Proceedings of the 2024 2nd International Conference on Information Education and Artificial Intelligence, 2024, pp. 424–430.
-
[17] A. Della Porta, G. Recupito, S. Lambiase, D. Di Nucci, F. Palomba, Unlocking code simplicity: the role of prompt patterns in managing LLM code complexity, in: 2025 IEEE International Conference on Software Analysis, Evolution and Reengineering-Companion (SANER-C), IEEE, 2025, pp. 140–143.
-
[18] S. Pan, L. Luo, Y. Wang, C. Chen, J. Wang, X. Wu, Unifying large language models and knowledge graphs: a roadmap, IEEE Trans. Knowl. Data Eng. 36 (7) (2024) 3580–3599.
-
[19] C.K.K. Reddy, P. Anoushka, A. Draksharapu, S. Doss, Beyond text: analyzing artificial intelligence models through prompt engineering, Future tech startups innov. age AI (2024) 120–156.
-
[20] Z. Ji, N. Lee, R. Frieske, T. Yu, D. Su, Y. Xu, E. Ishii, Y.J. Bang, A. Madotto, P. Fung, Survey of hallucination in natural language generation, ACM Comput. Surv. 55 (12) (2023) 1–38.
-
[21] S. Tonmoy, S. Zaman, V. Jain, A. Rani, V. Rawte, A. Chadha, A. Das, A comprehensive survey of hallucination mitigation techniques in large language models, arXiv preprint arXiv:240101313, 2024;6.
-
[22] M.T. Khalid, A.P. Witmer, Prompt engineering for large language model-assisted inductive thematic analysis, Soc. Sci. Comput. Rev. (2025) 08944393251388098.
-
[23] A. Remadi, K. El Hage, Y. Hobeika, F. Bugiotti, To prompt or not to prompt: navigating the use of large language models for integrating and modeling heterogeneous data, Data Knowl. Eng. 152 (2024) 102313.
-
[24] T. Tang, J. Li, W.X. Zhao, J.R. Wen, Context-tuning: learning contextualized prompts for natural language generation, in: Proceedings of the 29th International Conference on Computational Linguistics, 2022, pp. 6340–6354.
-
[25] L. Mei, J. Yao, Y. Ge, Y. Wang, B. Bi, Y. Cai, J. Liu, M. Li, Z.Z. Li, D. Zhang, et al., A survey of context engineering for large language models, arXiv preprint arXiv:250713334, 2025.
-
[26] Y. Deng, W. Zhang, Z. Chen, Q. Gu, Rephrase and respond: let large language models ask better questions for themselves, arXiv preprint arXiv:231104205, 2023.
-
[27] T. Kojima, S.S. Gu, M. Reid, Y. Matsuo, Y. Iwasawa, Large language models are zero-shot reasoners, Adv. Neural Inf. Process. Syst. 35 (2022) 22199–22213.
-
[28] O. Press, M. Zhang, S. Min, L. Schmidt, N.A. Smith, M. Lewis, Measuring and narrowing the compositionality gap in language models, in: Findings of the Association for Computational Linguistics: EMNLP 2023, 2023, pp. 5687–5711.
-
[29] R.S.R. Mekala, Y. Razeghi, S. Singh, EchoPrompt: instructing the model to rephrase queries for improved in-context learning, in: Proceedings of the 2024 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies (Volume 2: Short Papers), 2024, pp. 399–432.
-
[30] Q. Tian, H. Zhu, L. Wang, Y. Li, Y. Lan, R3 prompting: review, rephrase and resolve for chain-of-thought reasoning in large language models under noisy context, in: Findings of the Association for Computational Linguistics: EMNLP 2023, 2023, pp. 1670–1685.
-
[31] R. Cantini, C. Cosentino, F. Marozzo, D. Talia, P. Trunfio, Harnessing prompt-based large language models for disaster monitoring and automated reporting from social media feedback, Online Soc. Netw. Media 45 (2025) 100295.
-
[32] N.F. Liu, K. Lin, J. Hewitt, A. Paranjape, M. Bevilacqua, F. Petroni, P. Liang, Lost in the middle: how language models use long contexts, Trans. Assoc. Comput. Linguist. 12 (2024) 157–173.
-
[33] P.F. Christiano, J. Leike, T. Brown, M. Martic, S. Legg, D. Amodei, Deep reinforcement learning from human preferences, Adv. Neural Inf. Process. Syst. 30 (2017).
-
[34] C.F. Atkinson, Human in the loop chain of code prompting for deterministic tool development with generative AI, Discov. Artif. Intell. 6 (2026) 61,
https://doi.org/10.1007/s44163-025-00704-z
-
[35] F. Perez, I. Ribeiro, Ignore previous prompt: attack techniques for language models, arXiv preprint arXiv:221109527, 2022.
-
[36] Y. Liu, G. Deng, Y. Li, K. Wang, Z. Wang, X. Wang, T. Zhang, Y. Liu, H. Wang, Y. Zheng, et al., Prompt injection attack against LLM-integrated applications, arXiv preprint arXiv:230605499, 2023.
-
[37] J. Piet, M. Alrashed, C. Sitawarin, S. Chen, Z. Wei, E. Sun, B. Alomair, D. Wagner, Jatmo: 과업별 미세 조정을 통한 프롬프트 주입 방어, in: European Symposium on Research in Computer Security, Springer, 2024, pp. 105–124.
-
[38] B. Ahmad, S. Thakur, B. Tan, R. Karri, H. Pearce, 대규모 언어 모델 프롬프팅을 통한 하드웨어 보안 버그 코드 수정에 관하여, IEEE Trans. Inf. Forensics Secur. 19 (2024) 4043–4057.
-
[39] S.K. Nandi, R. Ratti, S.R. Singh, S. Nandi, 프롬프트 엔지니어링 기반 네트워크 침입 탐지 시스템, IEEE Access 13 (2025) 190859–190871.
-
[40] P. Lewis, E. Perez, A. Piktus, F. Petroni, V. Karpukhin, N. Goyal, H. Küttler, M. Lewis, W.T. Yih, T. Rocktäschel, et al., 지식 집약적 NLP 과업을 위한 검색 증강 생성, Adv. Neural Inf. Process. Syst. 33 (2020) 9459–9474.
-
[41] G. Izacard, P. Lewis, M. Lomeli, L. Hosseini, F. Petroni, T. Schick, J. Dwivedi-Yu, A. Joulin, S. Riedel, E. Grave, 검색 증강 언어 모델을 활용한 퓨샷 학습, arXiv preprint arXiv:220803299, 2022;1(2):4.
-
[42] S. Yao, J. Zhao, D. Yu, N. Du, I. Shafran, K.R. Narasimhan, Y. Cao, React: 언어 모델에서 추론과 행동의 시너지, in: The Eleventh International Conference on Learning Representations, 2022, pp. 1–33.
-
[43] A. Madaan, N. Tandon, P. Gupta, S. Hallinan, L. Gao, S. Wiegreffe, U. Alon, N. Dziri, S. Prabhumoye, Y. Yang, et al., Self-refine: 자기 피드백을 활용한 반복적 개선, Adv. Neural Inf. Process. Syst. 36 (2023) 46534–46594.
-
[44] Y. Chen, F. Xue, D. Li, Q. Hu, L. Zhu, X. Li, Y. Fang, H. Tang, S. Yang, Z. Liu, et al., Longvila: 장편 비디오를 위한 장문맥 시각 언어 모델의 확장, arXiv preprint arXiv:240810188, 2024.
-
[45] S. Chakraborty, R. Tomsett, R. Raghavendra, D. Harborne, M. Alzantot, F. Cerutti, M. Srivastava, A. Preece, S. Julier, R.M. Rao, et al., 딥러닝 모델의 해석 가능성: 결과에 대한 설문, in: 2017 IEEE Smartworld, Ubiquitous Intelligence & Computing, Advanced & Trusted Computed, Scalable Computing & Communications, Cloud & Big Data Computing, Internet of People and Smart City Innovation (Smartworld/SCALCOM/UIC/ATC/CBDcom/IOP/SCI), IEEE, 2017, pp. 1–6.
-
[46] H.D. Kabir, 배경 정보를 활용한 클래스 활성화 불확실성 감소, IEEE Trans. Artif. Intell. 7 (1) (2026) 571–585,
https://doi.org/10.1109/TAI.2025.3570282
-
[47] S. Joshi, 금융 분야 프롬프트 엔지니어링 기법 검토: 사고 연쇄, 사고 트리 및 사고 그래프 접근법의 평가, Tree-of-Thought Graph-of-Thought Approaches (January 31 2025) (2025).
-
[48] D.E. Frederick, Prompt engineerin
[64] I.W. Syahputri, E.K. Budiardjo, P.O.H. Putra, 소프트웨어 엔지니어링에서 프롬프트 엔지니어링 패러다임의 잠재력 실현: 체계적 문헌 검토,
AI 6
(9) (2025) 206.
[65] H. Zhou, C. Hu, D. Yuan, Y. Yuan, D. Wu, X. Chen, H. Tabassum, X. Liu, 무선 네트워크를 위한 대규모 언어 모델: 프롬프트 엔지니어링 관점에서의 개요,
IEEE Wirel. Commun.
32 (4) (2025) 98–106,
https://doi.org/10.1109/MWC.001.2400384
[66] K. Ronanki, S. Arvidsson, J. Axell, 요구사항 엔지니어링에서 대규모 언어 모델 사용을 위한 프롬프트 엔지니어링 지침, in:
Euromicro Conference on Software Engineering and Advanced Applications
, Springer, 2025, pp. 245–262.
[67] A. Singh, N.K. Chatta, A. Ehtesham, S. Kumar, G.K. Gupta, T.T. Khoei, 프롬프트 엔지니어링 기법의 SWOT 분석에 관한 체계적 문헌 검토,
IEEE Trans. Artif. Intell.
7 (5) (2026) 2447–2461,
https://doi.org/10.1109/TAI.2025.3626467
[68] M. Naser, 대규모 언어 모델을 위한 프롬프트 엔지니어링 기법 검토,
Int. J. Hum.-comput. Interact.
(2025) 1–35.
[69] J. Liu, D. Zhu, Z. Bai, Y. He, H. Liao, H. Que, Z. Wang, C. Zhang, G. Zhang, J. Zhang, et al., 장문맥 언어 모델링에 관한 포괄적 설문,
arxiv:2503.17407
, 2025.
[70] L. Reynolds, K. McDonell, 대규모 언어 모델을 위한 프롬프트 프로그래밍: 퓨샷 패러다임을 넘어, in:
Extended Abstracts of the 2021 CHI Conference on Human Factors in Computing Systems
, 2021, pp. 1–7.
[71] B. Lester, R. Al-Rfou, N. Constant, 매개변수 효율적 프롬프트 튜닝을 위한 규모의 힘, in:
Proceedings of the 2021 Conference on Empirical Methods in Natural Language Processing
, 2021, pp. 3045–3059.
[72] X. Zhao, M. Li, W. Lu, C. Weber, J.H. Lee, K. Chu, S. Wermter, 논리를 통한 대규모 언어 모델의 제로샷 사고 연쇄 추론 향상, in:
Proceedings of the 2024 Joint International Conference on Computational Linguistics, Language Resources and Evaluation (LREC-COLING 2024)
, 2024, pp. 6144–6166.
[73] J. Wei, M. Bosma, V.Y. Zhao, K. Guu, A.W. Yu, B. Lester, N. Du, A.M. Dai, Q.V. Le, 미세 조정된 언어 모델은 제로샷 학습자이다,
arXiv preprint arXiv:210901652
, 2021.
[74] I. Beltagy, A. Cohan, R. Logan IV, S. Min, S. Singh, 사전 학습된 언어 모델을 이용한 제로샷 및 퓨샷 NLP, in:
Proceedings of the 60th Annual Meeting of the Association for Computational Linguistics: Tutorial Abstracts
, 2022, pp. 32–37.
[75] E. Perez, D. Kiela, K. Cho, 언어 모델을 활용한 진정한 퓨샷 학습,
Adv. Neural Inf. Process. Syst.
34 (2021) 11054–11070.
[76] Y. Zhang, Z. Yu, Y. Huang, J. Tang, Climfs: 퓨샷 개체명 인식을 위한 대조 학습으로 향상된 대규모 언어 모델 프레임워크,
arXiv preprint arXiv:240812834
, 2024.
[77] S. Yu-Te Lee, A. Bahukhandi, D. Liu, K.L. Ma, 대규모 언어 모델 프롬프트에서 텍스트 요약의 데이터셋 규모 및 특성 지향 평가를 향하여,
IEEE Trans. Vis. Comput. Graph.
31 (1) (2024) 481–491.
[78] Y. Hao, Z. Chi, L. Dong, F. Wei, 텍스트-이미지 생성을 위한 프롬프트 최적화,
Adv. Neural Inf. Process. Syst.
36 (2023) 66923–66939.
[79] J. Sun, S. Lapuschkin, W. Samek, Y. Zhao, N.M. Cheung, A. Binder, 교차 도메인 퓨샷 분류를 위한 설명 유도 학습, in:
2020 25th International Conference on Pattern Recognition (ICPR)
, IEEE, 2021, pp. 7609–7616.
[80] Y. Zhang, C. Radishian, S. Brunswicker, D. Whitenack, D.W. Linna Jr, 프롬프트 엔지니어링 하에서 LLM의 공감 언어: 법률 분야의 비교 연구,
Procedia Comput. Sci.
244 (2024) 308–317.
[81] D. Trautmann, A. Petrova, F. Schilder, 다국어 법률 판결 예측을 위한 법률 프롬프트 엔지니어링,
arXiv preprint arXiv:221202199
, 2022.
[82] F. Yu, L. Quartey, F. Schilder, 법률 추론 과업을 위한 프롬프트 엔지니어링의 효과성 탐색, in:
Findings of the Association for Computational Linguistics: ACL 2023
, 2023, pp. 13582–13596.
[83] T.L. Ahlgren, H.F. Sunde, K.K. Kemell, A. Nguyen-Duc, LLM을 활용한 초기 단계 소프트웨어 스타트업 지원: 효과적인 프롬프트 엔지니어링 및 시스템 지시문 설계,
Inf. Softw. Technol.
(2025) 107832.
[84] X. Liang, X. Li, F. Li, J. Jiang, Q. Dong, W. Wang, K. Wang, S. Dong, G. Luo, S. Li, Medfilip: 의료 세분화 언어-이미지 사전 학습,
IEEE J. Biomed. Health Inform.
29 (5) (2025) 3587–3597.
[85] L. Buess, M. Keicher, N. Navab, A. Maier, S. Tayebi Arasteh, 대규모 언어 모델에서 멀티모달 AI까지: 의학에서 생성형 AI의 잠재력에 관한 범위 검토,
Biomed. Eng. Lett.
15 (5) (2025) 845–863.
[86] Y. Kobayashi, T. Uchida, T. Inoue, Y. Iwasaki, R. Ito, K. Saito, H. Akiyama, K. Tsuda, K. Yoshida, 자연어 처리와 생성형 AI를 활용한 50년간 건강식품 연구 동향 분석,
Procedia Comput. Sci.
246 (2024) 1875–1884.
[87] F. Naghdy, 공학 연구 설계에서 GenAI와의 협업,
Data Knowl. Eng.
159 (2025) 102445.
[88] F. Luo, J. Zhang, Q. Wang, C. Yang, 화학 연구 가속화를 위한 대규모 언어 모델에서의 프롬프트 엔지니어링 활용,
ACS Cent. Sci.
11 (4) (2025) 511–519.
[89] Z. Zhang, A. Zhang, M. Li, A. Smola, 대규모 언어 모델에서의 자동 사고 연쇄 프롬프팅,
arXiv preprint arXiv:221003493
, 2022.
[90] S. Huang, L. Dong, W. Wang, Y. Hao, S. Singhal, S. Ma, T. Lv, L. Cui, O.K. Mohammed, B. Patra, et al., 언어만으로는 충분하지 않다: 지각을 언어 모델과 정렬하기,
Adv. Neural Inf. Process. Syst.
36 (2023) 72096–72109.
[91] A. Lewkowycz, A. Andreassen, D. Dohan, E. Dyer, H. Michalewski, V. Ramasesh, A. Slone, C. Anil, I. Schlag, T. Gutman-Solo, et al., 언어 모델로 정량적 추론 문제 해결하기,
Adv. Neural Inf. Process. Syst.
35 (2022) 3843–3857.
[92] H. Zhou, A. Nova, H. Larochelle, A. Courville, B. Neyshabur, H. Sedghi, 인컨텍스트 학습을 통한 알고리즘적 추론 교육,
arXiv 사전출판물 arXiv:221109066
, 2022.
[93] K. Shum, S. Diao, T. Zhang, 레이블 데이터의 사고 사슬을 활용한 자동 프롬프트 증강 및 선택, 수록:
전산언어학협회 연구 결과: EMNLP 2023
, 2023, pp. 12113–12139.
[94] N. Reimers, I. Gurevych, Sentence-BERT: 샴 BERT 네트워크를 사용한 문장 임베딩, 수록:
2019 자연어 처리 경험적 방법 학회 및 제9회 자연어 처리 국제 공동 학회(EMNLP-LJCNLP) 논문집
, 2019, pp. 3982–3992.
[95] Z. Zhang, A. Zhang, M. Li, H. Zhao, G. Karypis, A. Smola, 언어 모델의 멀티모달 사고 사슬 추론,
arXiv 사전출판물 arXiv:230200923
, 2023.
[96] B. Wang, S. Min, X. Deng, J. Shen, Y. Wu, L. Zettlemoyer, H. Sun, 사고 사슬 프롬프팅 이해를 향하여: 무엇이 중요한지에 관한 실증 연구, 수록:
제61회 전산언어학협회 연례 학회 논문집(제1권: 장문 논문)
, 2023, pp. 2717–2739.
[97] X. Wang, J. Wei, D. Schuurmans, Q. Le, E. Chi, S. Narang, A. Chowdhery, D. Zhou, 자기 일관성은 언어 모델의 사고 사슬 추론을 향상시킨다,
arXiv 사전출판물 arXiv:220311171
, 2022.
[98] A. Saparov, H. He, 언어 모델은 탐욕적 추론자다: 사고 사슬의 체계적 형식 분석,
arXiv 사전출판물 arXiv:221001240
, 2022.
[99] M. Khalifa, L. Logeswaran, M. Lee, H. Lee, L. Wang, Grace: 판별기 유도 사고 사슬 추론, 수록:
전산언어학협회 연구 결과: EMNLP 2023
, 2023, pp. 15299–15328.
[100] A. Liu, Z. Wu, J. Michael, A. Suhr, P. West, A. Koller, S. Swayamdipta, N.A. Smith, Y. Choi, 언어 모델은 모호성을 모델링하지 않는 것이 두렵다, 수록:
2023 자연어 처리 경험적 방법 학회 논문집
, 2023, pp. 790–807.
[101] F. Zeng, W. Gao, 일관성을 유지하라는 프롬프트가 자기 일관성보다 나은가? 사전학습 언어 모델을 사용한 퓨샷 및 제로샷 사실 검증, 수록:
전산언어학협회 연구 결과: ACL 2023
, 2023, pp. 4555–4569.
[102] M. Liu, J. Fang, 자기 일관성 기반 환각 탐지로 대규모 언어 모델의 수학적 추론 강화,
arXiv 사전출판물 arXiv:250409440
, 2025.
[103] T. Liu, W. Xu, W. Huang, Y. Zeng, J. Wang, X. Wang, H. Yang, J. Li, Logic-of-thought: 대규모 언어 모델의 완전한 추론을 위해 맥락에 논리를 주입하기, 수록:
전산언어학협회 미주 지역 지부 2025 학회: 인간 언어 기술(제1권: 장문 논문) 논문집
, 2025, pp. 10168–10185.
[104] H. Hu, H. Lu, H. Zhang, Y.Z. Song, W. Lam, Y. Zhang, 기호 사슬 프롬프팅은 대규모 언어 모델에서 계획 수립을 이끌어 낸다,
arXiv 사전출판물 arXiv:230510276
, 2023.
[105] S. Yao, D. Yu, J. Zhao, I. Shafran, T. Griffiths, Y. Cao, K. Narasimhan, 사고의 나무: 대규모 언어 모델을 활용한 신중한 문제 해결, 수록:
A. Oh, T. Naumann, A. Globerson, K. Saenko, M. Hardt, S. Levine (Eds.)
[121] F. Shi, X. Chen, K. Misra, N. Scales, D. Dohan, E.H. Chi, N. Schärli, D. Zhou, 대규모 언어 모델은 관련 없는 맥락에 쉽게 주의가 분산될 수 있다, 수록: 기계학습 국제 학회, PMLR, 2023, pp. 31210–31227.
[122] R. Jia, P. Liang, 독해 시스템 평가를 위한 적대적 예제, 수록: 2017 자연어 처리 경험적 방법 학회 논문집, 2017, pp. 2021–2031.
[123] S. Sukhbaatar, A. szlam, J. Weston, R. Fergus, 종단간 메모리 네트워크, 수록: C. Cortes, N. Lawrence, D. Lee, M. Sugiyama, R. Garnett (Eds.),
신경 정보 처리 시스템의 발전
, vol. 28, Curran Associates, Inc., 2015, pp. 1–9,
https://proceedings.neurips.cc/paper_files/paper/2015/file/8fb21ee7a2207526da55a679f0332de2-Paper.pdf
.
[124] Z.Z. Li, D. Zhang, M.L. Zhang, J. Zhang, Z. Liu, Y. Yao, H. Xu, J. Zheng, P.J. Wang, X. Chen, et al., 시스템 1에서 시스템 2로: 추론 대규모 언어 모델에 관한 설문, arXiv 사전출판물 arXiv:250217419, 2025.
[125] D. Zhou, N. Schärli, L. Hou, J. Wei, N. Scales, X. Wang, D. Schuurmans, C. Cui, O. Bousquet, Q. Le, et al., 최소에서 최대로의 프롬프팅은 대규모 언어 모델의 복잡한 추론을 가능하게 한다, arXiv 사전출판물 arXiv:220510625, 2022.
[126] J. Wei, D. Huang, Y. Lu, D. Zhou, Q.V. Le, 단순한 합성 데이터는 대규모 언어 모델의 아첨 성향을 줄인다, arXiv 사전출판물 arXiv:230803958, 2023.
[127] S. Welleck, I. Kulikov, S. Roller, E. Dinan, K. Cho, J. Weston, 비우도 학습을 사용한 신경 텍스트 생성, arXiv 사전출판물 arXiv:190804319, 2019.
[128] N. Shinn, F. Cassano, A. Gopinath, K. Narasimhan, S. Yao, Reflexion: 언어적 강화학습을 사용하는 언어 에이전트, Adv. Neural Inf. Process. Syst. 36 (2023) 8634–8652.
[129] S. Dhuliawala, M. Komelii, J. Xu, R. Raileanu, X. Li, A. Celikyilmaz, J. Weston, 검증 사슬은 대규모 언어 모델의 환각을 줄인다, 수록: 전산언어학협회 연구 결과: ACL 2024, 2024, pp. 3563–3578.
[130] M. Nye, A.J. Andreassen, G. Gur-Ari, H. Michalewski, J. Austin, D. Bieber, D. Dohan, A. Lewkowycz, M. Bosma, D. Luan, C. Sutton, A. Odena, 작업을 보여줘: 언어 모델을 사용한 중간 계산용 스크래치패드, 2022.
https://openreview.net/forum?id=iedYJm92o0a
.
[131] J. Shi, Q. Guo, Y. Liao, S. Liang, LegalGPT: 법률 대규모 언어 모델 다중 에이전트 프레임워크를 위한 법률 사고 사슬, 수록: 지능 컴퓨팅 국제 학회, Springer, 2024, pp. 25–37.
[132] E. Zelikman, Y. Wu, J. Mu, N. Goodman, Star: 추론으로 추론 부트스트래핑하기, Adv. Neural Inf. Process. Syst. 35 (2022) 15476–15488.
[133] Z. Wang, H. Zhang, C.L. Li, J.M. Eisenschlos, V. Perot, Z. Wang, L. Miculicich, Y. Fujii, J. Shang, C.Y. Lee, et al., Chain-of-table: 테이블 이해를 위한 추론 사슬에서 테이블 진화시키기, arXiv 사전출판물 arXiv:240104398, 2024.
[134] J. Jiang, K. Zhou, Z. Dong, K. Ye, W.X. Zhao, J.R. Wen, StructGPT: 대규모 언어 모델이 구조화된 데이터를 추론하기 위한 일반 프레임워크, 수록: 2023 자연어 처리 경험적 방법 학회 논문집, 2023, pp. 9237–9251.
[135] Y. Hao, Y. Sun, L. Dong, Z. Han, Y. Gu, F. Wei, 구조화 프롬프팅: 인컨텍스트 학습을 1, 000개 예제로 확장하기, arXiv 사전출판물 arXiv:221206713, 2022.
[136] C. Wang, X. Li, H. Liu, X. Wu, W. He, 프로그램 유도 학습을 통한 대규모 언어 모델의 효율적인 논리 추론, Authorea Prepr. (2024).
[137] J. Kaddour, J. Harris, M. Mozes, H. Bradley, R. Raileanu, R. McHardy, 대규모 언어 모델의 과제와 응용, arXiv 사전출판물 arXiv:230710169, 2023.
[138] G.V. Aher, R.I. Arriaga, A.T. Kalai, 대규모 언어 모델을 사용하여 다수의 인간을 시뮬레이션하고 인간 대상 연구를 재현하기, 수록: 기계학습 국제 학회, PMLR, 2023, pp. 337–371.
[139] G. Izacard, E. Grave, 개방 도메인 질의응답을 위한 생성 모델의 구절 검색 활용, 수록: 전산언어학협회 유럽 지부 제16회 학회 논문집: 본권, 2021, pp. 874–880.
[140] K. Shuster, S. Poff, M. Chen, D. Kiela, J. Weston, 검색 증강은 대화에서 환각을 줄인다, 수록: 전산언어학협회 연구 결과: EMNLP 2021, 2021, pp. 3784–3803.
[141] H. Tan, Q. Luo, L. Jiang, Z. Zhan, J. Li, H. Zhang, Y. Zhang, 다중 검색 증강 생성을 통한 프롬프트 기반 코드 완성, ACM Trans. Softw. Eng. Methodol. 35 (1) (2025) 1–28.
[142] B.J. Chan, C.T. Chen, J.H. Cheng, H.H. Huang, RAG를 하지 마라: 지식 작업에 캐시 증강 생성만으로 충분할 때, 수록: ACM 웹 학회 2025 동반 논문집, 2025, pp. 893–897.
[143] D. Edge, H. Trinh, N. Cheng, J. Bradley, A. Chao, A. Mody, S. Truitt, D. Metropolitansky, R.O. Ness, J. Larson, 지역에서 전역으로: 질의 중심 요약을 위한 그래프 RAG 접근법, arXiv 사전출판물 arXiv:240416130, 2024.
[144] C. Mavromatis, G. Karypis, GNN-RAG: 대규모 언어 모델 추론을 위한 그래프 신경 검색, arXiv 사전출판물 arXiv:240520139, 2024.
[145] A. Singh, A. Ehtesham, S. Kumar, T.T. Khoei, 에이전틱 검색 증강 생성: 에이전틱 RAG에 관한 설문, arXiv 사전출판물 arXiv:250109136, 2025.
[146] Z. Yang, L. Li, J. Wang, K. Lin, E. Azarnasab, F. Ahmed, Z. Liu, C. Liu, M. Zeng, L. Wang, Mm-react: 멀티모달 추론과 행동을 위해 ChatGPT 프롬프팅하기, arXiv 사전출판물 arXiv:230311381, 2023.
[147] W. Wang, L. Dong, H. Cheng, X. Liu, X. Yan, J. Gao, F. Wei, 장기 기억으로 언어 모델 증강하기, Adv. Neural Inf. Process. Syst. 36 (2023) 74530–74543.
[148] D. Anh-Hoang, V. Tran, L.M. Nguyen, 대규모 언어 모델의 환각에 관한 설문과 분석: 프롬프팅 전략 또는 모델 행동에의 귀속, Front. Artif. Intell. 8 (2025) 1622292.
[149] L.C. Magister, J. Mallinson, J. Adamek, E. Malmi, A. Severyn, 소규모 언어 모델에 추론 가르치기, 수록: 제61회 전산언어학협회 연례 학회 논문집(제2권: 단문 논문), 2023, pp. 1773–1781.
[150] L. Beurer-Kellner, M. Fischer, M. Vechev, 프롬프팅은 프로그래밍이다: 대규모 언어 모델을 위한 질의 언어, Proc. ACM Program. Lang. 7 (PLDI) (2023) 1946–1969.
[151] Q. Lyu, S. Havaldar, A. Stein, L. Zhang, D. Rao, E. Wong, M. Apidianaki, C. Callison-Burch, 충실한 사고 사슬 추론, 수록: 제13회 자연어 처리 국제 공동 학회 및 전산언어학협회 아시아태평양 지부 제3회 학회(제1권: 장문 논문) 논문집, 2023, pp. 305–329.
[152] S. Diao, P. Wang, Y. Lin, R. Pan, X. Liu, T. Zhang, 대규모 언어 모델을 위한 사고 사슬 기반 능동 프롬프팅, 수록: 제62회 전산언어학협회 연례 학회 논문집(제1권: 장문 논문), 2024, pp. 1330–1350.
[153] H.D. Kabir, S.K. Mondal, S. Khanam, A. Khosravi, S. Rahman, M.R.C. Qazani, R. Alizadehsani, H. Asadi, S. Mohamed, S. Nahavandi, et al., 유사성과 민감도로부터의 불확실성 인식 신경망, Appl. Soft Comput. 149 (2023) 111027.
[154] B. Settles, 능동 학습 문헌 설문, 컴퓨터 과학 기술 보고서 1648, 위스콘신-매디슨 대학교, 2009.
[155] Y. Gal, Z. Ghahramani, 베이지안 근사로서의 드롭아웃: 딥러닝에서 모델 불확실성 표현하기, 수록: 기계학습 국제 학회, PMLR, 2016, pp. 1050–1059.
[156] M. Georgieva, I. Patias, P. Totev, 학술 과정에서 대규모 언어 모델을 평가하기 위한 프롬프트 엔지니어링 방법론, 수록: 2025 제9회 다학제 연구 및 혁신 기술 국제 심포지엄(ISMSIT), IEEE, 2025, pp. 1–6.
[157] Y. Zhou, A.I. Muresanu, Z. Han, K. Paster, S. Pitis, H. Chan, J. Ba, 대규모 언어 모델은 인간 수준의 프롬프트 엔지니어다.(2022), arXiv 사전출판물 arXiv:221101910, 2022.
[158] P. Liu, W. Yuan, J. Fu, Z. Jiang, H. Hayashi, G. Neubig, 사전학습, 프롬프트, 예측: 자연어 처리의 프롬프팅 방법에 관한 체계적 설문, ACM Comput. Surv. 55 (9) (2023) 1–35.
[159] T. Mikolov, K. Chen, G. Corrado, J. Dean, 벡터 공간에서 단어 표현의 효율적 추정, arXiv 사전출판물 arXiv:13013781, 2013.
[160] U. Khandelwal, H. He, P. Qi, D. Jurafsky, 가까이는 선명하고 멀리는 흐릿하다: 신경 언어 모델이 맥락을 사용하는 방식, 수록: 제56회 전산언어학협회 연례 학회 논문집(제1권: 장문 논문), 2018, pp. 284–294.
[161] A. See, P.J. Liu, C.D. Manning, 핵심으로 가기: 포인터-생성기 네트워크를 사용한 요약, 수록: 제55회 전산언어학협회 연례 학회 논문집(제1권: 장문 논문), 2017, pp. 1073–1083.
[162] A. Conneau, K. Khandelwal, N. Goyal, V. Chaudhary, G. Wenzek, F. Guzmán, E. Grave, M. Ott, L. Zettlemoyer, V. Stoyanov, 비지도 교차
[178] B. Felbo, A. Mislove, A. Søgaard, I. Rahwan, S. Lehmann, 감정, 정서 및 풍자 탐지를 위한 모든 도메인 표현 학습에 수백만 건의 이모지 출현 활용하기, 수록: 2017 자연어 처리 경험적 방법 학회 논문집, 2017, pp. 1615–1625.
[179] W. Chen, X. Ma, X. Wang, W.W. Cohen, 사고 프로그램 프롬프팅: 수치 추론 작업에서 계산과 추론 분리하기, arXiv 사전출판물 arXiv:221112588, 2022.
[180] C. Li, J. Liang, A. Zeng, X. Chen, K. Hausman, D. Sadigh, S. Levine, L. Fei-Fei, F. Xia, B. Ichter, 코드 사슬: 언어 모델 증강 코드 에뮬레이터로 추론하기, arXiv 사전출판물 arXiv:231204474, 2023.
[181] V. Tereshchenko, V. Martsinkevich, N. Aminov, A. Dukhanov, 미세 조정 및 프롬프트 엔지니어링 방법을 사용하여 학위 논문 텍스트에서 목표와 목적을 식별하기 위한 LLM의 사용, 수록: 2025 인공지능, 컴퓨터, 데이터 과학 및 응용 국제 학회(ACDSA), IEEE, 2025, pp. 1–5.
[182] H. Luo, J. Wu, J. Liu, M.F. Antwi-Afari, 건설 조립 로봇 제어를 위한 대규모 언어 모델 기반 코드 생성: 계층적 생성 접근법, Dev. Built Environ. 19 (2024) 100488.
[183] X. Xu, H. Zhao, V. Vineet, S.N. Lim, A. Torralba, Mtformer: 트랜스포머와 작업 간 추론을 통한 다중 작업 학습, 수록: 유럽 컴퓨터 비전 학회, Springer, 2022, pp. 304–321.
[184] D. Yang, T. Liu, D. Zhang, A. Simoulin, X. Liu, Y. Cao, Z. Teng, X. Qian, G. Yang, J. Luo, et al., 생각하기 위한 코드, 코딩하기 위한 사고: LLM의 코드 강화 추론 및 추론 주도 코드 지능에 관한 설문, 수록: 2025 자연어 처리 경험적 방법 학회 논문집, 2025, pp. 2586–2616.
[185] S. Krause, F. Stolzenburg, 대규모 언어 모델을 사용한 상식 추론과 설명 가능한 인공지능, 수록: 유럽 인공지능 학회, Springer, 2023, pp. 302–319.
[186] J. Roh, V. Gandhi, S. Anilkumar, A. Garg, 코드 사슬 붕괴: 코드 생성에서 적대적 프롬프팅을 통한 LLM의 추론 실패, arXiv 사전출판물 arXiv:250606971, 2025.
[187] K.V. Bodla, H. Yang, Protocode: LLM의 코드 생성을 위한 프로토타입 주도 해석 가능성, arXiv 사전출판물 arXiv:250925247, 2025.
[188] C. Yang, X. Wang, Y. Lu, H. Liu, Q.V. Le, D. Zhou, X. Chen, 최적화 도구로서의 대규모 언어 모델, 수록: 학습 표현 국제 학회, vol. 2024, 2024, pp. 12028–12068.
[189] C. Yang, X. Wang, Y. Lu, H. Liu, Q.V. Le, D. Zhou, X. Chen, 최적화 도구로서의 대규모 언어 모델, 수록: 제12회 학습 표현 국제 학회, 2023, pp. 1–41.
[190] D. Huang, S. Shi, C.Y. Lin, J. Yin, W.Y. Ma, 컴퓨터는 수학 문장제 문제를 얼마나 잘 푸는가? 대규모 데이터셋 구축 및 평가, 수록: 제54회 전산언어학협회 연례 학회 논문집(제1권: 장문 논문), 2016, pp. 887–896.
[191] M. Suzgun, N. Scales, N. Schärli, S. Gehrmann, Y. Tay, H.W. Chung, A. Chowdhery, Q. Le, E. Chi, D. Zhou, et al., 도전적인 BIG-bench 과제와 사고 사슬이 이를 해결할 수 있는지, 수록: 전산언어학협회 연구 결과: ACL 2023, 2023, pp. 13003–13051.
[192] D. Baldelli, J. Jiang, A. Aizawa, P. Torroni, TWOLAR: 구절 재순위화를 위한 2단계 LLM 증강 증류 방법, 수록: 유럽 정보 검색 학회, Springer, 2024, pp. 470–485.
[193] D. Refai, M.S. Al-Shaibani, I. Ahmad, 이것이 최고의 프롬프트인가? LLM 전반의 아랍어 NLP용 프롬프트 점수화, IEEE Access 13 (2025) 171468–171492,
https://doi.org/10.1109/ACCESS.2025.3616181
[194] E.M. Bender, T. Gebru, A. McMillan-Major, S. Shmitchell, 확률적 앵무새의 위험에 대하여: 언어 모델은 너무 커질 수 있는가? 수록: 2021 ACM 공정성, 책임성 및 투명성 학회 논문집, 2021, pp. 610–623.
[195] N.F. Rajani, B. McCann, C. Xiong, R. Socher, 스스로 설명하라! 상식 추론을 위한 언어 모델 활용, 수록: 제57회 전산언어학협회 연례 학회 논문집, 2019, pp. 4932–4942.
[196] S. Koneru, M. Exel, M. Huck, J. Niehues, 번역의 맥락적 정제: 문장 및 문서 수준 후편집을 위한 대규모 언어 모델, 수록: 전산언어학협회 북미 지부 2024 학회: 인간 언어 기술(제1권: 장문 논문) 논문집, 2024, pp. 2711–2725.
[197] S.K. Pandey, S. Chand, J. Horkoff, M. Staron, M. Ochodek, D. Durisic, 디자인 패턴 인식: 대규모 언어 모델 연구, Empir. Softw. Eng. 30 (3) (2025) 69.
[198] D. Panas, A. Payani, V. Belle, LLM 추론의 비합리적 효율성: 시간적 질의응답에 관한 이중의 경고적 이야기, Trans. Mach. Learn. Res. (2025).
[199] I.B. Schlicht, Z. Zhao, B. Sayin, L. Flek, P. Rosso, LLM은 언어 전반의 건강 관련 질문에 일관된 답변을 제공하는가? 수록: 유럽 정보 검색 학회, Springer, 2025, pp. 314–322.
[200] J. Li, Y. Deng, Q. Sun, J. Zhu, Y. Tian, J. Li, T. Zhu, 근거 기반 의학에서 대규모 언어 모델 벤치마킹, IEEE J. Biomed. Health Inform. 29 (9) (2024) 6143–6156.
[201] J. Lin, Z. Han, D.R. Thomas, A. Gurung, S. Gupta, V. Aleven, K.R. Koedinger, 어떻게 하면 올바르게 할 수 있을까? GPT를 사용하여 부정확한 훈련생 응답을 바꾸어 표현하기, Int. J. Artif. Intell. Educ. 35 (2) (2025) 482–508.
[202] K. Zhu, J. Wang, J. Zhou, Z. Wang, H. Chen, Y. Wang, L. Yang, W. Ye, Y. Zhang, N. Gong, et al., Promptrobust: 적대적 프롬프트에서 대규모 언어 모델의 견고성 평가를 향하여, 수록: 개인정보 보호 및 안전 분석을 갖춘 대규모 AI 시스템 및 모델 제1회 ACM 워크숍 논문집, 2023, pp. 57–68.
[203] A. Tang, L. Soulier, V. Guigue, 모호성 명료화: 명료화 생성 프롬프팅 방법에서 모호성 유형의 역할에 대하여, 수록: 정보 검색 연구 및 개발에 관한 제48회 국제 ACM SIGIR 학회 논문집, 2025, pp. 20–30.
[204] P. Maini, S. Seto, R. Bai, D. Grangier, Y. Zhang, N. Jaitly, 웹 바꾸어 표현하기: 계산 및 데이터 효율적인 언어 모델링을 위한 방법, 수록: 제62회 전산언어학협회 연례 학회 논문집(제1권: 장문 논문), 2024, pp. 14044–14072.
[205] H.S. Zheng, S. Mishra, X. Chen, H.T. Cheng, E.H. Chi, Q.V. Le, D. Zhou, 한 걸음 물러서기: 대규모 언어 모델에서 추상화를 통한 추론 유발, 수록: 제12회 학습 표현 국제 학회, 2024, pp. 1–38,
https://openreview.net/forum?id=3bq3jsvcQ1
.
[206] D. Chen, W.T. Yih, 개방 도메인 질의응답, 수록: 제58회 전산언어학협회 연례 학회 논문집: 튜토리얼 초록, 2020, pp. 34–37.
[207] K. Cobbe, V. Kosaraju, M. Bavarian, M. Chen, H. Jun, L. Kaiser, M. Plappert, J. Tworek, J. Hilton, R. Nakano, et al., 수학 문장제 문제를 풀기 위한 검증기 학습, arXiv 사전출판물 arXiv:211014168, 2021.
[208] T. Khot, H. Trivedi, M. Finlayson, Y. Fu, K. Richardson, P. Clark, A. Sabharwal, 분해된 프롬프팅: 복잡한 작업 해결을 위한 모듈식 접근법, 수록: 제11회 학습 표현 국제 학회, 2023, pp. 1–69,
https://openreview.net/forum?id=_nGgzQjzaRy
.
[209] J.W. Rae, S. Borgeaud, T. Cai, K. Millican, J. Hoffmann, F. Song, J. Aslanides, S. Henderson, R. Ring, S. Young, et al., 언어 모델 확장: Gopher 학습에서의 방법, 분석 및 통찰, arXiv 사전출판물 arXiv:211211446, 2021.
[210] A. Creswell, M. Shanahan, 대규모 언어 모델을 사용한 충실한 추론, arXiv 사전출판물 arXiv:220814271, 2022.
[211] S. Brade, B. Wang, M. Sousa, S. Oore, T. Grossman, Promptify: 대규모 언어 모델을 사용한 대화형 프롬프트 탐색을 통한 텍스트-이미지 생성, 수록: 제36회 ACM 사용자 인터페이스 소프트웨어 및 기술 심포지엄 논문집, 2023, pp. 1–14.
[212] R. Shalev-Arkushin, R. Gal, A.H. Bermano, O. Fried, ImageRAG: 참조 유도 이미지 생성을 위한 동적 이미지 검색, arXiv 사전출판물 arXiv:250209411, 2025.
[213] H. Liu, Z. Teng, L. Cui, C. Zhang, Q. Zhou, Y. Zhang, Logicot: 논리적 사고 사슬 지시 미세 조정, 수록: 전산언어학협회 연구 결과: EMNLP 2023, 2023, pp. 2908–2921.
[214] X. Yang, R. Zhan, S. Yang, J. Wu, L.S. Chao, D.F. Wong, 대규모 언어 모델에서 프롬프트 기반 편향 완화 재고하기, 수록: 전산언어학협회 연구 결과: ACL 2025, 2025, pp. 26538–26553.
[215] X. Li, R. Zhao, Y.K. Chia, B. Ding, S. Joty, S. Poria, L. Bing, Chain-of-knowledge: 이질적 출처에 걸친 동적 지식 적응을 통해 대규모 언어 모델을 근거화하기, 수록: 학습 표현 국제 학회, vol. 2024, 2024, pp. 9565–9587.
[216] W. Li, X. Wang, W. Li, B. Jin, 한 설문