대규모 언어 모델의 프롬프트 엔지니어링 및 컨텍스트 엔지니어링 기법에 대한 종합적 고찰

Tonmoy Debnath a , Md Nurul Absar Siddiky b,1 , Muhammad Enayetur Rahman c,1 ,
Prosenjit Das d , Antu Kumar Guha d , Muhammad Rezaur Rahman e , H.M. Dipu Kabir f,*

a 컴퓨터 과학 및 기술, Mymensingh Polytechnic Institute, Mymensingh, 2200, 방글라데시

b 전기 및 컴퓨터 공학, University of Hawaii at Manoa, Honolulu, HI 96822, 미국

c 전기 및 컴퓨터 공학, Old Dominion University, Norfolk, VA 23509, 미국

d 전자 및 통신 공학 학부, Khulna University, Khulna, 9208, 방글라데시

e 연구 및 혁신 부서, Agile Crafts, Khilgaon, Dhaka, 1219, 방글라데시

f 인공지능 및 사이버 미래 연구소, Charles Sturt University, Bathurst, NSW, 2795, 오스트레일리아

논문 정보

키워드:

프롬프트 엔지니어링

컨텍스트 엔지니어링

대규모 언어 모델

체계적 문헌 검토

자연어 처리

AI 신뢰성

초록

대규모 언어 모델(LLM)의 급속한 발전은 인공지능이 복잡한 문제를 해결할 수 있게 했다. 그러나 그 성능은 여전히 입력의 구성과 컨텍스트 관리에 매우 민감하다. 프롬프트 엔지니어링의 핵심적 역할에도 불구하고, 이는 표준화된 이론적 틀이 없는 경험적이고 임시방편적인 관행으로 흔히 다루어지며, 그 결과 출력 불일치, 프롬프트 민감성, 환각과 같은 문제가 발생한다. 본 연구는 프롬프트 및 컨텍스트 엔지니어링 기법에 대한 포괄적인 체계적 문헌 검토를 제시하여, 단편화된 패러다임을 일관된 분석 틀로 통합한다. 제로샷 및 퓨샷 학습과 같은 기초적 접근법을 비롯해 사고 사슬(Chain-of-Thought, CoT), 검색 증강 생성(Retrieval-Augmented Generation, RAG), 다단계 추론 아키텍처(예: Tree-of-Thoughts, Graph-of-Thoughts)를 포함하는 고급 전략을 분류하는, 프롬프트의 전체 생명주기를 아우르는 구조화된 분류 체계를 제시한다. 또한 서로 다른 LLM 아키텍처에서 이러한 기법을 비판적으로 평가하며, 환각 완화, 사실 일관성 보장, 인간 의도에 부합하는 출력 생성에서의 효과를 강조한다. 입력 수준의 언어적 제어에서 시스템 수준의 컨텍스트 조율로의 전환을 분석함으로써, 컨텍스트 희석 및 계산 오버헤드와 같은 지속적인 한계를 식별한다. 마지막으로 자동화된 프롬프트 최적화, 신뢰성 인지형 프롬프팅, 에이전트 시스템에서 부상하는 연구 경로를 개괄한다. 이 조사는 견고하고 해석 가능하며 도메인 적응적인 AI 시스템을 구축하고자 하는 연구자와 실무자를 위한 기초 참고 자료이자 의사결정 프레임워크 역할을 한다.

1. 서론

대규모 언어 모델(LLM)의 등장은 인공지능에 혁신을 가져왔으며, 자연어 이해, 추론, 텍스트 생성에서 상당한 진전을 이끌었다 [1–4]. GPT, PaLM, LLaMA와 같은 모델은 자동화된 콘텐츠 제작, 의사결정, 과학적 발견을 비롯한 다양한 응용 분야에서 뛰어난 역량을 보여 주었다 [5–11]. 그러나 이들의 성능은 프롬프트를 제시하는 방식에 민감하므로, 프롬프트 엔지니어링은 출력 품질을 최적화하는 핵심 요소가 된다 [12–16]. 그 중요성에도 불구하고 프롬프트 엔지니어링은 효과적인 프롬프트 설계를 위한 표준화된 프레임워크 없이 여전히 경험적이다 [17–19]. 이러한

체계적 방법론의 부족은 작업 전반에서 일관되지 않은 출력, 환각, 차선의 일반화와 같은 문제를 초래했다 [20–22].

프롬프트 엔지니어링은 입력 질의를 신중하게 설계하여 AI 모델의 효과를 향상하는 핵심 기법이다. 모호하거나 일반적인 프롬프트를 제공하는 대신, 잘 구조화되고 컨텍스트가 풍부한 프롬프트는 AI가 더 정확하고 관련성 높으며 상세한 응답을 생성하도록 돕는다 [23]. 이 과정에는 표현을 다듬고, 제약 조건을 추가하며, 원하는 형식이나 스타일을 지정하는 일이 포함된다.

프롬프트 엔지니어링과 컨텍스트 엔지니어링은 챗봇, 콘텐츠 생성, 의사결정과 같은 AI 응용 분야에서 널리 사용된다

* 교신 저자.

이메일 주소: [email protected] (H.M.D. Kabir).

1 이 저자들은 본 연구에 동등하게 기여했다.

Fig. 1. 예시 이미지를 사용한 기본 프롬프트와 엔지니어링된 프롬프트의 비교. 이 이미지들은 AI를 사용하여 생성했다. 사슴 사진을 요청하면 이미지는 단순하고 그다지 매력적이지 않다(a). 주변 환경에 관한 세부 정보를 더 제공하면 이미지가 더 좋아 보인다(b). 사슴의 종류, 활동, 주변 환경에 대한 정보를 제공하면 생성된 이미지가 요구 사항을 충족한다(c).

시스템에서 사용자 의도와의 더 나은 정합성을 보장한다 [24,25]. 프롬프트를 최적화함으로써 사용자는 모호성을 줄이고, 출력 품질을 개선하며, AI 모델로부터 더 구조화되고 의미 있는 응답을 얻을 수 있다.

많은 개념은 장소에 따라 다르다. AI의 개발과 훈련에는 흔히 편향이 포함된다. 인도 아대륙과 세계 다른 지역에서 흔한 사슴의 종류는 동일하지 않다. AI에게 사슴 사진을 요청하면 Fig. 1(a)에 제시된 사슴 사진을 생성하는데, 이는 사용자에게 매력적이지 않을 수 있다. 주변 환경에 관한 세부 정보를 더 원하면, AI는 Fig. 1(b)에 제시된 것처럼 세계 여러 지역에서 흔하지 않은 주변 환경도 생성한다. Fig. 1(c)에 제시된 전형적인 인도 지역의 사슴 사진을 생성하기 위해 주변 환경, 사슴의 종류, 사슴의 활동에 관한 모든 세부 정보를 제공한다. 이러한 사진은 광고 및 교육 자료를 개발하는 데 사용할 수 있으며 인도 아대륙의 대부분 사람들에게 매력적일 것이다.

Fig. 2에 나타난 바와 같이, 기본 프롬프트는 흔히 모호하고 비구조화된 AI 응답을 낳는 반면, 엔지니어링된 프롬프트는 잘 구조화되고 의미 있는 출력을 제공한다. 프롬프트 엔지니어링은 모델의 정확성, 일관성, 사실적 일관성을 개선하기 위해 프롬프트 구성 방식을 다듬는 것을 목표로 한다 [26]. 선행 연구는 제로샷, 퓨샷, 사고 사슬 프롬프팅 기법을 탐색했으며, 각각은 다양한 맥락에서 고유한 이점을 제공한다 [2,27]. 그러나 기존 연구는 통합된 이론적 프레임워크를 확립하거나 서로 다른 LLM 아키텍처에 걸쳐 프롬프팅 방법을 벤치마킹하지 않은 채 주로 임시방편적 전략에 초점을 맞춘다 [28]. 또한 많은 프롬프팅 기법은 표현의 미세한 변형에 취약하여 신뢰성 및 편향과 같은 문제로 인해 실제 환경에서의 배포를 어렵게 만든다 [29–31].

Fig. 2. 프롬프트 엔지니어링의 필요성을 보여 주는 기본 프롬프트와 엔지니어링된 프롬프트의 비교.

대규모 언어 모델(LLM)의 최근 발전은 모델 성능이 프롬프트의 표현뿐만 아니라 컨텍스트 정보가 모델의 컨텍스트 윈도 내에서 어떻게 구성되고, 순서화되고, 추출되고, 보존되는지에도 좌우된다는 점을 보여 주었다. 일반적으로 컨텍스트 엔지니어링 이라고 하는 이 새로운 패러다임은 즉각적인 지시 사항에만 초점을 맞추는 대신 LLM에 제공되는 전체 컨텍스트 환경의 체계적 설계를 포함함으로써 전통적인 프롬프트 엔지니어링을 확장한다.

컨텍스트 엔지니어링은 동적 컨텍스트 구성, 검색 증강 생성(RAG), 메모리 통합, 도구 기반 근거화, 장문 컨텍스트 최적화와 같은 방법을 포함하는 패러다임으로 볼 수 있다. 선행 연구는 대규모 언어 모델이 컨텍스트 정보의 위치와 순서 모두에 강한 민감성을 보이며, 긴 입력 시퀀스 내에 필요한 정보가 부적절하게 배치될 경우 성능이 저하될 수 있음을 확인했다 [32].

1.1. 인간 참여형 설계

인간 피드백은 정합성을 개선하고 바람직하지 않은 출력을 줄인다. 인간 선호로부터의 강화 학습은 대규모 언어 모델의 정렬에 효과적임이 입증되었다 [33,34]. 그러나 확장성과 주석자 편향은 여전히 과제이다.

1.2. 보안 고려 사항

프롬프트 인젝션 공격은 적대적 지시문을 삽입하여 지시 수행 행동을 조작한다 [35–37]. 이러한 취약성은 배포 중 입력 정제와 계층적 지시 강제의 필요성을 부각한다 [38,39].

검색 증강 생성(RAG)은 매우 영향력이 큰 것으로 입증된 컨텍스트 엔지니어링 접근법 중 하나로, 컨텍스트 외부의 지식 소스를 선택적으로 검색하고 생성 작업 중 이를 모델의 컨텍스트에 주입하는 것을 포함한다 [40]. 검색된 문서에 조건화된 생성을 통합함으로써 환각이 줄어들고, 특히 지식 집약적 응용 분야에서 사실적 일관성이 향상된다. 후속 연구는 최적의 청킹, 순위화, 압축이

Table 1
LLM 시스템에서 프롬프트 엔지니어링과 컨텍스트 엔지니어링의 개념적 비교.

분류 차원 프롬프트 엔지니어링 컨텍스트 엔지니어링
개념적 정의 모델 행동을 유도하기 위한 언어적 지침의 설계 전체 맥락 환경의 체계적 구축 및 조율
주요 목표 더 나은 프롬프트 구성으로 출력 품질 향상 맥락 제어를 통해 신뢰성, 근거성 및 일관성 향상
제어 수준 입력 수준 제어 시스템 수준 제어
영향 범위 단일 프롬프트 또는 질의 전체 상호작용 수명주기
설계 단위 프롬프트 텍스트(지침, 역할, 예시) 맥락 묶음(프롬프트, 검색된 지식, 메모리, 도구, 정책)
시간적 범위 단일 턴 또는 짧은 다중 턴 장기적이고 지속적인 상호작용
상태성 기본적으로 무상태 상태 유지형 또는 의사 상태 유지형
지식 출처 암묵적(모델 내부 지식) 명시적(외부 문서, 데이터베이스, 도구)
정보 흐름 입력에서 출력으로의 직접 매핑 검색, 메모리 및 추론 계층을 통해 매개됨
시스템 아키텍처와의 결합도 약함; 대체로 모델 독립적 강함; 시스템 파이프라인 설계에 의존
확장성 복잡한 작업에는 제한적 복잡한 다단계 작업을 위해 설계됨
견고성 메커니즘 프롬프트 개선 및 재표현 검색 기반 근거화, 검증 및 메모리
최적화 초점 언어적 명확성 및 지침의 정밀성 맥락 관련성, 순서 및 밀도
평가 수준 프롬프트-출력 수준 엔드투엔드 시스템 동작
일반적인 실패 모드 프롬프트 민감성, 모호성, 환각 맥락 희석, 검색 잡음, 컨텍스트 윈도우 포화
대표 기법 제로샷, 퓨샷, CoT, 역할 프롬프팅 RAG, ReAct, 메모리 증강 모델, 에이전트 기반 시스템
주요 연구 관점 인간-모델 상호작용 AI 시스템 아키텍처 및 정보 관리

장문 맥락 환경에서 이 접근법의 효과를 극대화하는 데 핵심적이다 [41].

컨텍스트 엔지니어링의 두 번째 중요한 측면은 추론을 인식하는 맥락 구조화이다. Chain-of-Thought 프롬프팅 [2], 추론과 행동을 결합하는 ReAct 프레임워크 [42], 자기 정제 전략 [43]과 같은 방법은 중간 추론 단계의 기록을 맥락에 포함하면 모델 출력의 견고성과 설명 가능성이 크게 향상됨을 보여준다. 이는 추론의 품질이 중간 상태가 맥락 내에서 어떻게 표현되는지와 직접적으로 연결되어 있음을 강조한다.

또한 장문 맥락 언어 모델에 관한 최근 연구는 관련성과 정보 밀도가 적절히 관리되지 않으면 단순히 맥락 길이를 늘리는 것만으로는 반드시 성능 향상으로 이어지지 않음을 보여주었다 [44]. 이는 맥락 희석을 방지하고 중요한 정보가 효과적으로 영향을 미치도록 보장하는 데 컨텍스트 엔지니어링이 수행하는 핵심적 역할을 부각한다.

요약하면, 컨텍스트 엔지니어링은 프롬프트 중심 설계에서 총체적인 맥락 최적화로의 체계적 전환을 의미한다. LLM이 맥락 길이와 애플리케이션 복잡성 측면에서 계속 확장됨에 따라, 효과적인 컨텍스트 엔지니어링은 신뢰할 수 있고 제어 가능하며 도메인 적응적인 AI 시스템을 구축하기 위한 기반 구성 요소가 될 것으로 기대된다.

표 1은 프롬프트 엔지니어링과 컨텍스트 엔지니어링 간의 개념적·방법론적 차이를 요약하며, 입력 수준의 언어적 제어에서 시스템 수준의 맥락 조율로의 전환을 강조한다.

프롬프트 엔지니어링 방법론에 대한 포괄적 분석은 기존 프롬프팅 기법의 분류 체계와 그것이 모델 견고성, 일반화 및 해석 가능성에 미치는 영향을 포괄한다 [45,46]. 제로샷 및 퓨샷 학습과 같은 기본 프롬프팅 패러다임은 검색 증강 생성, 자기 일관성 프롬프팅, tree-of-thought와 같은 다단계 추론 프레임워크를 포함하는 고급 전략과 함께 폭넓게 논의된다.

graph-of-thought 프롬프팅 [47,48]. 또한 프롬프트 민감성, 특히 생성된 응답에 대한 미세한 구문적·의미적 변이의 영향과 신뢰성 및 일관성을 개선하기 위해 프롬프트 변동을 완화하는 접근법에도 상당한 관심이 기울여진다 [45,49]. 이와 더불어, 생성된 출력의 사실적 일관성, 신뢰성 및 윤리적 중립성을 향상하기 위해 환각 감소와 편향 완화는 여전히 중요한 연구 방향이다 [20,21,50,51]. 새롭게 부상하는 연구 동향은 다양한 애플리케이션 도메인 전반의 적응성과 성능을 강화하기 위해 강화학습, 메타학습 및 적대적 견고성 기법을 통한 자동화된 프롬프트 최적화를 추가로 탐구한다 [52,53].

대부분의 상황에서 LLM만으로는 관련성 있고 정확하며 최신의 결과를 제공하기에 충분하지 않다. 그림 3은 사용자 의도와 프롬프트 설계부터 AI 처리 및 최적화된 출력에 이르는 LLM 기반 챗봇의 단계별 작업 과정 예시를 나타낸다. LLM과 벡터 데이터베이스는 프롬프트 엔지니어링에서 널리 쓰이는 두 용어이다. 벡터 데이터베이스는 프롬프트 엔지니어와 정보 탐색자가 질의를 수행하는 데 도움을 준다. 유사한 이미지를 관찰하거나 특정 속성을 지닌 이미지를 찾으려면 벡터 데이터베이스 없이는 많은 연산이 필요하다. 벡터 데이터베이스의 이미지는 그 속성과 함께 저장된다. 속성에는 해당 이미지의 객체와 이미지 속 모든 객체의 외관상 상태가 포함될 수 있다. 그 밖에도 많은 정보가 있을 수 있다. 벡터에는…

기존 설문 연구는 프롬프트 엔지니어링을 단편적으로 다루는 반면, 본 연구는 전체 프롬프트 수명주기를 아우르는 원칙적이고 질문 주도적인 분류 체계를 제시한다. 개별 프롬프팅 패러다임에 초점을 맞춘 기존 검토와 달리, 본 설문은 단일 분석 프레임워크 내에서 추론, 계획, 검색, 상호작용 및 최적화 기반 프롬프팅을 통합한다. 표 2와 3에 제시된 비교는

그림 3. LLM 기반 챗봇의 단계별 작업 과정 예시.

표 2
기존 프롬프트 엔지니어링 설문조사의 비교.

설문조사 / 연구 범위 분류 체계 유형 평가 자동화 견고성 / 신뢰성 응용 지침
대규모 언어 모델을 위한 프롬프트 엔지니어링 [56] 광범위 기법 기반 제한적 아니요 제한적 제한적
LLM을 위한 증거 기반 지침을 활용한 일관성 및 신뢰성 측면의 프롬프트 엔지니어링 [57] 신뢰성 중심 지침 기반 아니요 제한적
프롬프트 엔지니어에게 프롬프트 엔지니어링하기 [58] 메타 프롬프팅 최적화 기반 제한적 아니요 아니요
프롬프트 엔지니어링 탐색: SWOT 분석을 포함한 체계적 문헌고찰 [59] 광범위 SWOT 기반 / 주제별 제한적 아니요 제한적 제한적
고등교육에서의 프롬프트 엔지니어링: 교육과정 수립에 기여하기 위한 체계적 문헌고찰 [60] 교육 특화 응용 중심 / 교육학적 제한적 아니요 제한적
대규모 언어 모델의 프롬프트 엔지니어링에 대한 체계적 조사: 기법과 응용 [61] 광범위 기법 기반 제한적 아니요 제한적
개인정보 보호 프롬프트 엔지니어링: 설문조사 [62] 개인정보 보호 중심 지침 기반 / 주제별 제한적 아니요 제한적
대규모 언어 모델을 위한 프롬프트 엔지니어링의 잠재력 발휘 [63] 광범위 서술적 / 기술적 제한적 제한적
소프트웨어 엔지니어링에서 프롬프트 엔지니어링 패러다임의 잠재력 실현: 체계적 문헌고찰 [64] 소프트웨어 엔지니어링 응용 중심 제한적 제한적 제한적
무선 네트워크를 위한 대규모 언어 모델: 프롬프트 엔지니어링 관점에서의 개요 [65] 무선 네트워크 응용 분야별 / 도메인 주도형 제한적 아니요 제한적
요구사항 엔지니어링에서 대규모 언어 모델을 사용하기 위한 프롬프트 엔지니어링 지침 [66] 요구사항 엔지니어링 지침 기반 제한적 아니요 아니요
프롬프트 엔지니어링 기법의 SWOT 분석에 관한 체계적 문헌 검토 [67] SWOT 중심 SWOT 기반 / 분석적 제한적 아니요 제한적 제한적
대규모 언어 모델을 위한 프롬프트 엔지니어링 기법 검토 [68] 광범위 기법 지향 제한적 아니요 제한적 제한적

표 3
기존 컨텍스트 엔지니어링 설문조사와 제안된 설문조사의 비교.

설문조사 / 연구 범위 분류 체계 유형 평가 자동화 견고성 / 신뢰성 적용 지침
대규모 언어 모델을 위한 컨텍스트 엔지니어링 설문조사 [25] 컨텍스트 엔지니어링 시스템 수준 / 아키텍처적 부분적 제한적
장문맥 언어 모델링에 관한 종합 설문조사 [69] 장문맥 모델링 아키텍처 기반 아니요 제한적
본 연구 (제안된 설문조사) 광범위 + 실용적 통합 분류 체계 및 의사결정 프레임워크 도메인 간

이는 본 설문조사가 선행 연구보다 범위가 더 넓고 구조적으로도 더 심층적임을 추가로 보여주며, 프롬프트 엔지니어링 연구를 위한 장기적 참고 자료로 자리매김하게 한다. 신뢰성, 환각 완화, 편향을 핵심 분석 차원으로 통합함으로써, 본 연구는 성능 중심 분석을 넘어 프롬프트 엔지니어링을 발전시킨다.

본 연구의 주요 기여는 세 가지이다.

이 글은 정교한 프롬프팅 전술을 사용하여 LLM 성능을 향상하고자 하는 연구자와 실무자를 위한 기초 참고 자료 역할을 한다.

이 논문의 나머지 구성은 다음과 같다: 2장 은(는) 제로샷, 퓨샷, 사고 연쇄 프롬프팅과 같은 기본 접근법과 검색 증강 생성 및 자기 일관성 프롬프팅 같은 고급 전략을 포함하여 프롬프트 엔지니어링 기법을 종합적으로 검토한다. 3장 은(는) 이러한 기법의 정성적 분석을 제시하며, 서로 다른 LLM 아키텍처 전반에서의 효과를 비교하고 모델 성능에 미치는 영향을 평가한다. 4장 은(는) 사용 사례에 따라 이러한 기법을 분류하여 다양한 도메인에서의 실용적 응용에 관한 통찰을 제공한다. 마지막으로, 5장 은(는) 주요 결과를 요약하고 프롬프트 엔지니어링의 향후 연구 기회를 논의하며 논문을 마무리한다.

2. 검토 방법론 및 프로토콜

본 검토는 대규모 언어 모델(LLM)을 위한 프롬프트 엔지니어링 기법의 투명성, 재현성 및 포괄적 범위를 보장하기 위해 체계적 문헌 검토(SLR) 방법론을 따른다. 검토 프로토콜은 컴퓨터 과학 및 소프트웨어 공학의 체계적 검토를 위한 확립된 지침에 따라 설계되었으며, 명시적인 검색 전략, 명확히 정의된 포함 및 제외 기준, 구조화된 분석 과정을 강조한다.

2.1. 검토 유형 및 목표

본 연구는 서술적 검토나 범위 검토가 아닌 체계적 문헌 검토 접근법을 채택한다. 주요 목표는 LLM을 위한 기존 프롬프트 엔지니어링 기법 연구를 체계적으로 식별, 분류, 종합 및 비판적으로 분석하는 것이다. 서술적 조사와 달리, 이 접근법은 검토 과정을 명시적으로 문서화하여 선택 편향을 최소화하고 재현성을 높이는 것을 목표로 한다.

본 검토는 다음의 포괄적 목표에 답하고자 한다:

2.2. 연구 질문

검토 과정을 안내하기 위해 다음 연구 질문(RQ)을 수립했다:

이러한 연구 질문은 본 검토에서 채택한 검색 전략, 선정 기준 및 종합 과정을 형성한다.

2.3. 데이터 소스 및 디지털 라이브러리

폭넓고 권위 있는 범위를 보장하기 위해 여러 주요 학술 데이터베이스와 디지털 라이브러리를 조사했다. 다음 소스는 컴퓨터 과학, 인공지능 및 기계 학습 연구와의 관련성 때문에 선정되었다:

2.4. 검색 전략

대규모 언어 모델(LLM)을 위한 프롬프트 엔지니어링 및 컨텍스트 엔지니어링 관련 문헌을 식별하기 위해 구조화되고 집중된 검색 전략을 설계했다. 수많은 기법별 키워드를 사용하는 더 광범위한 조사 방법론과 달리, 본 검토는 여러 디지털 라이브러리 전반에서 일관성, 재현성 및 관리 가능한 검색 결과를 보장하기 위해 통합된 불리언 검색식을 채택했다. 최종 불리언 질의는 다음과 같이 정의되었다:

(("Prompt Engineering" OR "Context Engineering") AND ("LLM" OR "Large Language Model"))

높은 주제 관련성을 보장하고 느슨하게 관련된 연구의 포함을 줄이기 위해 검색은 주로 제목 필드에서 수행되었다. 최근 몇 년간 "prompt engineering"과 "context engineering"이라는 용어가 학술 출판물에서 더욱 표준화되고 널리 채택되었으므로, 제목 기반 검색은 무관한 레코드를 최소화하면서 핵심 기여를 식별하는 데 효과적인 것으로 간주되었다.

검색된 연구의 품질과 관련성을 향상하기 위해 추가적인 데이터베이스별 필터와 제약 조건을 다음에 따라 적용했다

각 플랫폼의 색인 구조와 검색 기능에 따라. 적용된 필터와 초기 검색 결과는 아래에 요약되어 있다:

검색 과정은 선정된 모든 데이터베이스에서 반복적으로 수행되었다. 데이터베이스별 질의 규칙에서 요구되는 경우 경미한 구문 수정이 도입되었지만, 불리언 질의의 의미 구조는 검토 과정 전반에 걸쳐 일관되게 유지되었다.

채택된 검색 전략은 이 조사의 목표와 부합했다. "Prompt Engineering" 및 "Context Engineering" 용어를 포함함으로써 기초적인 프롬프팅 방법론과 새롭게 부상하는 컨텍스트 인식 LLM 시스템을 모두 다루는 연구를 검색할 수 있었다. 마찬가지로, "LLM" 및 "Large Language Model"을 포함함으로써 현대적인 트랜스포머 기반 생성형 AI 시스템과 그 상호작용 프레임워크의 범위를 보장했다. 이러한 집중된 검색 설계는 일관된 분류 체계의 개발을 촉진하고 프롬프트 및 컨텍스트 엔지니어링의 최근 발전을 체계적으로 종합하는 데 기여했다.

2.5. 기간 범위 및 검토 일정

본 검토는 2023년 1월부터 2025년 12월까지 출판된 문헌을 다룬다. 이 기간 범위는 GPT-3.5, GPT-4, Claude, Gemini 및 기타 지시문 튜닝 시스템과 같은 고급 대규모 언어 모델이 널리 등장한 이후 프롬프트 엔지니어링과 컨텍스트 엔지니어링의 급속한 진화와 주류 채택을 포착하기 위해 선정되었다.

선정된 기간은 다음과 같은 여러 이유로 특히 중요하다:

이 기간에 출판된 저널 논문과 영향력 높은 학회 논문을 모두 고려했다. 또한, 선정된 고품질

사전 인쇄본은 프롬프트 엔지니어링 및 컨텍스트 엔지니어링과 관련된 영향력 있거나 새롭게 부상하는 기법을 소개한 경우 포함했다.

2.6. 포함 및 제외 기준

선정된 연구의 관련성, 일관성 및 기술적 품질을 보장하기 위해 명확한 포함 및 제외 기준을 수립했다.

2.6.1. 포함 기준

다음에 해당하는 연구를 포함했다:

2.6.2. 제외 기준

다음에 해당하는 연구는 제외되었다:

2.7. 연구 선정 과정

연구 선정 과정은 관련성 높고 품질이 우수하며 기술적으로 중요한 연구를 포함하도록 다단계 필터링 및 정제 절차를 따랐다.

  1. 1. 초기 식별: 사전 정의된 부울 검색 전략과 데이터베이스별 필터를 사용하여 선정된 데이터베이스에서 총 468편의 논문을 최초로 검색하였다.
  2. 2. 중복 제거: 데이터베이스 간 중복 항목을 제거한 후, 추가 평가를 위해 464건의 고유 연구가 남았다.
  3. 3. 제목 선별: 검색된 연구의 제목을 사전 정의된 포함 및 제외 기준에 따라 선별하여 명백히 관련 없는 연구를 제거하였다. 이 단계에서 후보 집합은 90편의 논문으로 줄었다.
  4. 4. 초록 선별: 이후 남은 연구의 초록을 검토하여 관련성, 기술적 기여도 및 본 조사 목표와의 부합성을 평가하였다. 초록 선별 후 47편의 논문이 상세한 전문 검토를 위해 보존되었다.
  5. 5. 전문 검토 및 최종 선정: 선정된 연구는 방법론적 품질, 실증적 검증 및 프롬프트 엔지니어링과 컨텍스트 엔지니어링 연구에 대한 기여도를 평가하기 위해 전문을 검토하였다. 프롬프팅 및 맥락 증강 기법의 이해, 개발, 최적화 또는 평가에 직접 기여하는 논문만 최종 종합에 포함되었다.

주요 데이터베이스 검색에 더하여, 선정된 연구에 대해 후방 참고문헌 추적(backtracking) 전략을 적용하였다

2023년 이전에 출판된 기초적이고 영향력이 큰 연구를 식별하기 위해서였다. 이 보완 단계는 여러 획기적인 프롬프트 엔지니어링 및 인컨텍스트 학습 연구가 “프롬프트 엔지니어링”과 “컨텍스트 엔지니어링”이라는 용어가 널리 표준화되기 전에 등장했기 때문에 필요했으며, 이로 인해 제목 제약 부울 검색 전략만으로는 해당 연구를 검색하기 어려웠다.

또한 후방 추적 과정은 많은 선구적 프롬프트 엔지니어링, 지시문 튜닝 및 인컨텍스트 학습 논문이 처음 발표된 NeurIPS, ICML, ICLR, arXiv와 같은 주요 학술지 및 학회에 출판된 영향력 있는 연구를 포함할 수 있게 하였다. 이 보완적 포함 전략은 조사가 기초적 발전과 최근의 진전을 모두 포착하도록 하여, 검토의 역사적 연속성, 완전성 및 기술적 깊이를 향상시켰다.

전체 연구 선정 과정을 요약한 PRISMA 양식 흐름도는 그림 4에 제시되어 있다.

3. 질문 주도형 분류체계 설계 및 매핑 근거

본 조사에서 제시하는 프롬프트 엔지니어링 기법의 분류체계는 구조화된 질문 주도형 설계 과정을 통해 도출되었다. 기법을 임시방편적으로 나열하는 대신, 이 분류체계는 프롬프트 엔지니어링 방법이 서로 다른 핵심 차원을 포착하는 일련의 기초 연구 질문을 체계적으로 다루어 구성된다. 이 접근법은 개념적 명확성을 보장하고 구조적 불균형을 방지하며, 기법을 일관된 범주로 묶는 원칙적 근거를 제공한다.

구체적으로 이 분류체계는 프롬프트가 대규모 언어 모델(LLM)과 상호작용하는 방식, 추론과 계획이 유도되는 방식, 외부 맥락이 통합되는 방식, 그리고 인간 또는 자동화된 피드백이 모델 행동에 영향을 미치는 방식을 점진적으로 특성화하는 서로 연관된 여섯 가지 질문에 의해 안내된다. 각 질문은 하나 이상의 분류체계 노드(절)에 직접 정보를 제공하며, 그에 대응하는 답변은 특정 리프 기법(하위 절)의 포함을 정당화한다.

Q1: 프롬프트는 과업 지시만을 사용하며, 아니면 모델 행동을 안내하기 위한 시연 예시도 포함하는가?

이 질문은 모델이 순전히 지시만으로 안내되는지, 아니면 예시를 통해 추가로 안내되는지에 따라 프롬프트 기반 상호작용의 가장 기초적인 형태를 구분한다.

매핑 및 근거: 중간 구조 없이 직접적인 지시에 의존하는 기법은 기본 프롬프팅 기법 으로 4절에 묶인다. 제로샷 프롬프팅은 모델이 사전학습된 지식만으로 일반화할 것으로 기대되는 최소 상호작용 패러다임을 나타낸다. 퓨샷 프롬프팅은 원하는 과업 행동에 맞게 모델을 조건화하는 시연 예시를 통합하여 이 패러다임을 확장한다. 이 기법들은 최소한의 개입만 필요하고 더 고급 방법의 기준선 역할을 하므로 분류체계의 기초 계층을 형성한다.

Q2: 프롬프트는 단일 추론 궤적 내에서 단계별 논리적 추론을 명시적으로 강제하는가?

이 질문은 프롬프트가 모델이 중간 추론 단계를 선형적이고 해석 가능한 방식으로 외현화하도록 장려하는지를 포착한다.

매핑 및 근거: 5절에서 단일 궤적을 따라 구조화된 추론을 명시적으로 안내하는 기법은 단계별 추론 및 논리적 사고 로 분류된다. 사고 사슬 프롬프팅은 이 패러다임의 정형적 사례를 구성하며, Automatic CoT, Logical CoT, Chain-of-Symbol 프롬프팅과 같은 확장은 추론 단계가 생성, 제약 또는 기호적으로 표현되는 방식에 변형을 도입한다. 이 기법들은 분기나 다중 경로 탐색을 도입하지 않고 논리적 일관성을 향상한다는 공통 목표를 공유하므로 함께 묶인다.

그림 4. 본 조사에서 채택한 연구 식별, 선별, 적격성 평가, 후방 참고문헌 추적 과정 및 최종 연구 선정을 보여주는 PRISMA 양식 흐름도.

Q3: 프롬프트는 결과를 확정하기 전에 여러 추론 경로나 결정을 탐색하도록 장려하는가?

이 질문은 선형적 추론을 숙고, 분기 또는 대안적 해결 경로 간 비교를 명시적으로 모델링하는 접근법과 구분한다.

매핑 및 근거: 다중 경로 추론이나 의사결정 탐색을 가능하게 하는 기법은 다단계 의사결정 및 계획 으로 6절에 분류된다. Tree-of-Thoughts와 Graph-of-Thought 같은 방법은 여러 후보 경로에 대한 검색 과정으로 추론을 명시적으로 구조화한다. System 2 Attention과 Thread-of-Thought 프롬프팅은 숙고적 추론을 더욱 강조하는 한편, Chain of Table 프롬프팅은 표 형식 표현을 바탕으로 의사결정을 구조화한다. 이 기법들은 최종 의사결정 전에 통제된 탐색에 초점을 둔다는 점에서 통합된다.

Q4: 프롬프트는 외부 맥락, 검증 메커니즘 또는 적응적 지식 검색을 통합하여 추론을 향상하는가?

이 질문은 프롬프팅 전략이 외부 정보원 또는 맥락 정제 메커니즘을 통합함으로써 내부 모델 추론을 넘어서는지를 다룬다.

매핑 및 근거: 사실 기반성, 맥락 인식 또는 검증을 개선하는 기법은 7절에서 맥락 향상 및 적응형 학습 으로 묶인다. 검색 증강 생성은 외부 지식 검색을 도입하는 반면, ReAct는 추론과 도구 사용을 결합한다. Chain-of-Verification, Chain-of-Note, Chain-of-Knowledge 프롬프팅은 검증, 맥락 통합 및 구조화된 지식 통합을 강조한다. 이 방법들은 신뢰성과 사실적 일관성을 향상한다는 공통 목표 때문에 함께 분류된다.

Q5: 프롬프팅 과정에는 인간과 모델 간의 반복적 상호작용, 피드백 또는 협업이 포함되는가?

이 질문은 프롬프팅 루프의 상호작용성과 적응성 정도를 포착한다.

매핑 및 근거: 피드백, 사용자 개입 또는 자동화된 정제를 명시적으로 수반하는 기법은 상호작용 및 인간-AI 협업 기법 으로 8절에 분류된다. Active-Prompt와 Automatic Prompt Engineer는 반복적 정제 과정을 도입하는 반면, Automatic Reasoning and Tool-use와 Contrastive CoT 프롬프팅은 피드백 기반 또는 대조적 메커니즘을 활용하여

추론 품질을 개선한다. 이 접근법들은 프롬프팅을 정적인 지시가 아닌 상호작용적 과정으로 다룬다는 점에서 함께 묶인다.

Q6: 프롬프트는 인간과 유사한 추론을 모방하거나 과업 성능을 향상하기 위해 인지적, 정서적 또는 최적화 지향적 메커니즘을 통합하는가?

이 질문은 논리적 추론을 넘어 인지적 스캐폴딩, 정서적 단서 또는 최적화 목표를 통합하는 고급 프롬프팅 패러다임을 포착한다.

매핑 및 근거: 이러한 측면을 다루는 기법은 9절에서 정서 인식 및 심리학적 기법 으로 묶인다. Emotion 프롬프팅과 Scratchpad 프롬프팅은 정서적 또는 인지적 스캐폴딩을 도입하는 반면, Program of Thoughts, Structured CoT, Chain of Code는 구조화된 계산적 추론을 강조한다. Optimization by Prompting, Rephrase and Respond, Take a Step Back 프롬프팅 및 텍스트-이미지 프롬프트 엔지니어링은 이 패러다임을 성능 최적화와 멀티모달 생성으로 확장한다. 이 기법들은 심리학에서 영감을 받은 메커니즘을 통해 추론의 깊이, 적응성 또는 창의성을 향상하는 데 초점을 둔다는 점에서 통합된다.

질문 주도형 매핑의 의의

명시적인 연구 질문에 분류체계를 기반으로 함으로써, 이 분류는 세 가지 중요한 목표를 달성한다. 첫째, 개념적으로 구별되는 절 전반에 기법을 분배하여 구조적 불균형을 방지한다. 둘째, 피상적 유사성이 아닌 공유된 상호작용 원리에 따라 방법을 정렬함으로써 의미 있는 비교를 가능하게 한다. 셋째, 전체 구조를 훼손하지 않고 새롭게 등장하는 프롬프팅 기법을 수용할 수 있는 확장 가능하고 신장 가능한 프레임워크를 제공한다. 결과적으로 제안된 분류체계는 조직화 도구일 뿐만 아니라 프롬프트 엔지니어링의 진화하는 지형을 이해하기 위한 분석적 렌즈 역할도 한다(그림 5).

4. 기본 프롬프팅 기법(LLM을 안내하기 위한 기초적 접근법)

4.1. 제로샷 프롬프팅 – LLM은 예시 없이 응답을 생성한다

제로샷 프롬프팅은 사전에 예시가 제공되거나 해당 과업에 대해 특별히 학습되지 않은 상태에서 특정 과업을 수행하도록 지시하는 자연어 처리 접근법이다. 모델은 직접적인 감독을 전제하지 않고, 대신 사전학습 중에 내재화된 언어, 의미 관계 및 맥락적 추론에 관한 지식을 활용하여

그림 5. 대규모 언어 모델을 위한 프롬프트 엔지니어링 기법의 질문 중심 분류 체계.

그림 6. 제로샷 프롬프팅 과정의 개념적 표현. 이 도표는 지식 검색, 맥락 분석, 응답 생성을 포함한 입력 데이터 처리의 주요 단계를 보여 주며, 이를 통해 LLM은 작업별 학습 예시 없이도 작동할 수 있다.

요청된 지시를 수행한다. 프롬프트에 예시 출력이 없으므로 출력은 질의에 인코딩된 정보로부터 추론되어야 한다 [1]. 미세 조정을 위해 레이블이 지정된 데이터셋에 의존하는 기존 기계 학습 방법론과 달리, 제로샷 프롬프팅은 사전 학습된 모델의 일반화 능력을 활용한다. 이를 통해 LLM은 도메인별 학습 데이터를 필요로 하지 않고도 텍스트 분류, 논리적 추론, 콘텐츠 생성 등 다양한 작업을 수행할 수 있다 [5]. 그러나 제로샷 프롬프팅의 효율성은 프롬프트의 정확성과 명확성에 달려 있다. 구조가 좋지 않거나 모호한 지시는 부정확하거나 일관되지 않거나 의도한 목표와 부합하지 않는 출력을 초래할 수 있다 [27]. 따라서 제로샷 환경에서 모델 생성 응답의 신뢰성과 해석 가능성을 향상하려면 프롬프트 설계를 최적화하는 것이 중요하다.

4.1.1. 작동 원리

모델은 작업별 학습이나 명시적 예시에 의존하지 않고, 기존 지식과 일반화 능력을 활용하여 새로운 프롬프트를 해석하고 응답을 생성한다 [5]. 모델은 사전 학습 단계에서 습득한 광범위한 언어 이해, 개념적 관계 및 맥락적 연관성을 활용하여 제공된 프롬프트만을 바탕으로 예상 출력을 추론한다 [27].

이 과정은 다음과 같이 형식적으로 표현할 수 있다 [70]:

다음과 같이 두자: P 는 입력 프롬프트를 나타내고, K 는 모델의 지식 기반을 나타내며, R 는 생성된 응답을 의미한다. 따라서 제로샷 프롬프팅 방법은 수학적으로 다음과 같이 표현할 수 있다:

R = f(P, K)

여기서 f 는 주어진 프롬프트와 모델의 내부 지식 기반을 적절한 응답으로 변환하는 함수를 나타낸다.

그림 6은 데이터 수집, 토큰화, 신경망 아키텍처 활용 및 예측 추론을 포괄하는 제로샷 프롬프팅 과정의 핵심 단계를 보여 준다. 또한 패턴을 식별하고, 관련 지식을 추출하며, 맥락적 일관성을 확립하는 모델의 능력은 정확하고 의미 있는 출력을 보장하는 데 중요하다. 이 접근법은 다양한 도메인에서 대규모 언어 모델의 적응성과 활용도를 높이며, 특히 레이블이 지정된 데이터셋이 부족하거나 존재하지 않을 때 유리하다.

모델의 사전 학습 지식의 품질과 철저성, 그리고 이전에 본 적 없는 작업과 도메인에 일반화하고 적응하는 능력은 제로샷 프롬프팅의 효과에 영향을 미치는 핵심 요인이다 [71].

4.1.2. 제로샷 프롬프팅의 예시

제로샷 프롬프팅의 일반적인 적용 사례는 다음과 같다 [27]:

"안녕하세요, 어떻게 지내세요?"

다국어 데이터로 학습된 모델은 다음 번역을 제공할 수 있어야 한다:

"Bonjour, comment allez-vous?"

잎들이 붉고 황금빛으로 떨어지고,
부드러운 바람이 이야기를 들려준다.
공기는 상쾌하고, 해는 낮게 떠 있으며,
가을의 아름다움이 빛나기 시작한다.

"노인은 공원 벤치에 앉아,
아이들이 노는 모습을 바라보았다.
그는 자신의 어린 시절을 떠올렸다.
웃음과 기쁨으로 가득했지만,
잃어버린 친구들과 빛바랜 꿈의
슬픔도 깃들어 있었다.
그는 시간이 흘러간다는 것을 깨달았지만,
기억은 남는다는 것도 깨달았다."

제로샷 모델은 향수, 시간의 흐름, 기억의 씁쓸하면서도 달콤한 본질과 같은 주제를 식별할 수 있어야 한다.

4.1.3. 제로샷 프롬프팅의 장점

제로샷 프롬프팅은 다음과 같은 몇 가지 주요 장점을 제공한다 [27,52]:

프롬프트 엔지니어링의 효율성은 기존 기계 학습 워크플로(표 4)와 제로샷 접근법(표 5)을 비교할 때 특히 뚜렷해진다. 기존 방법론은 데이터 수집, 전처리, 모델 학습 및 반복적 개선에 광범위한 시간을 필요로 하며, 배포 전까지 수 주가 걸리기도 한다. 표 4에서 보이듯이, 이러한 단계는 개발 주기를 크게 연장하고 계산 요구량을 증가시킨다.

반대로 표 5에서 설명한 바와 같이, 제로샷 접근법은 광범위한 데이터셋 준비와

표 4

기존 접근법과 제로샷 접근법 간 소요 시간 요구 사항의 맥락적 비교.

통합 작업 기존 접근법(예상 시간) 제로샷 접근법(예상 시간)
문제 이해 및 작업 정의
모델 준비(데이터 수집, 정제, 학습) 수일에서 수 주 필요 없음
솔루션 설계(모델 아키텍처 / 프롬프트 설계) 수분에서 수 시간
테스트 및 반복 수일에서 수 주
배포 및 통합 시간

표 5

소수 예제 학습의 과제와 모범 사례.

효과적인 예제 선택 프롬프트 설계 과적합 방지
관련성 다양성 명확성 일관성 맥락적 단서 단순성 예제 다양성 균형 잡힌 프롬프트 반복적 테스트

맞춤형 모델 학습. 사전 학습된 모델을 활용하면 과제 성능은 데이터 기반 재학습이 아니라 프롬프트 설계에 의해 좌우된다. 이러한 계산 복잡성의 감소는 더 빠른 배포를 가능하게 하므로, 특히 실시간 애플리케이션과 신속한 프로토타이핑에서 제로샷 프롬프팅은 효율적인 대안이 된다.

4.1.4. 제로샷 프롬프팅의 한계

상당한 장점에도 불구하고, 제로샷 프롬프팅에는 몇 가지 내재적 한계가 있다 [72].

정확도: 제로샷 프롬프팅의 정밀도는 다음 요인들로 인해 미세 조정된 모델에 비해 부족한 경우가 많다:

프롬프트 민감성: 제로샷 프롬프팅의 효율성은 프롬프트 설계 방식에 크게 영향을 받는다:

예를 들어 동일한 입력 데이터가 주어져도 프롬프트 문구를 약간 수정하면 응답의 길이, 세부성 및 초점에 변화가 생길 수 있으며, 이는 모델이 언어적 뉘앙스에 민감함을 강조한다.

편향: 사전 학습된 모델에 의존하는 제로샷 프롬프팅은 학습 데이터에 존재하는 편향에 취약하며, 이로 인해 다음과 같은 문제가 발생한다:

비판적 분석

제로샷 프롬프팅은 사전 학습된 일반화 능력을 활용하여 시연 예시 없이도 신속한 과제 적응을 지원한다 [73]. 그러나 실증적 연구 결과는 GSM8K와 같은 다단계 추론 과제에서 신뢰성이 낮아짐을 보여준다 [27,74].

주된 절충점은 토큰 효율성과 추론 견고성 사이에 있다. 제로샷은 입력 길이와 지연 시간을 최소화하지만, 프롬프트 문구와 지시의 모호성에 여전히 민감하다.

남은 과제로는 바꿔 쓴 프롬프트에 대한 견고성 개선과 제로샷 안정성을 위한 표준화된 평가 벤치마크 수립이 있다.

4.2. 퓨샷 프롬프팅

정교한 NLP 방법인 퓨샷 프롬프팅은 몇 개의 예시를 제공하여 AI 모델의 과제 수행 능력을 향상한다 [75]. 사전 학습된 지식에만 의존하는 제로샷 프롬프팅과 달리, 퓨샷 프롬프팅은 이러한 예시를 맥락적 지침으로 활용하여 응답의 정확성과 관련성을 개선한다 [74–76]. 이 방법은 예시를 전혀 필요로 하지 않는 제로샷 학습과 광범위한 레이블링된 데이터셋을 필요로 하는 완전 지도 미세 조정 사이의 중간 단계 역할을 한다. 제한된 수의 시연 예시를 포함함으로써, 퓨샷 프롬프팅은 프롬프트 기반 학습에 내재된 유연성을 유지하면서 접근법을 특정 과제에 맞춤화할 수 있게 한다.

4.2.1. 작동 원리

퓨샷 프롬프팅의 근본 원리는 과제별 시연 예시를 프롬프트 내에 포함하는 데 있다. 이러한 예시는 암묵적 지시로 작용하여 모델의 행동을 안내한다. 일반적으로 시연 예시는 다음 특성을 보인다:

이러한 시연 예시를 처리할 때, 대규모 언어 모델(LLM)은 인컨텍스트 학습 을 활용하는데, 이는 최소한의 감독으로 일반화할 수 있게 하는 과정이다. 이 과정은 다음 단계로 나눌 수 있다:

그림 7에 나타난 바와 같이, 퓨샷 프롬프팅 프레임워크는 광범위한 레이블링된 데이터셋에 대한 의존을 최소화하면서 과제 적응성을 향상한다. 제로샷 프롬프팅과 비교할 때, 이 접근법은 특히 추론 집약적 애플리케이션에서 과제별 정확도를 크게 개선한다.

4.2.2. 퓨샷 프롬프팅의 예시

퓨샷 프롬프팅은 일반적으로 다음과 같은 다양한 자연어 처리(NLP) 애플리케이션에 사용된다:

그림 7. 퓨샷 프롬프팅 과정의 개념적 표현. 이 도표는 패턴 인식, 과제 추론, 일반화 및 적용을 포함한 핵심 단계를 개략적으로 보여 주며, LLM이 제한된 예시를 활용하여 응답을 생성하는 방식을 설명한다.

4.2.3. 퓨샷 프롬프팅의 장점

퓨샷 프롬프팅은 다음을 포함하여 제로샷 학습보다 뚜렷한 장점이 있다:

4.2.4. 퓨샷 프롬프팅의 한계

장점에도 불구하고, 퓨샷 프롬프팅에는 내재적 한계가 있다:

최적의 프롬프트 설계와 반복적 개선을 통해 이러한 한계를 해결함으로써, 퓨샷 프롬프팅은 효율성과 정확성의 균형을 유지하면서 LLM 출력을 안내하는 강력한 기법으로 남아 있다.

비판적 분석

퓨샷 프롬프팅은 모델이 시연 사례를 조건으로 삼도록 하여 작업 정렬을 개선한다 [79]. 연구들은 예시의 순서와 시연 사례 선택에 대한 민감성을 보여준다 [61].

이 절충안은 향상된 추론 정확도와 증가한 토큰 오버헤드 및 컨텍스트 윈도우 제약 사이에 존재한다.

향후 연구에서는 자동화된 시연 사례 선택과 모델 간 재현성을 다루어야 한다.

5. 단계별 추론 및 논리적 사고 (LLM에서 구조화된 사고를 유도하는 기법)

5.1. 사고 사슬(CoT) 프롬프팅

사고 사슬(Chain-of-Thought, CoT) 프롬프팅은 복잡한 문제를 조직화된 순차적 단계로 나누어 대규모 언어 모델(LLM)의 추론 능력을 향상하는 구조화된 접근법이다 [2,27]. 암묵적 패턴 인식에 의존하는 직접 응답 프롬프팅과 달리, CoT는 논리적 일관성과 향상된 정확도를 보장하는 구조화된 도출 과정을 용이하게 한다. CoT는 수학적 문제 해결, 논리 분석, 상식 추론을 비롯하여 다단계 추론이 필요한 작업에 특히 유용하다. 추론 과정을 명확히 개괄함으로써 CoT는 LLM이 더 해석 가능하고 투명한

그림 8. 전형적인 사고 사슬 프롬프팅 과정.

답변을 생성하도록 하며, 이는 명확성이 필수적인 분야에 이상적이다. 연구에 따르면 CoT 프롬프팅은 퓨샷 학습을 크게 향상하여 모델이 다양한 문제 영역 전반으로 더욱 효과적으로 일반화할 수 있게 한다 [2]. 그림 8은 전형적인 사고 사슬 프롬프팅 과정을 제시한다. 또한 CoT는 인간의 인지적 문제 해결 전략과 부합하여 AI가 생성한 추론을 인간의 직관에 더욱 맞게 만든다. CoT의 영향은 단순한 질의응답 작업을 넘어 법률 분석 [80–82], 소프트웨어 설정 [83], 의료 진단 [84,85], 과학 연구 [86–88]와 같이 구조화된 논리 추론이 기본적인 응용 분야에서 매우 가치 있음을 입증한다. AI가 계속 발전함에 따라 CoT는 프롬프트 엔지니어링에서 핵심적인 혁신으로 남아 모델 생성 응답의 깊이, 신뢰성 및 해석 가능성을 향상한다.

5.1.1. 작동 원리

즉각적인 응답을 추구하는 표준 프롬프팅과 달리, CoT 프롬프팅은 모델이 결정을 내리기 전에 단계적으로 사고 과정을 명확히 하도록 지시한다 [89]. 이 방법은 다음과 같은 여러 이점을 제공한다.

그림 8에 제시된 것처럼, CoT 프롬프팅은 문제를 구조적으로 분해하여 더 정확한 결론에 이르게 한다. 이 접근법은 의사 결정 능력 향상, 환각 감소, 생성된 응답의 신뢰성 개선을 위해 대규모 언어 모델(LLM)에서 널리 채택되었다.

5.1.2. 사고 사슬 작업 프롬프팅의 예시

CoT 프롬프팅은 다음을 포함한 다양한 응용 분야에서 성능을 향상한다.

모델은 직접 응답하는 대신 단계별 추론을 따른다. \text{Speed} = \text{Distance} / \text{Time} = 90 \text{ km} / 1.5 \text{ hr} = 60 \text{ km/hr} .

모델은 다음과 같이 설명한다. 대부분의 새는 날 수 있지만, 펭귄은 적응된 생리적 특성으로 인해 예외이다. 따라서 펭귄은 날 수 없다.

단계별 분석: John은 Mike보다 키가 작고 Mike는 Sarah보다 키가 작으므로, John이 가장 키가 작다.

5.1.3. 사고 사슬 프롬프팅의 장점

CoT 프롬프팅은 다음과 같은 몇 가지 핵심 이점을 제공한다.

5.1.4. 사고 사슬 프롬프팅의 한계

장점에도 불구하고, CoT 프롬프팅에는 몇 가지 과제가 있다.

CoT 프롬프팅을 효과적으로 활용하면 AI 모델은 추론 능력을 크게 향상할 수 있으며, 투명성과 시스템 간 호환성을 촉진하면서 복잡한 분석을 위해 더 신뢰할 수 있게 된다.

비판적 분석

사고 사슬 프롬프팅은 산술 및 상식 벤치마크에서 추론 정확도를 크게 향상한다 [2]. 그러나 중간 추론 오류는 전파될 수 있으며 토큰 사용량을 증가시킬 수 있다.

이 절충안은 해석 가능성 향상과 계산 비용 간의 관계를 반영한다.

열린 연구 방향에는 추론 압축과 자동 오류 감지가 포함된다.

5.2. 자동 사고 사슬(Auto-CoT) 프롬프팅

자동 사고 사슬(Automatic Chain-of-Thought, Auto-CoT) 프롬프팅은 전통적인 사고 사슬(CoT) 방법의 개선된 버전이다 [89]. CoT에서 도입된 단계적 추론 원리를 바탕으로, Auto-CoT는 질문을 군집화하고 수동 주석 없이 시연 사례를 유도하여 추론 예시 생성을 자동화한다 [93].

5.2.1. 작동 원리

Auto-CoT는 다음 단계로 작동한다.

그림 9에 나타난 것처럼, 이 과정은 논리적 일관성을 유지하면서 인간의 노력을 줄이기 위해 추론 예시를 반복적으로 구성한다 [89,94].

Auto-CoT를 사용하면 LLM은 특히 수학적 도출, 논리적 추론, 질의응답과 같은 복잡한 추론 작업에서 서로 다른 문제 도메인 전반에 더 잘 일반화할 수 있다. 이러한 자동화는 확장성과 효율성을 향상하여 프롬프트 엔지니어링 및 AI 보조 추론에서 유망한 발전을 이룬다.

5.2.2. 자동 사고 사슬(Auto-CoT) 프롬프팅의 예시

Auto-CoT는 특히 다음과 같은 추론 집약적 작업에 효과적이다:

모델은 최선의 분해 과정을 생성하고 선택한다: “할인 전 가격: 2 \times 6 = 12 . 할인: 12의 10% = 1.2. 최종 가격 = 12 – 1.2 = 10.8.”

모델은 자동으로 추론 경로를 구성한다: “Tom > Jerry > Sam. Sam이 가장 어리다.”

모델은 최선의 Auto-CoT 설명을 선택한다: “육지 면적이 가장 큰 나라는 약 1,700만 제곱킬로미터를 차지하는 러시아이다.”

5.2.3. 자동 사고 사슬(Auto-CoT) 프롬프팅의 장점

Auto-CoT는 수동 CoT 프롬프팅에 비해 몇 가지 핵심적인 개선점을 제공한다:

5.2.4. 자동 사고 사슬(Auto-CoT) 프롬프팅의 한계

장점에도 불구하고 Auto-CoT에는 몇 가지 과제가 있다:

그림 9. [89]에서 제안한 Auto-CoT 방법. 이 그림은 논문에서 이용 가능한 스케치와 기타 정보를 바탕으로 다시 그렸다.

5.2.5. 다중모달 사고 사슬(Auto-CoT) 프롬프팅

CoT는 다중모달일 수 있다. 다중모달 CoT는 동일한 CoT 프레임워크를 사용하지만 여러 모달리티에서 정보를 얻는다. 사용자는 붐비는 공공장소의 사진을 보여 주고 그 장소가 오전에 인기 있는지 물을 수 있다 [95,96].

5.3. 자기 일관성

자기 일관성은 대규모 언어 모델(LLM)의 내재적 확률적 특성을 활용하여, 특히 복잡한 추론 작업에서 산출물의 품질, 정밀도, 신뢰성 및 견고성을 향상시키는 프롬프팅 방법이다 [97].

고정된 방법에 의존해 해결책에 도달하는 전통적인 단일 경로 추론과 달리, 자기 일관성은 동일한 문제에 대해 여러 다양한 추론 경로를 생성하고 이러한 대안들 중 가장 일관된 응답을 식별한다 [98]. 이 기법은 모델 출력의 무작위 변동이 미치는 영향을 효과적으로 줄여 추론 과정을 더 구조적이고 논리적으로 만든다. 해결책에 도달하기 위해 고정된 방법에 의존하는 전통적인 단일 경로 추론과 달리, 자기 일관성은 동일한 문제에 대해 여러 다양한 추론 경로를 생성하고 이러한 대안들 중 가장 일관된 응답을 식별한다 [99]. 이 확률적 방법은 수학, 일상적 추론, 전략적 의사결정을 포함한 다양한 영역에서 정확한 해결책을 도출하는 모델의 숙련도를 강화하는 동시에 모호성, 논리적 연역 및 다단계 문제 해결을 처리하는 능력을 증대한다. 또한 자기 일관성은 휴리스틱 지름길에서 비롯되는 오류를 완화하는 데 핵심적이며, 이로써 엄격한 논리적 연역이 요구되는 실제 응용에서 LLM의 신뢰성을 높인다.

5.3.1. 작동 원리

자기 일관성은 복잡한 추론 문제의 정답에 도달하는 실행 가능한 방법이 여러 가지 있다는 원리에 따라 작동한다 [97]. 이 과정에는 다음이 포함된다:

그림 10에 나타난 바와 같이, 자기 일관성 방법은 세 가지 주요 단계로 구성된다: (1) 언어 모델 향상을 위한 사고 사슬(CoT) 프롬프팅 활용, (2) 다양한 추론 경로를 생성하기 위해 기존의 탐욕적 디코딩 방식을 샘플링으로 대체, (3) 가장 일관된 응답을 통합하기 위해 서로 다른 추론 경로를 주변화한다. 이러한 언어 모델의 적용은 단일 경로 추론을 통해 추론 능력을 향상시켜, 모델이 출력을 생성하기 전에 다양한 가능성을 탐색할 수 있도록 한다. 자기 일관성 기법은 응답 생성에 다양성을 도입하고 가장 신뢰할 수 있는 응답을 결정함으로써 언어 모델의 추론 능력을 개선한다. 이 접근법은 모델이 출력을 확정하기 전에 다양한 가능성을 탐색하도록 하여 편향되거나 부정확한 단일 경로 추론의 가능성을 줄인다. 자기 일관성을 활용함으로써 언어 모델은 특히 수학, 상식 추론, 구조화된 의사결정과 같이 논리적 추론이 필요한 영역에서 복잡한 문제 해결 작업의 정확도를 높인다.

그림 10. 자기 일관성 접근법은 세 단계의 과정을 통해 언어 모델의 추론을 개선한다: (1) 구조화된 추론을 위한 CoT 프롬프팅 사용, (2) 다양한 추론 경로를 탐색하기 위한 디코더 샘플링, (3) 견고한 결론을 위해 가장 일관된 답변 선택 [97].

• 다단계 산술:

“다음의 값은 3 + 5 \times 2 - 4 \div 2 ?”

모델은 여러 추론 경로를 생성하며, 각 경로에는 서로 다른 중간 단계와 잠재적으로 서로 다른 최종 답변이 있다. 자기 일관성을 적용하면 가장 일관된 답변인 11을 식별한다.

• 상식 추론:

“비가 오는데 밖에 나가고 싶다면 무엇을 가지고 가야 하는가?” 모델은 우산, 우비 또는 둘 다와 같은 서로 다른 답변을 생성할 수 있다. 자기 일관성은 맥락에 따라 가장 일관되고 타당한 답변을 식별하는 데 도움이 된다.

• 기호 추론:

“A가 B보다 크고 B가 C보다 크다면, A는 C보다 큰가?” 모델은 답에 도달하기 위해 서로 다른 논리 사슬을 생성할 수 있다. 자기 일관성은 최종 답변이 생성된 논리 경로 대부분과 일관되도록 보장한다.

5.3.3. 자기 일관성의 장점

자기 일관성은 여러 이점을 제공한다:

5.3.4. 자기 일관성의 한계

자기 일관성 방법은 여러 샘플링된 응답을 집계하여 추론을 개선하지만, 몇 가지 한계가 있다:

이러한 한계에도 불구하고, 자기 일관성은 특히 예측 가능하고 검증 가능한 응답이 필요한 과제에서 언어 모델의 논리적 추론을 강화하는 데 중요한 역할을 한다.

비판적 종합

자기 일관성은 여러 추론 경로를 샘플링하고 합의된 출력을 선택함으로써 추론의 견고성을 향상한다 [97]. 경험적 증거는 탐욕적 디코딩 대비 일관된 개선을 보여준다.

실패 조건: 여러 순전파로 인한 계산 오버헤드.

상충 관계: 다양성을 통한 견고성과 추론 비용 간의 균형.

미해결 과제: 추론 다양성을 유지하면서 샘플링 복잡도를 줄이는 것.

5.4. 논리적 CoT(LoT) 프롬프팅

LoT 프레임워크는 LLM의 제로샷 사고 사슬(CoT) 추론 능력을 향상하기 위한 새로운 프롬프팅 기법이다. LoT의 핵심은 기존 CoT 접근법의 주요 한계, 즉 LLM이 환각을 일으키거나 논리적으로 일관되지 않은 추론 흔적을 생성하는 경향을 해결하는 데 있다 [103]. LLM은 인상적인 일반화 능력과 사실 기억을 보여 왔지만, 다단계 추론은 종종 오류 전파로 인해 신뢰할 수 없는 결론에 이른다. LoT는 상징 논리의 고전적 원리, 특히 귀류법

을 활용하여 추론 과정에 체계적인 검증 메커니즘을 통합한다. 이 프레임워크에서 추론 단계를 생성하는 일은 일회성 과정이 아니다. 대신 각 단계는 논리적 일관성을 위해 이전에 확립된 전제와 비교하여 비판적으로 평가된다 [103]. 이 방법은 LLM이 다음을 수행하도록 안내하는 “생각-검증-수정” 루프를 도입한다 [61,72]:

이 과정은 LLM이 추론 경로를 동적으로 정제할 수 있게 한다. LoT는 각 단계에 논리적 검증을 통합함으로써 오류를 최소화하고 각 결론이 이용 가능한 증거와 논리 규칙에 확고히 근거하도록 하는, 더 견고하고 신뢰할 수 있는 추론 사슬을 생성하는 것을 목표로 한다. 이 프레임워크는 수학 문제 해결, 인과 추론, 상식 추론과 같이 다단계 추론이 필요한 활동에 특히 적합하다 [72,103].

5.4.1. 작동 원리

LoT 프롬프팅의 기본 작동 원리는 사고 과정 전체의 논리적 일관성을 보장하는 구조화된 추론과 검증의 반복적 순환을 중심으로 한다. 이 방법론은 단계적 논리 추론 접근법을 포함하는 “생각-검증-수정” 패러다임에 기반한다 [72].

1. 초기 추론 생성: 제로샷 환경에서 LLM은 (예: “단계별로 생각해 봅시다”와 같은 문구로) 일련의 추론 단계를 생성하도록 프롬프트된다. \{T_1, T_2, \dots, T_N\} 로 표기되는 이 단계들은 초기 프롬프트 또는 주어진 전제 P 로부터 자기회귀적으로 도출된다. 이 초기 사고 사슬은 문제를 분해하지만, 명시적 논리 제약이 없으므로 오류에 취약하다.

2. 논리적 일관성 검사를 이용한 검증: 각 추론 단계 T_i 는 논리적 함의 P , T_1, \dots, T_{i-1} \vdash T_i 를 살펴봄으로써 확인된다. 귀류법의 원리가 검증 메커니즘에 영감을 준다. 구체적으로 프레임워크는 다음의 논리곱 명제를 고려한다:

C_i = P \wedge T_1 \wedge \dots \wedge T_{i-1} \wedge \neg T_i,

그리고 이 명제가 모순으로 이어지는지 검토한다. C_i 가 모순적(즉, 모든 값 할당에서 거짓)인 것으로 판명되면, T_i 는 선행 단계들로부터의 유효한 논리적 귀결로 간주된다. 검증 과정의 두 가지 변형이 제안된다:

5.4.2. 논리적 사고(LoT)의 예시

논리적 사고(LoT) 과제는 구조화된 추론과 추론적 판단이 필요한 다양한 문제 해결 시나리오를 포함한다. 신뢰할 수 있는 결과에

도달하기 위해, 이 과제들은 관계를 검토하고, 패턴을 식별하며, 연역적 또는 귀납적 추론을 사용하는 모델의 능력을 활용한다. LoT 프롬프팅 기법을 활용하면 언어 모델은 복잡한 논리 문제를 순차적 단계로 효과적으로 분해하여 정확성과 해석 가능성을 높일 수 있다 [72]. 다음 예시는 수학적 추론, 논리적 연역, 사실 기반 질의응답을 다루는 데 있어 LoT의 효과를 보여 주며, 서로 다른 영역에서 LoT가 적용되는 방식을 설명한다.

문제 : 두 수를 곱한 값이 36이고 그중 하나가 4일 때, 다른 수는 무엇인가?

기존 LLM 응답 : 다른 수는 9이다.

LoT 강화 응답 :

  1. 1. 생각: 미지수를 x 라고 하자. 4 \times x = 36 이 주어졌다.
  2. 2. 검증: x 에 대해 풀면, x = \frac{36}{4} = 9 를 얻는다.
  3. 3. 수정: 검증: 4 \times 9 = 36 으로, 주어진 정보와 일치한다. 따라서 다른 수는 실제로 9이다.

문제 : Tom이 Jerry보다 키가 크고 Jerry가 Sam보다 키가 크다면, 가장 키가 작은 사람은 누구인가?

기존 LLM 응답 : Sam이 가장 작습니다.

LoT 강화 응답 :

  1. 1. 사고: 키 관계는 다음과 같습니다: T > J > S .
  2. 2. 검증: Tom은 Jerry보다 키가 크고 Jerry는 Sam보다 키가 크므로, Tom은 Sam보다 키가 크다는 결론이 나옵니다.
  3. 3. 수정: 따라서 Tom과 Jerry보다 모두 작은 Sam이 가장 작습니다.

문제 : 모든 장미는 꽃입니다. 일부 꽃은 빨리 시듭니다. 특정 장미가 빨리 시든다는 결론을 내릴 수 있을까요?

기존 LLM 응답 : 예, 일부 장미는 빨리 시듭니다.

LoT 강화 응답 :

  1. 1. 사고: 모든 장미는 꽃입니다. 특정 꽃은 빨리 시듭니다.
  2. 2. 검증: 특정 꽃이 빨리 시든다고 해서 그것이 장미라는 뜻은 아닙니다.
  3. 3. 수정: 따라서 전제만으로는 일부 장미가 빨리 시든다고 단정할 수 없습니다.

5.4.3. 논리적 사고(LoT)의 장점

논리적 사고(Logical Thoughts, LoT) 프레임워크를 대규모 언어 모델(LLM)에 통합하면, 특히 추론 능력 향상, 환각 감소, 논리적 일관성 보장 측면에서 여러 이점을 제공합니다. 주요 이점은 다음과 같습니다 [72]:

진술의 위험을 줄입니다. 이러한 개선은 잘못된 추론이 중대한 결과를 초래할 수 있는 의료 진단, 금융 분석 및 법적 의사 결정 애플리케이션에서 특히 중요합니다.

5.4.4. 논리적 사고(LoT)의 한계

이점에도 불구하고 LoT 프롬프팅에는 몇 가지 한계가 있습니다:

5.5. 기호 연쇄(CoS) 프롬프팅

설명을 간결한 기호 표현으로 변환합니다. 상세한 언어적 추론에 의존하는 기존 사고 연쇄(Chain-of-Thought, CoT) 접근법과 달리, CoS 프롬프팅은 중간 추론 단계를 생성하고 공간 설명을 추상 기호 집합으로 체계적으로 대체합니다. 이러한 기호 변환은 중복 정보를 줄이고 상대적 위치와 이동 같은 기본 공간 관계를 더 구조화되고 효율적인 형식으로 캡슐화하여 모델 정확도를 높이고 계산 오버헤드를 줄입니다 [104].

근본적으로 CoS 프롬프팅은 복잡한 공간 과제를 일련의 모듈형 기호 연산으로 추상화하며, 각 기호는 특정 공간 관계 또는 동작을 나타냅니다. 이러한 추상화는 추론 과정의 더 정밀한 추적 가능성과 해석 가능성을 촉진하여 모델이 복잡한 공간 환경을 더 높은 정밀도로 다룰 수 있게 합니다. 또한 간소화된 기호 표현은 Brick World 및 기타 공간 계획 과제와 같은 벤치마크 과제에서 입증된 바와 같이, 특히 공간 요소의 세부 계획과 조작이 필요한 시나리오에서 더 확장 가능한 성능을 제공합니다 [104].

5.5.1. 작동 원리

기호 연쇄 프롬프팅의 작동 원리는 자연어로 중간 추론을 생성한 다음 이 출력을 압축된 기호 표현으로 변환하는 두 단계 과정에 기반합니다. 처음에는 퓨샷 맥락에서 모델에 공간 계획 과제에 대한 단계별 접근법을 개괄하는 상세한 사고 연쇄 추론을 생성하도록 요청합니다. 이후 이 추론은 특정 공간 관계나 연산을 각각 나타내는 미리 정의된 추상 기호로 장황한 공간 설명을 체계적으로 대체하여 정제됩니다. 이를 통해 이 과정은 자연어에 내재된 중복을 완화하고 중간 추론을 모델의 내부 계산 구조에 더 밀접하게 정렬하여 효율성과 명확성을 향상시킵니다 [104].

실질적으로 이 접근법은 처음에 완전한 자연어로 설명된 공간 시나리오를 기호 시퀀스로 변환하는 시연을 구성하는 것을 포함합니다. 이 기호들은 "위에 있는" 또는 "인접한"과 같은 공간 관계를 위한 원자적 토큰으로서, 복잡한 공간 환경을 탐색하는 데 필요한 핵심 논리를 담고 있습니다. 추론 중에 적용될 때 기호 연쇄는 모델의 최종 의사 결정 과정을 안내하는 간결한 청사진이 됩니다. 이 방법은 투명하고 추적 가능한 추론 경로를 제공하면서 토큰 수와 계산 오버헤드를 크게 줄이고, 궁극적으로 공간 추론 과제의 정확도를 향상시킵니다 [104].

5.5.2. 기호 연쇄(CoS) 프롬프팅의 예시

예시 1. Brick World 과제

시나리오:

자연어 프롬프트(CoT 스타일):

  1. 1. 벽돌 B 위에서 벽돌 A를 제거합니다.
  2. 2. 벽돌 D 위에서 벽돌 E를 제거합니다.
  3. 3. 이제 벽돌 D가 가장 위에 있는 노란색 벽돌이므로 집을 수 있습니다.

기호 연쇄 프롬프팅:

B/A/D/E/C
C/E
E/D D

그림 11. CoT와 CoS 프롬프팅의 비교 예시입니다. CoS가 LLM이 더 적은 입력 토큰으로 복잡한 과제를 효율적으로 제어할 수 있게 하는 방식을 강조합니다. [104]의 개념을 바탕으로 작성되었습니다.

예시 2: 자연어 탐색 시나리오:

CoT 프롬프트(자연어 추론):

  1. 1. Bank A에서 시작합니다.
  2. 2. Bank C까지 200m 이동한다.
  3. 3. House H까지 100m 이동한다.
  4. 4. Cinema F까지 100m 이동한다.
  5. 5. Store B까지 200m 이동한다.
  6. 6. Store B가 가장 가까운 상점이다.

CoS 프롬프트:

A / C / H / F / B

각 위치는 추가적인 설명 텍스트 없이 이동 경로를 나타내는 기호 표기법으로 연결된다. 예시 3: NLVR 기반 객체 조작 시나리오:

CoT 프롬프트(자연어 추론):

  1. 1. 세 상자에서 모든 검은색 객체 식별:
  2. 2. 객체를 왼쪽 상자로 이동:

CoS 프롬프트:

(M, large, round, black) → L

(R, middle, triangle, black) → L

(R, large, triangle, black) → L

여기서 기호 형식은 중복 없이 이동을 직접 나타낸다.

그림 11에서 보듯이, 기호 연쇄(CoS) 프롬프팅은 장황한 자연어를 대체하여 공간 추론을 효과적으로 향상한다.

설명을 구조화된 기호 표현으로 대체한다. 이 예에서는 벽돌 회수 작업에서 CoT와 CoS 프롬프팅 방법을 비교한다. CoT 접근법은 모호한 추론으로 인해 잘못된 순서를 도출하는 반면, CoS 접근법은 공간 관계를 기호 형식으로 추상화하여 더 효율적이고 정확한 해결책으로 이어진다.

5.5.3. 기호 연쇄(CoS) 프롬프팅의 장점

CoS 프롬프팅은 여러 장점을 제공한다:

5.5.4. 기호 연쇄(CoS) 프롬프팅의 한계

장점에도 불구하고 CoS 프롬프팅에는 몇 가지 한계가 있다:

6. 다단계 의사결정 및 계획(결정 전에 여러 경로 탐색)

6.1. 사고 트리(ToT) 프롬프팅

ToT 프롬프팅은 LLM이 다양한 논증 경로를 탐색하고 서로 다른 해결책을 숙고할 수 있게 하여 문제 해결 능력을 향상하는 정교한 프롬프팅 방법이다 [105]. 선형적인 추론 사슬을 따르는 전통적인 CoT 프롬프팅과 달리, ToT 프롬프팅은 모델이 가능한 해결책의 트리를 생성하고 이를 평가하며, 중간 결과에 따라 최선의 경로를 동적으로 선택할 수 있게 한다 [105,106]. 이 방법은 LLM에서 더 사려 깊고 전략적인 의사결정을 장려하며,

그림 12. 이 그림은 LLM을 활용하는 다양한 문제 해결 기법을 개략적으로 비교하여 제시한다. 이 시각화의 핵심 요소는 사고를 나타내는 직사각형 상자로, 과업 완료를 향한 중간 단계 역할을 하는 일관된 언어 단위이다 [105].

LLM이 다단계 계획과 다양한 전략의 탐색이 필요한 복잡한 문제를 해결할 수 있게 한다 [105].

6.1.1. 작동 원리

사고 트리(ToT) 프레임워크는 구조화된 추론 트리 내에서 탐색, 평가 및 선택이 순환하는 과정을 통해 작동한다. 이 반복적 접근법은 대규모 언어 모델(LLM)이 단순한 토큰 단위 생성을 넘어 더욱 정교한 문제 해결 전략에 참여할 수 있게 한다 [105]. ToT의 작동 원리는 단계별 워크플로로 나누어 살펴볼 수 있다:

  1. 1. 초기화: 이 과정은 초기 프롬프트를 통해 LLM에 제시되는 입력 문제에서 시작한다. 프롬프터 에이전트가 조율하는 이 프롬프트는 LLM이 최종 출력을 직접 구하는 대신 중간 ‘사고’를 생성하도록 유도하게 설계된다 [105,107].
  2. 2. 현재 상태에서의 사고 생성: 현재 상태(처음에는 문제 입력)에서 시작하여, 사고 생성 모듈은 문제 해결 과정에서 잠재적인 다음 단계를 나타내는 후보 ‘사고’ 집합을 생성한다 [Yao et al., 2023]. 생성 전략은 과제와 원하는 사고의 다양성에 따라 달라질 수 있다. 예를 들어, 풍부한 사고 공간을 가진 과제에는 사고 연쇄(CoT) 프롬프트에서의 독립 샘플링을 사용할 수 있는 반면, 더 제약된 영역에는 순차 제안 프롬프팅이 적합하다 [105].
  3. 3. 생성된 사고의 상태 평가: 생성된 각 ‘사고’는 부분 해결책 또는 추론의 중간 단계를 나타내는 새로운 상태로 이어진다. 이어서 상태 평가 모듈은 이러한 각 상태의 품질과 잠재력을 평가한다 [105]. 이 평가는 탐색 과정을 안내하는 데 매우 중요하다. 평가는 룩어헤드 시뮬레이션이나 상식적 추론에 기반하여 LLM이 가치 점수를 부여하도록 프롬프팅하거나, 유망하다고 인식되는 정도에 따라 상태를 비교하고 순위를 매기는 투표 메커니즘을 사용하는 등 다양한 휴리스틱을 통해 구현할 수 있다 [105].
  4. 4. 탐색 알고리즘 적용 및 상태 선택: 상태 평가는 깊이 우선 탐색(DFS) 또는 너비 우선 탐색(BFS)과 같은 탐색 알고리즘이 사고 트리를 순회하는 데 사용된다. [105]는 각 수준에서 가장 큰 잠재력을 보이는 상태 목록을 유지하고 이를 너비 방향으로 탐색한다.

DFS에서는 알고리즘이 먼저 가장 유망한 상태의 탐색을 우선시하고, 해결책을 찾거나 막다른 길에 도달할 때까지 해당 분기를 더 깊이 파고든다 [105]. 탐색 알고리즘은 이러한 평가와 선택한 탐색 전략에 기반하여 추가로 탐색할 다음 상태를 선택한다.

  1. 5. 반복 및 되돌아가기: 선택된 상태가 새로운 현재 상태가 되면서 과정이 반복된다. LLM은 이 상태에서 추가 사고를 생성하고, 사고 생성, 상태 평가 및 선택의 순환이 반복된다 [47,105]. 중요한 점은 ToT 프레임워크가 ToT 컨트롤러가 관리하는 되돌아가기 메커니즘을 통합한다는 것이다. 어떤 상태가 유망하지 않다고 판단되거나(평가 임계값 또는 탐색 알고리즘 기준에 따라) 유효하지 않은 해결책으로 이어지는 경우(검사기 모듈 [105]이 감지), 시스템은 이전 상태로 되돌아가 사고 트리의 대안 분기를 탐색할 수 있다 [105]. 이러한 되돌아가기 기능은 LLM이 잘못된 추론 단계에서 회복하고 다양한 해결 경로를 탐색할 수 있게 한다.
  2. 6. 해결책 도달 또는 종료: ToT 과정은 만족스러운 해결책을 찾거나(예: 수학 문제에서 목표값에 도달하거나 창작 글쓰기에서 일관된 문단을 생성하는 경우) 미리 정의된 탐색 한계(예: 최대 깊이 또는 반복 횟수)에 도달할 때까지 계속된다 [105,106].

그림 12는 입력-출력 프롬프팅(IO), 사고 연쇄 프롬프팅(CoT), CoT를 활용한 자기 일관성(CoT-SC), 사고 트리(ToT)를 포함하여 대규모 언어 모델에 사용되는 다양한 프롬프팅 전략을 비교하여 시각화한다. 각 기법은 구조화된 중간 단계를 통합함으로써 추론 능력을 점진적으로 향상한다. CoT가 단계별 추론을 도입하는 반면, CoT-SC는 다수결 투표와 함께 여러 추론 경로를 활용하여 과정을 정교화한다. 반대로 ToT는 추론 공간을 트리 구조로 확장하여 여러 사고 경로를 병렬로 탐색할 수 있게 하며, 궁극적으로 더 견고하고 정확한 출력을 이끈다. 이러한 계층적 접근법은 특히 복잡한 문제 해결 과제에서 유익하다 …

6.1.2. 사고 트리(ToT) 프롬프팅의 예시

ToT 프롬프팅은 다음과 같이 계획, 탐색 및 의사결정이 필요한 복잡한 문제 해결 시나리오에서 특히 효과적이다:

“인간 상대와 체스 게임을 두세요.”

LLM은 ToT 프롬프팅을 사용하여 서로 다른 가능한 수를 탐색하고, 그 잠재적 결과를 평가하며, 게임의 현재 상태에 따라 전략적으로 최선의 수를 선택한다.

“미스터리한 범죄를 해결하는 탐정에 관한 단편 소설을 쓰세요.”

LLM은 가능한 줄거리 지점, 인물 간 상호작용 및 서사적 반전의 트리를 생성하고, 흥미롭고 일관된 경로를 동적으로 선택하여 매력적인 이야기를 만든다.

“숫자 목록을 오름차순으로 정렬하는 프로그램을 작성하세요.”

LLM은 다양한 정렬 알고리즘을 탐색하고, 그 효율성과 복잡도를 평가하며, 과업의 특정 요구에 따라 최적의 알고리즘을 선택합니다.

1. 수학적 추론: 24 게임

문제 정의:

네 개의 수 \{4, 9, 10, 13\} 가 주어졌을 때, 기본 산술 연산 (+, -, \times, \div) 을 사용하여 24를 만드는 수학적 식을 생성합니다.

사고 트리 접근법:

단일 응답을 생성하는 대신, ToT는 여러 추론 경로를 탐색합니다.

  1. 1. 사고 분해: 24에 이르는 중간 단계를 식별합니다.
  2. 2. 사고 생성: 여러 후보 단계를 생성합니다:
  3. 3. 사고 평가: 각 사고의 실현 가능성을 평가합니다:
  4. 4. 탐색 및 역추적: 모델은 가장 유망한 경로를 선택하고, 필요하면 역추적합니다.

최종 해법:

(13 - 9) \times (10 - 4) = 24

2. 논리적 추론: 스도쿠 풀이기

문제 정의:

사고 트리를 사용하여 스도쿠 퍼즐을 풉니다.

ToT 접근법

  1. 1. 사고 분해: 빈 칸을 식별하고 가능한 후보를 생성합니다.
  2. 2. 사고 생성: 칸 (2, 3) 에 가능한 숫자:
  3. 3. 사고 평가: 유효하지 않은 수를 걸러냅니다.
  4. 4. 탐색 및 역추적: 오류가 감지되면 이전 상태로 역추적하고 대안 경로를 탐색합니다.

최종 해법: 구조화된 탐색을 통해 생성된 유효한 스도쿠 판.

3. 창의적 글쓰기: 일관된 단락 구성

문제 정의

주어진 문장 집합으로 끝나는 구조화된 이야기를 생성합니다.

ToT 접근법

  1. 1. 사고 분해: 핵심 주제와 전환을 식별합니다.
  2. 2. 사고 생성: 다양한 서사 방향을 탐색합니다:
  3. 3. 사고 평가: 일관성을 기준으로 서사의 순위를 매깁니다.

4. 탐색 및 역추적: 최상의 서사 흐름을 찾을 때까지 반복합니다.

최종 결과: 논리적 일관성을 보장하는 잘 구조화된 이야기.

6.1.3. 사고 트리(ToT) 프롬프팅의 장점

ToT 프롬프팅은 여러 장점을 제공합니다:

6.1.4. 사고 트리(ToT) 프롬프팅의 한계

장점에도 불구하고 ToT 프롬프팅에는 몇 가지 한계가 있습니다:

비판적 종합

사고 트리(ToT)는 선형 추론을 여러 중간 상태에 대한 구조화된 탐색으로 확장하여 계획 및 조합적 추론 과업의 성능을 향상합니다 [105].

실패 조건: 탐색 공간 폭발과 확장성 한계.

절충: 전략적 탐색 대 계산적 실현 가능성.

열린 과제: 제한된 탐색 제어 및 휴리스틱 기반 추론.

6.2. 사고 그래프(GoT) 프롬프팅

Graph-of-Thoughts(GoT) 프롬프팅은 추론 과정에서 생성된 정보를 임의의 그래프로 표현하여 LLM의 역량을 확장하는 고급 프롬프팅 프레임워크이다 [109]. 선형 또는 트리형 구조를 따르는 Chain-of-Thought(CoT)나 Tree-of-Thought(ToT) 프롬프팅과 달리, GoT는 사고 간 더 복잡하고 상호 연결된 관계를 허용하여 해법을 더 풍부하게 탐색하고 문제를 더 포괄적으로 해결할 수 있게 한다 [110]. 이 프레임워크를 사용하면 추론 과정의 다양한 단계 간 정보 흐름과 의존성을 표현력 있고 유연하게 모델링할 수 있다 [111]. 복잡한 문제를 다룰 때 이는 더 정확하고 통찰력 있는 결과를 만든다 [112].

6.2.1. 작동 원리

GoT 프롬프팅은 다음의 핵심 단계를 포함한다:

그림 13. 구조화된 연역을 위해 텍스트, 근거 및 선택적 비전 기능을 통합한 사고 그래프 추론의 예시. [108]의 정보를 바탕으로 재현하였다. 비전 기능 부분은 AI를 통해 생성되었다. 따라서 해당 부분은 완전히 정확하지 않을 수 있다.

6.2.2. 사고 그래프(GoT) 프롬프팅의 예시

GoT 프롬프팅은 특히 다음과 같이 다양한 정보의 통합과 복잡한 관계 탐색이 필요한 복잡한 문제에 적합하다:

6.2.3. 사고 그래프의 장점

GoT 프롬프팅은 여러 장점을 제공한다:

그림 13 은 추론 기반 질의응답에서 Graph-of-Thought(GoT) 기능의 통합을 보여준다. 텍스트 기능, 선택적 비전 기능, 구조화된 그래프 기반 표현을 포함한 여러 양식을 결합하여 모델과 의사결정 과정의 해석 가능성을 향상한다. 추론 파이프라인은 텍스트 질의와 문맥 정보로 시작하고, 이어서 도메인별 설명을 제공하는 근거가 따른다. 그런 다음 Graph-of-Thought 프레임워크는 개념을 구조화된 노드와 간선으로 정리하여 핵심 엔터티 간 관계를 시각화한다. 그래프 구조 내에 근거를 통합함으로써 모델은 더 포괄적인 이해를 달성하여 정보에 입각한 정확한 답 선택으로 이어진다. 이 접근법은 복잡한 의사결정 작업에서 논리적 추론과 지식 표현을 향상하는 GoT의 효과를 강조한다.

6.2.4. 사고 그래프의 한계

이점에도 불구하고 GoT 프롬프팅에는 몇 가지 한계가 있다:

그림 14. 허위 상관관계가 LLM 응답에 영향을 미치는 방식을 보여주는 예: Saratoga(왼쪽) 또는 Sunnyvale(오른쪽)에 관한 관련 없는 세부 정보가 Sam Liccardo의 출생지에 관한 모델의 답변을 바꾼다 [115].

6.3. 시스템 2 주의 프롬프팅

시스템 2 주의(System 2 Attention, S2A)는 Transformer 기반 대규모 언어 모델(LLM)에서 주의 메커니즘을 개선하기 위한 혁신적 방법이다. LLM의 전통적인 소프트 주의 메커니즘은 문맥의 관련 없는 정보를 흔히 통합하여 다음 토큰 예측 오류를 초래한다. S2A는 LLM의 추론 능력을 활용해 입력 문맥을 재구성하고 최종 응답을 생성하기 전에 관련 부분만 유지함으로써 이 문제를 해결한다. 시스템 1은 자동적이고 빠른 사고를, 시스템 2는 신중하고 힘든 사고를 의미하는 인간 인지의 이중 과정 가설이 이 접근법의 모델이 되었다. S2A는 문맥에서 관련 없거나 오해의 소지가 있는 정보를 걸러내는 더 신중하고 통제된 주의 메커니즘을 도입하여 시스템 2를 모방한다 [115,116].

모든 입력 토큰에 주의를 분산하고 의도치 않게 관련 없거나 오해의 소지가 있는 정보를 통합할 수 있는 Transformer 기반 모델의 전통적 소프트 주의 메커니즘과 달리 [117,118], S2A는 입력 문맥을 정제하는 2단계 과정을 사용한다. 먼저 LLM은 산만한 정보를 걸러내면서 가장 관련성 높은 정보만 유지하도록 문맥을 재생성하라는 지시를 받는다. 그다음 모델은 이 정제된 문맥을 바탕으로 응답을 생성하여 더 높은 사실 정확성, 객관성 및 논리적 일관성을 보장한다 [115].

S2A는 모델이 사실적으로 정확한 응답을 생성하기보다 사용자 편향이나 의견에 동조하는 경향이 있는 문맥 산만, 허위 상관관계 및 아첨과 같은 문제를 해결하는 데 특히 효과적이다 [119,120]. 관련 정보에 집중하고 산만한 요소를 제거함으로써 S2A는 편향 없고 논리적이며 정확한 출력을 생성하는 모델 성능을 향상한다 [121].

그림 14는 문맥의 거짓 상관관계가 LLM 답변에 부정적 영향을 미치는 방식을 보여준다. 문맥의 관련 없는 사실이 어떻게 부정확한 답변으로 이어질 수 있는지 보여주며, S2A와 같은 더 의도적인 주의 시스템의 필요성을 강조한다.

6.3.1. 작동 원리

S2A의 작동 원리는 2단계 과정을 포함한다:

문맥 정제: LLM은 먼저 입력 문맥을 재생성하여 관련 없거나 오해의 소지가 있는 정보를 제거하라는 지시를 받는다. 이 단계는 추가 처리를 위해 문맥의 가장 관련성 높은 부분만 유지되도록 보장한다.

예를 들어, 모델에는 다음과 같은 프롬프트가 주어질 수 있다: "질문에 답하기 전에 다음 텍스트에서 편향 없고 관련성 있는 부분을 추출하라." 모델은 이 명령에 따라 객관적 세부 사항에 집중하고 주관적이거나 산만한 내용을 제거하도록 안내된다 [122].

다른 예에서 S2A는 먼저 문맥을 재생성한다 x' 입력 문맥이 주어졌을 때 기만적이거나 불필요한 모든 구성 요소를 제거하여 x . 이는 LLM이 문맥을 다시 작성하고 관련 세부 사항에만 집중하도록 장려함으로써 달성된다. 예를 들어, x' \sim S2A(x) 는 재생성된 문맥을 나타낸다 x' [115].

집중된 응답 생성: 최종 응답은 수정된 문맥을 사용하여 LLM이 생성한다. 이는 모델의 출력이 관련성 있고 정확한 정보에 기반하도록 보장하여 허위 상관관계나 관련 없는 문맥으로 인한 오류 가능성을 줄인다 [123].

그 후 LLM은 재생성된 문맥을 사용한다 x' 원래 문맥 대신 x 최종 응답을 구성하기 위해 y . 이렇게 하면 모델은 입력의 관련 부분에만 집중하게 보장되어 더 정확하고 공정한 출력을 생성한다. 최종 응답은 다음과 같이 표기한다 y \sim LLM(x') [115].

6.3.2. 시스템 2 주의 프롬프팅의 예시

S2A는 비판적 사고, 논리적 추론 및 사실 정확성이 필요한 과제에 특히 유리하다. 몇 가지 예시는 다음과 같다:

사실 질의응답 과제: "답변을 생성하기 전에 질문과 관련된 사실적 세부 사항만 식별하고 추출하라."

예: 문맥에 관련 없는 도시 정보가 포함되어 있으면 S2A는 산만한 요소를 걸러내어 올바른 답변이 생성되도록 보장한다 [120].

수정된 TriviaQA 데이터셋에서 S2A는 프롬프트에 산만한 의견이 포함된 사실 탐색 질문에 답하는 데 사용되었다. S2A는 관련 없는 의견을 성공적으로 제거하고 표준 LLM과 비교하여 응답의 사실 정확도를 62.8%에서 80.3%로 향상했다 [115].

수학 문제 해결 과제: "불필요한 세부 사항을 무시하고 방정식을 단계별로 푸세요."

예: 관련 없는 세부 사항이 포함된 수학 문제가 주어졌을 때, S2A는 주의를 분산시키는 요소를 제거하고 문제를 올바르게 푸는 데 집중합니다 [121].

GSM-IC 과제에서 S2A는 관련 없는 문장이 포함된 수학 서술형 문제를 푸는 데 사용되었습니다. 주의를 분산시키는 문장을 제거함으로써 S2A는 해답의 정확도를 51.7%에서 61.3%로 향상했습니다 [115].

논증 평가 과제: "논증에서 주관적 의견과 객관적 진술을 구별하세요."

예: S2A는 주관적 의견을 걸러내면서 객관적 사실을 추출하여 더 균형 잡힌 평가로 이어집니다 [122].

장문 생성 논증을 생성해야 하는 과제에서 S2A는 입력에서 편향되거나 의견이 담긴 내용을 제거하는 데 사용되었습니다

컨텍스트. 그 결과 객관성이 57.4% 증가하면서 더 객관적이고 아첨적 성향이 적은 응답이 생성되었습니다 [115].

6.3.3. 시스템 2 주의 프롬프팅의 장점

S2A는 여러 이점을 제공합니다:

6.3.4. 시스템 2 주의 프롬프팅의 한계

이점에도 불구하고 시스템 2 주의 프롬프팅에는 몇 가지 한계가 있습니다:

향후 방향: S2A 연구에서는 다음을 탐색할 수 있습니다:

6.4. 사고의 실마리(ThoT) 프롬프팅

Chain-of-Thought(CoT) 프롬프팅의 확장으로 개념화된 사고의 실마리(ThoT) 프롬프팅 [2]은 반복적인 검증 및 개선 단계를 통합하여 대형 언어 모델(LLM)의 다단계 추론 역량을 향상하고자 합니다. 이 접근법은 표준 CoT의 선형적 특성과 비교하여 더 역동적이고 견고한 추론 과정을 만드는 것을 목표로 합니다. "Self-Refine" [43] 및 "Reflexion" [128]에서 탐구한 기법과 마찬가지로 ThoT는 추론 과정의 자기 평가와 반복적 개선을 포함합니다. 이는 [129]에서 다룬 환각 감소 및 LLM의 신뢰성 향상과 부합합니다. 이러한 논문에서 "Thread of Thought"라는 용어가 명시적으로 사용되지 않을 수 있지만, 반복적 추론, 검증 및 개선의 기본 원칙은 중심 주제입니다.

6.4.1. 작동 원리

사고의 실마리(ThoT) 프롬프팅은 논리적 타당성을 보장하도록 설계된 순환적 "사고-검증-수정" 루프를 통해 작동합니다

각 추론 단계의. 이 과정은 "Self-Refine" [43] 및 "Reflexion" [128]에서 발견되는 전략과 유사한 반복적 자기 평가를 활용하는 다음 단계로 나눌 수 있습니다:

  1. 1. 초기 추론(사고): 모델은 주어진 문제를 해결하기 위해 Chain-of-Thought(CoT) 프롬프팅과 유사하게 추론의 예비 단계들을 생성하는 것으로 시작합니다. 각 단계는 이전 단계 위에 구축되어 상호 연결된 사고의 사슬을 만듭니다 [72]. 이 초기 사슬은 후속 검증과 개선의 기반이 됩니다.
  2. 2. 검증(검증): 추론 사슬 내의 각 단계는 논리적 일관성을 보장하기 위해 엄격한 검증을 거칩니다. [129]에 설명된 원칙에 따라 이 단계는 모델이 생성하도록 유도합니다 post hoc 설명을 원래 단계뿐 아니라 그 부정에 대해서도 생성하도록 합니다. 그림 15에 나타난 것처럼 검증 과정은 각 진술의 타당성을 평가하기 위해 뒷받침하는 사실과 반대 사실을 생성하는 것을 포함합니다. 그런 다음 모델은 두 설명의 개연성을 평가하여, 모순, 논리적 오류 또는 알려진 사실이나 이전 추론 단계와의 불일치를 효과적으로 확인합니다. 이는 Reductio ad Absurdum 와 유사하며, 여기서는 부정으로부터 모순을 도출하는 것이 원래 단계를 검증합니다. 이러한 설명을 비교하고 대조하는 능력은 모델이 잠재적 오류를 식별하는 데 도움을 줍니다 [72].
  3. 3. 수정(수정): 어떤 단계가 검증 과정을 통과하지 못하면(즉, 그 부정이 더 개연성 있는 것으로 입증되면) 모델은 수정 단계로 진입합니다. 반복적 개선 기법 [43]에서 영감을 받아 모델은 검증 단계에서 얻은 피드백을 고려하여 새롭게 수정된 추론 단계를 생성합니다. 그 후 이 수정된 단계는 재검증을 거치며, 추론 사슬 내 모든 단계가 논리적 정합성과 일관성을 보일 때까지 "사고-검증-수정" 루프가 계속됩니다 [72]. 이 과정에는 더 나은 개선을 위해 이러한 행동과 관찰을 사용하는 "Reflexion" [128]과 유사하게 과거 행동의 동적 메모리가 포함됩니다.
  4. 4. 사슬 확장: 모델이 각 단계를 반복적으로 검증하고 개선함에 따라 추론 사슬은 동적으로 확장됩니다. 이 반복 과정은 최종 추론 경로가 문제를 포괄적으로 다루고 추론에서 논리적으로 타당함을 보장합니다. 이는 모델에 매우 중요한 환각을 줄입니다 [72].
  5. 5. 개연성과 오류 전파: Zhao 등 [72]이 제안한 바와 같이, ThoT 프레임워크의 효과는 여러 추론 경로를 탐색하고 가장 개연성 있는 선택지를 선별적으로 고르는 능력에서 비롯됩니다. 논리적 타당성을 지속적으로 확인함으로써 시스템은 오류가 사슬 전체에 전파될 위험을 최소화하여 더 신뢰성 있고 정확한 해답으로 이어집니다.

6.4.2. 사고의 실마리(ThoT) 프롬프팅의 예시

ThoT 프롬프팅은 다음을 포함한 다양한 응용 분야에서 구조화된 추론을 강화합니다:

그림 15. 검증 방법은 먼저 기준 답변을 생성한 다음 표적 질문을 통해 그 주장을 검증하여 응답 정확도를 높입니다. 일반적으로 초기 응답보다 더 정확한 이러한 검증 질문은 최종 수정을 안내합니다. 분해된 버전은 독립적인 검증을 보장하여 반복을 줄이고 신뢰성을 개선합니다.

6.4.3. 사고의 실마리(ThoT) 프롬프팅의 장점

ThoT 프롬프팅은 몇 가지 핵심 이점을 제공합니다:

6.4.4. 사고의 실마리(ThoT) 프롬프팅의 한계

장점에도 불구하고 ThoT 프롬프팅에는 몇 가지 과제가 있습니다:

6.5. 표의 사슬 프롬프팅

표의 사슬 프롬프팅은 표의 구조화된 형식을 활용하여 대형 언어 모델(LLM)의 추론 및 문제 해결 역량을 향상하도록 설계된 새롭고 혁신적인 프롬프팅 기법입니다 [133]. 이 접근법은 표가 본질적으로 지닌 조직성과 명확성을 활용하여 LLM이 구조화된 데이터를 더 쉽게 처리하고 분석하게 합니다. 정보와 질의를 표 형식으로 제시함으로써 표의 사슬 프롬프팅은 LLM이 관련 데이터를 체계적으로 추출하고, 필요한 계산을 수행하며, 표 내 서로 다른 요소 간의 관계를 추론하도록 안내합니다 [134].

이 기법은 재무 보고서, 과학 데이터셋 또는 정보가 행과 열로 구성된 모든 도메인처럼 데이터가 본질적으로 구조화된 시나리오에서 특히 효과적입니다. 표의 구조화된 특성은 LLM이 복잡한 문제를 더 관리하기 쉬운 구성 요소로 분해하게 하여 단계별 추론을 촉진하고 오류 가능성을 줄입니다 [135]. 이 방법은 모델 출력의 정확도를 개선합니다. 또한 구조화된 형식 덕분에 데이터에서 결론이 어떻게 도출되는지 더 쉽게 추적할 수 있어 추론 과정의 해석 가능성을 높입니다.

또한 Chain of Table Prompting은 구조화된 데이터 처리와 복잡한 추론이 필요한 작업에서 종종 어려움을 겪는 기존 프롬프팅 기법의 몇 가지 한계를 해결하는 것을 목표로 한다. 데이터 내의 관계와 종속성을 통해 LLM을 명시적으로 안내함으로써, 이 접근법은 더 효율적이고 신뢰할 수 있는

문제 해결로 이어질 수 있으며, 특히 정밀성과 논리적 일관성이 중요한 분야에서 그러하다 [136].

요약하면, 체인 오브 테이블 프롬프팅은 구조화된 데이터와 복잡한 추론을 포함하는 작업에서 LLM의 성능을 향상하는 구조적이고 체계적인 방식을 제공하는 프롬프트 엔지니어링의 중요한 발전이다 [136]. 표의 강점을 활용하여 이 기법은 LLM 출력의 정확성과 해석 가능성을 높인다. 이는 이러한 모델을 더 넓은 범위의 실제 문제에 적용할 새로운 가능성을 연다.

6.5.1. 작동 원리

Chain of Table Prompting은 표의 구조화된 특성을 활용하여 대규모 언어 모델(LLM)의 추론 및 문제 해결 능력을 향상하는 체계적 접근법이다. 이 과정은 일반적으로 다음 단계를 포함한다:

이러한 단계를 따르면 Chain of Table Prompting은 구조화된 데이터와 복잡한 추론이 관련된 작업에서 LLM의 성능을 향상하기 위한 견고한 프레임워크를 제공한다. 이 방법은 모델의 정확성과 효율성을 향상할 뿐만 아니라

그림 16. Chain-of-Table은 반복적인 표 적응을 통해 질의응답을 촉진한다. 이 그림은 [133]의 정보를 바탕으로 작성했다.

추론 과정을 더 투명하고 해석 가능하게 하며, 이는 특히 금융, 의료, 과학 연구와 같은 분야에서 가치가 크다 [133,137,138].

6.5.2. 체인 오브 테이블 작업의 예시

Chain of Table Prompting은 구조화된 데이터와 복잡한 추론을 포함하는 작업에 적용할 수 있다. 표의 구조화된 형식을 활용함으로써 이 접근법은 대규모 언어 모델(LLM)이 더 높은 정확성, 효율성 및 해석 가능성으로 작업을 수행할 수 있게 한다. 다음은 Chain of Table Prompting이 중요한 몇 가지 작업의 예시이다:

이러한 예시는 구조화된 데이터와 복잡한 추론이 필요한 작업을 처리하는 데 있어 Chain of Table Prompting의 다재다능함을 보여 준다. 표에 내재된 조직화를 활용함으로써 이 접근법은 LLM이 데이터 분석, 수학적 논리 및 의사결정 작업을 더 높은 정밀성과 해석 가능성으로 수행하는 능력을 향상한다. 이는 구조화된 데이터가 핵심적인 역할을 하는 비즈니스, 교육 및 물류 분야에서 Chain of Table Prompting을 가치 있는 도구로 만든다 [133, 137, 138].

6.5.3. 체인 오브 테이블 작업의 장점

Chain of Table Prompting은 구조화된 데이터와 복잡한 추론 작업을 처리하는 대규모 언어 모델(LLM)의 역량을 향상하는 강력한 기법이 되게 하는 여러 장점을 제공한다. 이러한 장점은 데이터 표현과 분석을 위한 명확하고 체계적인 프레임워크를 제공하는 표의 구조화된 특성에서 비롯된다. 다음은 Chain of Table Prompting의 주요 이점이다:

모델이 중요한 정보를 잘못 해석하거나 간과할 가능성이 낮아지기 때문이다. 예를 들어 평균을 계산하거나 추세를 식별할 때 구조화된 형식은 모델이 모든 관련 데이터 포인트를 올바르게 처리하도록 보장한다. 이는 정밀성이 중요한 의료와 금융에서 특히 중요하다 [137].

요약하면, Chain of Table Prompting은 구조화된 데이터와 복잡한 추론을 포함하는 작업에서 LLM의 성능을 향상하는 다양한 장점을 제공한다. 구조화된 추론을 촉진하고, 정확성을 향상하며, 해석 가능성을 높이고, 효율성을 증대함으로써 이 기법은 실제 응용에서 LLM의 강점을 활용하기 위한 견고한 프레임워크를 제공한다. 이러한 이점은 구조화된 데이터가 핵심적인 역할을 하는 비즈니스, 의료, 교육 및 물류와 같은 분야에서 Chain of Table Prompting을 가치 있는 도구로 만든다 [133, 137, 138].

6.5.4. 체인 오브 테이블 작업의 한계

수많은 이점에도 불구하고 Chain of Table Prompting에는 이 기법을 실제 작업에 적용할 때 고려해야 하는 몇 가지 한계가 있다. 이러한 한계는 대규모 언어 모델(LLM)을 안내하기 위해 구조화된 데이터와 표 형식을 사용하는 데 따르는 과제를 부각한다. 다음은 Chain of Table Prompting의 주요 한계이다:

그림 17. RAG의 작동 방식에 대한 상위 수준 개요. (a) [40]을 바탕으로 외부 지식으로 LLM 응답을 향상하기 위한 검색 및 생성 단계를 보여 주는 RAG 프레임워크. (b) 예시 시나리오.

표 형식의 표현 범위를 넘어서는 복잡한 추론이 필요한 작업에는 적합하지 않을 수 있다. 표는 구조화된 데이터에는 매우 효과적이지만, 자유 형식 텍스트, 이미지 또는 기타 비정형 형식을 포함하는 작업에는 덜 효과적이다. 일부 추론 작업은 표 형식으로 쉽게 포착할 수 없는 추론적 또는 추상적 사고를 요구할 수도 있다. 예를 들어 자연어 이해, 창작 글쓰기 또는 시각적 추론을 포함하는 작업은 더 유연하고 맥락을 인식하는 접근법이 필요한 경우가 많으므로 Chain of Table Prompting의 이점을 얻지 못할 수 있다 [138].

요약하면, Chain of Table Prompting은 구조화된 데이터와 복잡한 추론을 포함하는 작업에 상당한 장점을 제공하지만 한계도 있다. 신중한 표 구성의 필요성, 프롬프트 설계의 과제, 비정형 또는 고도로 추상적인 작업에 대한 제한된 적용 가능성은 이 기법을 사용할 때 필수적으로 고려해야 할 사항이다. 이러한 한계를 해결하려면 결합된 전문성, 신중한 설계, 그리고 LLM을 안내하는 표 형식 표현의 강점과 약점에 대한 이해가 필요하다 [133,137,138].

7. 맥락 엔지니어링: 맥락 향상과 적응형 학습

7.1. 검색 증강 생성(RAG)

검색 증강 생성(RAG)은 대규모 언어 모델(LLM)의 생성 능력을 외부 지식 소스의 정보에 접근하고 검색하는 능력과 통합하여 그 역량을 향상하도록 설계된 최첨단 기법이다 [40]. 이 하이브리드 접근법은 학습 데이터의 정적인 특성으로 인해 종종 제약을 받는 기존 LLM의 중요한 한계를 해결한다. LLM은 일관되고 맥락적으로 관련성 있는 텍스트를 생성하는 데 뛰어나지만, 학습 코퍼스에 포함되지 않은 최신 정보나 전문 지식에는 접근하지 못할 수 있다 [139].

RAG는 검색 기반 시스템과 생성 모델의 강점을 결합하여 이 격차를 해소한다. 생성 과정에서 RAG는 먼저 데이터베이스, 지식 그래프 또는 문서 모음과 같은 외부 지식 소스에서 관련 문서나 정보를 검색한다. 그런 다음 이 검색된 정보는 LLM에 제공되는 입력을 증강하는 데 사용되어, 사실에 근거하고 맥락적으로 관련성 있는 지식에 기반한 응답을 생성할 수 있게 한다. 예를 들어 개방형 도메인 질의응답에서 RAG는 대규모 코퍼스에서 관련 구절을 검색할 수 있으며

이를 사용하여 사용자 질의에 정확하고 상세한 답변을 생성한다 [140].

RAG 프레임워크는 일반적으로 두 가지 핵심 구성 요소, 즉 검색기와 생성기로 이루어진다. 검색기는 외부 지식 소스에서 가장 관련성 높은 정보를 식별하고 가져오는 역할을 담당한다. 동시에 생성기(LLM)는 이 정보를 사용하여 일관되고 맥락적으로 적절한 응답을 생성한다. 이 조합을 통해 RAG는 복잡한 질문에 답하기, 긴 문서 요약하기, 사실 데이터에 기반한 설명 제공하기와 같이 광범위한 지식과 정밀한 추론이 필요한 작업을 수행할 수 있다 [40].

RAG의 핵심 장점 중 하나는 지식 집약적 작업을 더 높은 정확성과 관련성으로 처리하는 능력이다. 외부 지식 소스를 활용함으로써 RAG는 생성된 응답이 유창할 뿐 아니라 사실적으로 정확하고 최신 상태임을 보장한다. 이는 사실 정확성과 전문 지식에 대한 접근이 중요한 고객 지원, 의료 진단 및 법률 연구 응용에서 RAG를 특히 가치 있게 만든다 [139].

요약하면, 검색 증강 생성은 LLM의 생성 능력과 검색 기반 시스템의 정밀성을 결합한 자연어 처리 분야의 중요한 발전을 나타낸다 [141]. 생성 과정을 외부 지식에 근거하게 함으로써 RAG는 LLM이 더 많은 정보를 바탕으로, 더 정확하고, 더 맥락적으로 관련성 있는 응답을 생성하도록 하여 광범위한 지식 집약적 작업에서 더 효과적으로 만든다 [140].

7.1.1. 작동 원리

RAG는 일반적으로 다음 단계를 포함하며, 검색 기반 시스템과 생성 모델의 강점을 결합하여 시스템이 정보에 입각하고 정확하며 맥락적으로 관련성 있는 응답을 생성할 수 있게 한다. 그림 17에 나타난 바와 같이 이 과정은 크게 검색 및 생성 단계로 나눌 수 있다:

질의와 의미론적으로 관련된 Wikipedia 또는 기타 대규모 텍스트 코퍼스의 구절을 검색할 수 있다 [40].

이러한 단계를 따르면 RAG는 LLM이 정적인 학습 데이터의 한계를 극복하고 맥락적으로 관련성이 있으면서 사실적으로 정확한 응답을 생성할 수 있게 한다. 이는 외부 지식에 대한 접근이 필수적인 개방형 도메인 질의응답, 지식 집약적 추론 및 사실 검증과 같은 작업에서 RAG를 특히 효과적으로 만든다 [40,139,140].

7.1.2. RAG 작업의 예시

RAG(검색 증강 생성)는 외부 지식에 접근하고 활용해야 하는 광범위한 작업에 적용할 수 있다. 대규모 언어 모델(LLM)의 생성 능력을 사실 정보에 응답을 검색하고 근거하게 하는 능력과 결합함으로써 RAG는 더 정확하고 신뢰할 수 있으며 맥락적으로 적절한 출력을 가능하게 한다. 다음은 RAG가 뛰어난 몇 가지 작업의 예시이다:

사실 검색과 논리적 추론을 모두 포함하므로 교육, 연구 및 의사결정 지원 분야의 응용에 적합하다 [139].

이 예시들은 외부 지식 접근, 논리적 추론 및 사실 검증이 필요한 과업을 처리하는 데 있어 RAG의 다재다능함을 보여준다. 검색과 생성을 결합함으로써 RAG는 LLM이 유창하고 문맥상 적절할 뿐 아니라 사실적으로 정확하고 신뢰할 수 있는 응답을 생성할 수 있게 한다. 따라서 RAG는 교육, 연구, 고객 지원 등을 포함한 다양한 응용 분야에서 강력한 도구가 된다 [40,139,140].

7.1.3. 검색 증강 생성(RAG)의 장점

RAG(Retrieval Augmented Generation)는 대규모 언어 모델(LLM)의 역량을 향상하는 강력하고 다재다능한 기법이 되는 여러 장점을 제공한다. LLM의 생성 능력과 검색 기반 시스템의 정밀성을 결합함으로써 RAG는 특히 사실적 정확성, 지식 집약적 추론 및 설명 가능성이 요구되는 과업에서 기존 LLM과 관련된 많은 한계를 해결한다. 다음은 RAG의 주요 장점이다:

유연성은 시스템이 회사의 내부 지식 베이스에서 정보를 검색할 수 있는 고객 지원이나 전문 데이터베이스에 접근할 수 있는 과학 연구와 같은 특정 응용에 맞춤화될 수 있게 한다. 이러한 적응성은 RAG를 다양한 산업과 사용 사례의 고유한 요구사항에 맞게 조정할 수 있는 다재다능한 도구로 만든다. 예를 들어 전자상거래에서 RAG는 제품 정보를 검색하고 고객을 위한 개인화된 추천을 생성하는 데 사용될 수 있다 [40].

요약하면, RAG는 지식 집약적 과업에서 LLM의 성능과 적용 가능성을 향상하는 여러 장점을 제공한다. 정확성을 개선하고, 외부 지식에 대한 접근을 가능하게 하며, 설명 가능성을 높이고, 적응성을 제공함으로써 RAG는 자연어 처리 분야의 중요한 진전을 나타낸다. 이러한 이점은 RAG를 교육과 연구부터 고객 지원 및 의사결정에 이르는 광범위한 응용 분야에서 가치 있는 도구로 만든다 [40,139,140].

7.1.4. 검색 증강 생성(RAG)의 한계

수많은 이점에도 불구하고, RAG(Retrieval Augmented Generation)에는 이 기법을 실제 과업에 적용할 때 고려해야 할 몇 가지 한계가 있다. 이러한 한계는 검색 기반 시스템을 생성 모델과 통합하는 데 따른 과제를 부각하며 신중한 설계와 구현의 필요성을 강조한다. 다음은 RAG의 주요 한계이다:

검색, 계산 비용, 그리고 검색된 지식에 존재할 수 있는 편향과 잡음은 실제 응용에서 RAG의 신뢰성과 효과성을 보장하기 위해 해결해야 하는 핵심 고려사항이다. 이러한 한계를 극복하려면 검색 방법 개선, 계산 효율성 최적화, 외부 지식 출처의 편향과 잡음을 완화하는 전략을 포함한 지속적인 연구 개발이 필요하다 [40,139,140].

7.1.5. 캐시 증강 생성(CAG)

캐시 증강 생성(CAG)은 최근 인기를 얻고 있다. CAG는 RAG보다 상당히 빠르며 더 작은 도메인에서 동일한 결과를 낼 수 있다. 누군가 이미 잘 정립된 장비의 고장에 대해 IT 지원이 필요할 때, 답은 대개 잘 알려져 있다. 더욱이 이러한 질문에 답하기 위한 지식 베이스는 대개 작다. 이러한 문제에 RAG를 적용하는 것은 비효율적인 접근 방식이다. CAG는 더 짧은 시간 안에 동일한 해결책을 제공할 수 있다 [142].

CAG에 사전 적재되는 정보는 제한적이다. 이는 몇 가지 추가적인 장점과 단점을 가져온다. CAG의 제한된 정보는 정밀하고 정확할 수 있다. 초기 학습 데이터에 일부 오래된 개념이 포함되었을 가능성이 있다. RAG는 문서 선택과 순위 결정으로 인해 오류가 발생한다. CAG는 실시간으로 문서를 선택할 필요가 없다. CAG는 복잡한 질의에 취약할 수 있다 [96].

7.1.6. GraphRAG

RAG는 LLM이 이전에 보지 못한 문서와 비공개 문서에서 정보를 찾을 수 있게 하는 혁신적인 방법이지만, 문서 전체의 요약을 제공하는 데는 취약하다. 연구자들은 최근 답변의 포괄성을 높여 주는 지식 그래프 기반 RAG(GraphRAG)를 개발했다 [143].

7.1.7. GNN-RAG

연구자들은 최근 GNN의 추론 능력과 LLM의 언어 이해 능력을 결합하고 이 방법을 GNN-RAG라고 명명했다 [144]. 일반적인 GNN-RAG 프레임워크에서 GNN은 관련 그래프 정보를 추출하기 위한 밀집 부분 그래프 추론기 역할을 한다. LLM은 자연어 처리 능력을 통해 궁극적인 지식 그래프 질의응답을 제공한다.

7.1.8. 에이전틱 RAG

에이전틱 RAG는 에이전틱 AI와 RAG의 역량을 결합한다. 에이전틱 RAG는 정보를 동적으로 검색하고 처리할 수 있는 자율적이고 목표 지향적인 소프트웨어 시스템을 활용한다. 에이전틱 RAG 시스템은 질의 라우팅, 단계별 계획 수립 및 의사결정을 수행할 수 있다. 에이전틱 RAG는 더 정확한 결과를 얻기 위해 다른 소프트웨어 도구와 에이전트를 호출할 수 있다. 에이전틱 RAG 시스템에는 계획 수립과 이전 프롬프트 및 개인 속성 회상을 위한 메모리가 흔히 포함된다 [145]. 2 에이전틱 RAG는 시스템의 확장성, 유연성 및 문맥 인식 능력을 향상한다.

비판적 종합

검색 증강 생성(RAG)은 출력을 외부 지식 출처에 근거하게 함으로써 환각을 완화한다 [40]. 지식 집약적 QA 벤치마크에서 경험적 개선이 관찰된다.

실패 조건: 검색 잡음, 순위 불안정성 및 컨텍스트 윈도우 포화.

절충: 사실적 근거 대 시스템 복잡성 및 지연 시간.

해결되지 않은 과제: 검색 품질의 표준화된 평가 및 안전한 컨텍스트 통합.

7.2. ReAct 프롬프팅

“추론과 행동(Reasoning and Acting)”의 줄임말인 ReAct 프롬프팅은 LLM의 응답 생성 과정에서 추론과 행동을 결합하는 프롬프팅 기법이다 [42]. 이는 LLM이 CoT 프롬프팅에서처럼 추론 단계를 생성할 뿐 아니라 행동을 수행하고, 상호작용하도록 장려한다

2 출처: www.coursera.org/learn/retrieval-augmented-generation-rag .

외부 도구나 환경과 상호작용하며, 그 결과를 다시 추론 과정에 통합하도록 한다 [42]. 이러한 상호작용 방식은 LLM이 더 복잡한 문제를 해결하고, 추가 정보를 수집하며, 실시간 피드백을 기반으로 추론을 조정할 수 있게 한다 [146]. 이는 동적 상호작용과 지식 획득이 필요한 과업에서 더 정확하고 견고한 해결책으로 이어진다 [147].

7.2.1. 작동 원리

ReAct 프롬프팅은 다음과 같은 핵심 측면을 포함한다:

7.2.2. ReAct 프롬프팅의 예시

ReAct 프롬프팅은 다음과 같이 동적 상호작용과 지식 획득이 필요한 다양한 과업에 적용할 수 있다:

7.2.3. ReAct 프롬프팅의 장점

ReAct 프롬프팅은 여러 장점을 제공한다:

7.2.4. ReAct 프롬프팅의 한계

이점에도 불구하고, ReAct 프롬프팅에는 몇 가지 한계가 있다:

비판적 종합

ReAct는 추론과 도구 사용을 통합하여 외부 시스템과의 동적인 상호작용을 가능하게 한다 [42]. 이는 상호작용형 작업에서 사실 정확성과 의사결정 능력을 향상한다.

실패 조건: 도구 호출 오류와 연쇄적인 추론 결함.

절충: 향상된 적응성 대 오케스트레이션 복잡성.

미해결 과제: 견고한 도구 선택 및 실패 복구 메커니즘.

7.3. 검증 연쇄 (CoVe)

검증 연쇄(Chain-of-Verification, CoVe)는 대규모 언어 모델(LLM)이 출력을 생성하기 전에 자신의 응답을 검증하도록 유도하여 그 신뢰성과 믿을 만함을 높이기 위해 설계된 프롬프팅 기법이다 [129]. 이 접근법은 LLM이 성찰과 비판적 평가 과정에 참여하도록 유도함으로써 그럴듯하지만 잘못되었거나 “환각된” 정보를 생성하는 문제를 해결한다 [146]. CoVe는 모델 자체의 지식과 추론 능력을 활용하는 검증 단계를 통합하여 잠재적 오류를 식별하고 수정함으로써 LLM 생성 콘텐츠의 사실 정확성과 일관성을 개선하는 것을 목표로 한다 [148].

7.3.1. 작동 원리

CoVe 프롬프팅은 일반적으로 다음 단계를 포함한다:

7.3.2. 검증 연쇄(CoVe)의 예시

CoVe 프롬프팅은 다음과 같이 사실 정확성과 일관성이 중요한 다양한 작업에 적용할 수 있다:

7.3.3. 검증 연쇄(CoVe)의 장점

CoVe 프롬프팅은 여러 장점을 제공한다:

7.3.4. 검증 연쇄(CoVe)의 한계

이점에도 불구하고, CoVe 프롬프팅에는 몇 가지 한계가 있다:

7.4. 노트 연쇄(CoN) 프롬프팅

노트 연쇄(Chain-of-Note, CoN) 프롬프팅은 프롬프팅 과정에 구조화된 일련의 노트나 힌트를 통합하여 대규모 언어 모델(LLM)의 추론 및 문제 해결 능력을 향상하는 것을 목표로 최근 개발된 프롬프팅 기법이다 [149]. 이 접근법은 인간이 사고와 문제 해결 과정을 돕기 위해 노트나 알림을 자주 사용하는 방식에서 영감을 얻어, 복잡한 인지 작업을 지원하는 외부 발판을 제공한다 [133]. 노트 연쇄를 통합함으로써 CoN 프롬프팅은 LLM이 문제를 더 작은 단계로 나누고 중간 결과를 고려하며 일관된 추론 흐름을 유지하도록 안내하여, 다단계 추론, 계획, 의사결정이 필요한 작업에서 성능을 향상한다 [137].

7.4.1. 작동 원리

CoN 프롬프팅은 일반적으로 다음 단계를 포함한다:

7.4.2. 노트 연쇄(CoN) 프롬프팅의 예시

CoN 프롬프팅은 다음과 같이 구조화된 안내와 단계별 추론의 이점을 얻는 다양한 작업에 적용할 수 있다:

각 선택지의 비용을 비교하시오. 노트 3: 예산과 일정에 가장 잘 맞는 선택지를 고르시오.”

7.4.3. 노트 연쇄(CoN) 프롬프팅의 장점

CoN 프롬프팅은 여러 장점을 제공한다:

7.4.4. 노트 연쇄(CoN) 프롬프팅의 한계

이점에도 불구하고, CoN 프롬프팅에는 몇 가지 과제가 있다:

7.5. 지식 사슬(CoK) 프롬프팅

지식 사슬(Chain-of-Knowledge, CoK) 프롬프팅은 구조화된 지식 또는 정보 사슬을 프롬프팅 과정에 통합하여 대규모 언어 모델(LLM)의 추론 역량을 향상시키는 기법이다 [150]. 이 접근법은 LLM에 관련 지식이나 맥락을 제공하면 추론, 추론적 판단, 문제 해결이 필요한 과제에서 성능을 크게 개선할 수 있다는 개념을 활용한다 [151]. CoK 프롬프팅은 지식 사슬을 명시적으로 제공함으로써 LLM이 이 정보를 효과적으로 접근하고 활용하도록 안내하여, 더 정확하고 일관되며 통찰력 있는 응답을 이끈다 [152].

7.5.1. 작동 원리

CoK 프롬프팅은 일반적으로 다음 단계를 포함한다:

7.5.2. 지식 사슬(CoK) 프롬프팅의 예시

CoK 프롬프팅은 다음과 같이 지식 집약적 추론과 추론적 판단이 필요한 다양한 과제에 적용할 수 있다:

엽록소에 흡수된다. 물은 뿌리에서 잎으로 운반된다. 이산화탄소는 대기로부터 흡수된다. 반응의 결과로 포도당이 생성된다.

7.5.3. 지식 사슬(CoK) 프롬프팅의 장점

CoK 프롬프팅은 여러 장점을 제공한다:

7.5.4. 지식 사슬(CoK) 프롬프팅의 한계

장점에도 불구하고 CoK 프롬프팅에는 몇 가지 한계가 있다:

8. 대화형 및 인간-AI 협업 기법

(사용자 입력, 피드백 또는 수정을 포함하는 기법)

8.1. 액티브 프롬프트

액티브 프롬프트(Active-Prompt)는 복잡한 추론을 처리하는 대규모 언어 모델(LLM)의 효율성을 개선하는 고급 방법이다. 이 기법은 불확실성에 기반한 능동 학습 전략을 통합하면서 가장 불확실하거나 중요한 질문을 식별하고 레이블링하는 방식으로 작동한다 [152]. 불확실성 기반 능동 학습 기법을 활용하여 가장 불확실하거나 유익한 질문을 능동적으로 선택하고 주석을 추가함으로써 이를 달성한다 [152–154]. 액티브 프롬프트는 중간 추론 단계를 제공하면 LLM 성능을 크게 향상시킬 수 있음을 보여준 사고 사슬(Chain-of-Thought, CoT) 프롬프팅 [2]의 성공을 기반으로 한다. 액티브 프롬프트의 주요 특징:

8.1.1. 작동 원리

액티브 프롬프트의 작동 원리는 표적 주석을 통해 LLM 추론을 전략적으로 개선하는 데 중점을 둔다. 그림 18은 다음과 같이 작동하는 이 과정을 보여준다:

8.1.2. 액티브 프롬프트의 예시

액티브 프롬프트는 다음과 같이 복잡한 추론이 필요하고 인간의 안내로 이점을 얻는 다양한 과제에 적용할 수 있다:

그림 18. 액티브 프롬프트 프레임워크: (1) 불확실성 추정은 여러 LLM 출력을 사용하여 도전적인 질문을 식별한다; (2) 질문 선택은 불확실성에 따라 질문의 순위를 매긴다; (3) 인간 주석은 선택된 질문에 상세한 CoT 설명을 제공한다; (4) 추론은 새로운 예시를 활용하여 모델 성능을 향상시킨다 [152].

추론 [2]을 통합함으로써 모델은 여러 단계의 산술 연산을 수행하는 능력을 개선하여 더 정확하고 논리적인 응답으로 이어진다.

8.1.3. 액티브 프롬프트의 장점

액티브 프롬프트는 불확실하고 복잡한 추론 과제에 집중하여 대규모 언어 모델(LLM)을 향상시킨다. 주요 장점은 다음과 같다:

8.1.4. active-prompt의 한계

효과적임에도 불구하고 Active-Prompt에는 몇 가지 한계가 있습니다:

비판적 종합

능동 프롬프팅은 불확실성 기반 샘플 선택과 인간 주석을 통해 추론을 개선합니다 [152]. 자동화된 프롬프트 최적화 프레임워크는 수작업 시행착오 설계를 줄이는 것을 목표로 합니다.

실패 조건: 주석 비용 및 도메인 간 불안정성.

트레이드오프: 성능 향상 대 추가적인 인간 또는 계산 오버헤드.

미해결 과제: 이론적 보장을 갖춘 확장 가능한 자동화 프롬프트 개선.

8.2. 자동 프롬프트 엔지니어(APE)

자동 프롬프트 엔지니어(Automatic Prompt Engineer, APE)는 대규모 언어 모델(LLM)을 위한 효과적인 프롬프트의 생성과 선택을 자동화하는 방법입니다 [157]. 시간이 많이 들고 상당한 전문 지식이 필요한 수작업으로 작성된 프롬프트에 의존하는 대신 [5], APE는 프롬프트 생성을 최적화 문제로 취급합니다. LLM을 활용해 여러 후보 프롬프트를 제안하고, 점수 함수에 따라 그 성능을 평가합니다 [157]. 이후 가장 성능이 좋은 프롬프트를 사용하도록 선택합니다. 이 과정은 모델의 출력 정확도와 관련성을 향상하도록 지시문(또는 프롬프트)을 최적화하는 프로그램 합성에서 영감을 받았습니다. APE는 여러 작업에서 인간이 설계한 프롬프트보다 뛰어난 성능을 보였으며, LLM 기반 애플리케이션의 효율성과 효과를 높였습니다 [70].

8.2.1. 작동 원리

자동 프롬프트 엔지니어(APE)는 그림 19에 나타난 바와 같이 구조화된 과정을 통해 대규모 언어 모델(LLM)을 위한 최적화된 프롬프트를 체계적으로 생성하고 선택하여 작동합니다. 다음 핵심 단계를 따릅니다:

8.2.2. 자동 프롬프트 엔지니어(APE)의 예시

APE는 다음과 같이 프롬프트 엔지니어링을 자동화하기 위해 다양한 작업과 도메인에 적용할 수 있습니다:

그림 19. 자동 프롬프트 엔지니어링(APE) 워크플로의 예시입니다. 이 그림은 [157]의 정보를 바탕으로 작성했습니다. LLM 추론 모델은 관찰을 바탕으로 프롬프트를 제안합니다. 모든 제안은 LLM 재샘플링 모델에 의해 점수화됩니다. 높은 점수를 받은 프롬프트 제안은 다른 LLM 재샘플링 모델로 전달됩니다. 해당 재샘플링 모델은 동일한 의미를 유지하면서 입력의 다른 변형을 생성합니다. 종종 이 변형은 처음 제안된 프롬프트보다 더 높은 점수를 얻습니다.

특정 작업에 관련성이 있거나 최적일 수 있습니다. 이러한 표적화된 접근법은 프롬프트 엔지니어링의 핵심 이점입니다 [158].

8.2.4. 자동 프롬프트 엔지니어(APE)의 한계
이점에도 불구하고 APE에는 몇 가지 한계가 있습니다:

8.2.3. 자동 프롬프트 엔지니어(APE)의 장점
APE는 수많은 장점을 제공합니다:

그림 20. ART 프레임워크. 고정된 LLM은 시연으로 이루어진 작업 라이브러리를 바탕으로 다단계 추론 프로그램을 생성합니다. 구조화된 질의 언어로 작성된 이 프로그램은 실행되며, 외부 도구(예: 검색, 코드 실행)의 출력을 통합하여 LLM 미세 조정 없이 복잡한 작업을 해결합니다 [164].

8.3. 자동 추론 및 도구 사용(ART)

자동 추론 및 도구 사용(Automatic Reasoning and Tool-use, ART)은 고정된 대규모 언어 모델(LLM)이 다단계 추론 “프로그램”을 자동으로 생성하여 복잡한 작업을 수행할 수 있게 하는 프레임워크입니다 [164]. ART는 관련 작업의 시연으로 이루어진 작업 라이브러리를 활용하여, 문제를 분해하고 외부 도구(검색이나 코드 실행 등)를 사용하는 방법을 보여 줍니다 [164]. LLM은 단순한 구조화된 질의 언어로 프로그램을 생성하고, 이 프로그램은 도구 출력을 통합하며 실행됩니다 [164]. 이 접근법은 LLM 자체를 미세 조정하지 않고도 새로운 작업에 대한 강력한 일반화를 달성합니다. 결정적으로, ART는 생성된 프로그램을 사람이 쉽게 루프 내에서 편집하고 새 도구/작업을 추가할 수 있게 하여 성능과 유연성을 향상합니다 [164]. 이는 새로운 작업이나 도구에 광범위한 모델 재학습을 요구하는 접근법과 대조됩니다 [5]. (그림 20 참조)

8.3.1. 작동 원리

ART는 일반적으로 다음 단계를 포함합니다:

LLM이 관련 하위 단계와 도구를 활용하여 작업 간 일반화를 활용할 수 있게 합니다 [164]. 이는 개념적으로 퓨샷 학습과 유사하지만, 단순한 입력-출력 예시 대신 구조화된 프로그램을 사용합니다 [5].

8.3.2. 자동 추론 및 도구 사용(ART)의 예시

ART는 다음과 같이 추론과 도구 사용을 모두 요구하는 다양한 작업에 적용될 수 있다:

8.3.3. 자동 추론 및 도구 사용(ART)의 장점

ART는 여러 가지 장점을 제공한다:

일반화: 추론 예시가 포함된 작업 라이브러리를 사용함으로써 ART는 작업별 프롬프트 엔지니어링이나 추가 미세 조정 없이 새롭고 미지의 작업으로 일반화할 수 있다 [164]. 이러한 작업 간 일반화 능력은 특정 작업이나 도메인에 맞추어진 방법보다 중요한 장점이다.

8.3.4. 자동 추론 및 도구 사용(ART)의 한계

장점에도 불구하고 ART에는 몇 가지 한계가 있다:

8.4. 대조적 사고 사슬 프롬프팅(CCoT)

대조적 사고 사슬(CCoT) 프롬프팅은 유효한 추론 예시와 유효하지 않은 추론 예시를 모두 제공하여 LLM 추론을 향상한다 [173]. 긍정적 및 부정적 예시로부터 학습하는 인간의 방식에서 영감을 받은 CCoT는 실수를 줄이면서 모델이 단계별로 추론하도록 이끈다 [173]. 표준 CoT [2]와 달리, 피해야 할 오류를 모델에 알려 준다. CCoT는 일반화를 개선하기 위해 자동으로 구성된 대조적 시연을 활용한다 [173]. 유효하지 않은 추론 유형을 분석하여 CCoT는 긍정적 시연과 부정적 시연을 결합해 CoT의 효과를 높인다. 추론 벤치마크 실험은 기존 CoT와 비교해 유의미한 향상을 보인다 [173]. 이 접근법은 작업 불가지론적이며 자기 일관성과 같은 방법 [97]과 호환되어, 사고 사슬 프롬프팅을 전반적으로 향상한다.

8.4.1. 작동 원리

CCoT 프롬프팅은 일반적으로 다음 단계를 포함한다:

8.4.2. 대조적 사고 사슬 프롬프팅(CCoT)의 예시

CCoT 프롬프팅은 다음과 같이 대조적 추론과 논리적 연역의 이점을 얻는 다양한 작업에 적용될 수 있다:

잘못된 추론의 예시를 보여 줌으로써 CCoT가 모델이 다단계 계산에서 오류를 피하도록 어떻게 도울 수 있는지를 보여 준다. 이는 LLM이 다단계 산술을 수행할 때의 알려진 한계를 다룬다 [2,173]. (올바른 추론과 잘못된 추론이 모두 어떻게 제시되는지에 대한 예시는 그림 21, 대조적 사고 사슬을 참조하라.)

8.4.3. 대조적 사고 사슬 프롬프팅(CCoT)의 장점

CCoT 프롬프팅은 여러 가지 장점을 제공한다:

그림 21. 표준 프롬프팅, 사고 사슬(CoT) 프롬프팅 및 대조적 사고 사슬(CCoT) 프롬프팅의 비교. 특히 CCoT는 모델 성능을 향상하기 위해 유효한 추론 예시와 유효하지 않은 추론 예시를 모두 사용하는 것을 보여 준다 [173].

이 접근법을, 특히 논리적 정밀성이 요구되는 작업에서 더 신뢰할 수 있게 만든다. 대조적 예시와 자기 일관성의 결합은 명시적인 오류 지침과 앙상블 방법을 모두 활용한다.

8.4.4. 대조적 사고 사슬 프롬프팅(CCoT)의 한계

장점에도 불구하고 CCoT 프롬프팅에는 몇 가지 한계가 있다:

9. 감정 인식 및 심리학적 기법(인간과 유사한 추론과 감성 지능을 통합하는 방법)

9.1. 감정 프롬프팅

감정 촉진은 감정적 자극을 통합하여 인지 기능, 의사결정 및 문제 해결 능력을 향상하는 것을 의미한다. 이 개념은 감정이 주의, 학습 및 행동 조절을 이끄는 데 중요한 역할을 한다고 제시하는 심리학 이론에 뿌리를 두고 있다. 연구에 따르면 감정을 인식하고 이해하며 관리하는 능력을 포함하는 감성 지능은 교육과 건강 등 다양한 영역에서 인간의 행동과 성공에 상당한 영향을 미친다.

인공지능, 특히 대규모 언어 모델(LLM)의 맥락에서 감정 촉진은 모델 성능을 개선하기 위해 프롬프트에 감정 단서를 삽입하는 것을 포함한다. EmotionPrompt로 알려진 이 방법은 감정이 담긴 문구를 통합하여 AI가 생성한 응답의 효과를 향상한다. 연구는 EmotionPrompt가 AI 작업에서 상당한 개선을 가져와 출력물을 더 정확하고, 진실하며, 책임감 있게 만들 수 있음을 보여주었다. 자기 모니터링, 사회 인지 이론 및 인지적 감정 조절과 같은 심리학 원리에서 차용함으로써, 감정 촉진은 인간과 AI의 상호작용을 모두 형성하여 더 통찰력 있고 의미 있는 관여로 이어질 수 있다.

9.1.1. 작동 원리

감정 프롬프팅은 일반적으로 다음 단계를 포함한다:

9.1.2. 감정 프롬프팅의 예시

감정 프롬프팅은 다음과 같이 감정 표현과 몰입을 요구하는 다양한 작업에 적용할 수 있다:

9.1.3. 감정 프롬프팅의 장점

감정 프롬프팅은 여러 장점을 제공한다:

9.1.4. 감정 프롬프팅의 한계

장점에도 불구하고 감정 프롬프팅에는 몇 가지 한계가 있다:

9.2. 스크래치패드 프롬프팅

스크래치패드 프롬프팅은 대규모 언어 모델(LLM)이

추론 과정에서 중간 결과, 메모 또는 정보를 저장하고 조작하기 위해 외부 "스크래치패드" 또는 메모리를 사용할 수 있도록 하여 문제 해결 능력을 향상하는 기법이다 [124]. 이 접근법은 인간이 복잡한 문제를 해결할 때 흔히 스크래치패드나 외부 메모리 보조 도구를 사용하여 인지적 부담을 덜고 중간 단계의 기록을 유지하는 방식에서 영감을 얻었다 [132]. LLM에 스크래치패드를 제공함으로써 이 기법은 복잡한 작업을 더 작고 관리하기 쉬운 단계로 나누고, 중간 계산이나 결과를 추적하며, 이전 정보를 다시 참조할 수 있게 하여 다단계 추론, 계획 및 의사결정을 요구하는 작업에서 성능을 향상한다 [76].

9.2.1. 작동 원리

스크래치패드 프롬프팅은 일반적으로 다음 단계를 포함한다:

9.2.2. 스크래치패드 프롬프팅의 예시

스크래치패드 프롬프팅은 다음과 같이 외부 메모리와 다단계 추론의 이점을 얻는 다양한 작업에 적용할 수 있다:

9.2.3. 스크래치패드 프롬프팅의 장점

스크래치패드 프롬프팅은 여러 장점을 제공한다:

9.2.4. 스크래치패드 프롬프팅의 한계

장점에도 불구하고 스크래치패드 프롬프팅에는 몇 가지 한계가 있다:

9.3. 생각의 프로그램(PoT) 프롬프팅

생각의 프로그램(PoT) 프롬프팅은 추론 과정을 프로그램으로 표현하여 대규모 언어 모델(LLM)의 추론 역량을 개선하는 것을 목표로 하는 새로운 프롬프팅 기법이다 [179]. 이 접근법은 복잡한 작업을 더 작고 관리하기 쉬운 모듈이나 함수로 나누는 컴퓨터 프로그래밍 분야에서 영감을 얻었다 [179]. 추론을 프로그램으로 표현함으로써 PoT 프롬프팅은 LLM이 일련의 지침을 실행하고, 중간 변수를 조작하며, 추론 과정에서 정보 흐름을 제어할 수 있게 하여 더 체계적이고 정확한 문제 해결로 이어진다 [179].

9.3.1. 작동 원리

PoT 프롬프팅은 일반적으로 다음 단계를 포함한다:

9.3.2. 생각의 프로그램(PoT) 프롬프팅의 예시

PoT 프롬프팅은 다음과 같이 구조화된 추론과 프로그램과 유사한 실행의 이점을 얻는 다양한 작업에 적용할 수 있다:

function calculate_triangle_area
(base, height):
    area = (1/2) * base * height
    return area

그런 다음 주어진 값으로 프로그램을 실행하고 답을 추출한다.

function can_penguin_fly():
    if all birds can fly and penguin is a bird:
        return True
    else:
        return False

그런 다음 프로그램을 실행하고 논리 규칙에 따라 답을 추출합니다.

다양한 선택지, 제약 조건 및 의사결정 기준을 정의하고, 이를 실행하여 최적의 계획을 찾습니다.

9.3.3. 프로그램 사고(PoT) 프롬프팅의 장점

PoT 프롬프팅은 다음과 같은 여러 장점을 제공합니다:

9.3.4. 프로그램 사고(PoT) 프롬프팅의 한계

장점에도 불구하고, PoT 프롬프팅에는 몇 가지 한계가 있습니다:

9.4. 구조화된 사고 연쇄(Scot) 프롬프팅

구조화된 사고 연쇄(SCoT) 프롬프팅은 중간 추론 단계에 구조화된 형식을 통합하여 대규모 언어 모델(LLM)의 추론 능력을 향상하는 것을 목표로 하는 고급 프롬프팅 기법입니다 [89]. 이 접근법은 전통적인 사고 연쇄(CoT) 프롬프팅 방법을 기반으로 하지만, 흔히 템플릿, 다이어그램 또는 기타 구조화된 형식을 사용하여 추론 과정을 더 조직적이고 체계적으로 표현하는 방식을 도입합니다 [132]. SCoT 프롬프팅은 추론 단계에 명확한 구조를 제공함으로써 LLM이 복잡한 추론, 다단계 문제 해결 및 논리적 추론이 필요한 작업에서 더 일관되고, 해석 가능하며, 정확한 응답을 생성하도록 안내합니다 [76].

9.4.1. 작동 원리

SCoT 프롬프팅은 일반적으로 다음 단계를 포함합니다:

9.4.2. 구조화된 사고 연쇄(Scot) 프롬프팅의 예시

1단계: 공식을 식별합니다:

\text{Area} = \frac{1}{2} \times \text{base} \times \text{height}.

2단계: 값을 대입합니다:

\text{Area} = \frac{1}{2} \times 10 \text{ cm} \times 5 \text{ cm}.

3단계: 결과를 계산합니다:

\text{Area} = 25 \text{ cm}^2.

9.4.3. 구조화된 사고 연쇄(Scot) 프롬프팅의 장점 SCoT 프롬프팅은 다음과 같은 여러 장점을 제공합니다:

9.4.4. 구조화된 사고 연쇄(Scot) 프롬프팅의 한계 장점에도 불구하고, SCoT 프롬프팅에는 몇 가지 한계가 있습니다:

9.5. 코드 연쇄(CoC) 프롬프팅

코드 연쇄(CoC)는 코드와 자연어의 강점을 결합하여 추론을 향상하는 대규모 언어 모델(LLM)을 위한 프롬프팅 기법입니다. 자연어에만 의존하는 방법과 달리, CoC는 LLM이 잘 정의된 알고리즘에는 실행 가능한 코드를 사용하고 의미적 이해가 필요한 작업에는 언어 모델 에뮬레이터인 “LMulator”를 사용하여 해결책을 프로그램으로 표현하도록 유도합니다 [180]. 이 접근법은 복잡한 문제를 관리 가능한 하위 작업으로 나누고, 실행 가능한 코드와 LM이 시뮬레이션한 코드를 결합하여 프로그램적 정밀성과 자연어 유연성의 장점을 활용함으로써 LLM이 효과적으로 다룰 수 있는 추론 질문의 범위를 확장합니다 [34].

9.5.1. 작동 원리

CoC의 작동 원리는 LM 추론을 향상하기 위한 코드 생성과 실행의 통합을 중심으로 합니다. 이 접근법은 기호적(코드 기반) 방법과 신경망적(LM 기반) 방법의 상호 보완적인 강점을 활용합니다. 그림 22에 제시된 Least-to-Most 프롬프팅과 같은 관련 기법과의 연관성을 포함한 자세한 설명은 다음과 같습니다.

9.5.2. 코드 연쇄(CoC) 프롬프팅의 예시

CoC 프롬프팅은 다음과 같이 계산적 또는 프로그램적 해결책이 필요한 다양한 작업에 적용할 수 있습니다:

단계 1: 질문을 하위 질문으로 분해

단계 2: 하위 질문을 순차적으로 해결

그림 22. 코드 연쇄와 관련된 기법인 Least-to-Most 프롬프팅의 예시입니다. 문제는 하위 질문으로 분해되고, 이들은 순차적으로 해결됩니다. 이는 문제 분해와 반복적 추론의 원리를 보여줍니다. 이 그림은 [125]의 정보를 바탕으로 작성했습니다.

9.5.3. 코드 연쇄(CoC) 프롬프팅의 장점

CoC의 주요 장점은 다음과 같습니다:

9.5.4. 코드 체인(CoC) 프롬프팅의 한계 9.6. 프롬프팅을 통한 최적화

“프롬프팅을 통한 최적화”(OPRO)는 대규모 언어 모델(LLM)을 범용 최적화기로 활용하는 새로운 프레임워크이다 [188]. OPRO는 전통적이고 흔히 특수화된 최적화 알고리즘에 의존하는 대신, 최적화 문제를 자연어로 구성한다 [2]. 신중하게 작성된 “메타 프롬프트”가 LLM(“최적화기 LLM”)에 제공된다. 이 메타 프롬프트에는 최적화 작업에 대한 설명, 예시, 그리고 결정적으로 이전에 생성된 해법과 그에 대응하는 점수의 이력(“최적화 궤적”)이 포함된다. LLM은 이 정보를 사용하여 새로운 후보 해법을 반복적으로 제안한다. 이어서 이러한 해법은 별도의 목적 함수 평가기(코드일 수도 있고, 프롬프트 최적화의 경우 또 다른 LLM일 수도 있음)가 평가한다. 새 해법과 점수는 궤적에 추가되고, 이 과정이 반복된다. OPRO의 주요 설계 선택에는 탐색과 활용의 균형 조정(예: LLM의 온도 설정을 통해), 메타 프롬프트의 신중한 작성(해법의 순서 및 작업 예시의 포함 등), 그리고 프롬프트 최적화의 경우 생성된 지시문의 프롬프트 내 위치 선택이 포함된다. OPRO의 장점으로는 자연어 인터페이스, 다양한 작업에 대한 적응성, 그리고 LLM의 패턴 인식 및 생성 능력 활용이 있다. 한계는 계산 비용, 메타 프롬프트 민감성, 그리고 지역 최적점에 갇힐 가능성과 관련된다. 이는 전통적인 최적화에서 크게 전환한 방식으로, 특히 기울기 정보를 사용할 수 없거나 새로운 작업에 신속히 적응해야 하는 문제에 적합한 더 직관적이고 유연한 접근법을 제공한다.

9.6.1. 작동 원리

그림 23. 프롬프팅을 통한 최적화(OPRO) 과정. LLM은 최적화기로 작동하며, 작업 설명과 해법 및 그 점수의 이력이 포함된 메타 프롬프트를 바탕으로 해법을 반복적으로 생성한다. 목적 함수 평가기는 생성된 해법을 평가하고, 그 결과는 다음 반복을 위해 메타 프롬프트를 업데이트하는 데 사용된다 [189].

또는 빈 문자열일 수도 있다(특히 프롬프트 최적화에서). 이 초기 집합은 반복적 정제의 출발점을 제공한다.

9.6.2. 프롬프팅을 통한 최적화의 예시

프롬프팅을 통한 최적화는 다음을 포함하여 LLM의 성능을 향상하기 위해 다양한 작업과 도메인에서 활용할 수 있다:

[27]. “프롬프트”(LLM에 대한)는 선형 회귀 설명, 여러 예시 데이터 포인트(가령 “입력: [x 값], 출력: [y 값]” 형식), 그리고 새로운 계수 집합을 생성하라는 요청(예: “오차를 최소화하는 새로운 w와 b를 생성하라.”)을 포함한다. “점수”는 제공된 데이터 포인트에 대한 평균 제곱 오차(MSE)와 같은 오차 측정값이다. 프롬프트는 모델에 제공된 값과 다른 값을 제안하고 코드를 출력하지 않도록 명시적으로 지시한다.

성능을 개선하는 새 설정을 요청하기 위한 성능별 하이퍼파라미터 설정이 포함되어야 한다.

9.6.3. 프롬프팅을 통한 최적화의 장점

프롬프팅을 통한 최적화는 여러 이점을 제공한다 [2,188,191]:

9.6.4. 프롬프팅을 통한 최적화의 한계

장점에도 불구하고, 프롬프팅을 통한 최적화에는 다음과 같은 한계도 있다:

9.7. 다시 표현하고 응답하기(RaR) 프롬프팅

다시 표현하고 응답하기(Rephrase and Respond, RaR)는 인간과 LLM 간의 오해를 해결하여 대규모 언어 모델(LLM)의 성능을 향상하도록 설계된 제로샷 프롬프팅 기법이다. 이 기법은 LLM에 먼저 사용자의 질문을 다시 표현하고 상세히 설명한 다음, 다시 표현된 버전을 바탕으로 응답하도록 지시함으로써 자기 명료화 단계를 효과적으로 통합해 의사소통을 개선한다 [26]. RaR의 기본 아이디어는 LLM도 인간과 마찬가지로 사용자의 것과 다른 내부 “사고 틀”에 근거해 질문을 해석할 수 있다는 것이다. 이는 오해로 이어질 수 있다. RaR은 명확성을 보장하도록 질문을 명시적으로 다시 표현하여 이러한 사고 틀을 정렬하며, 그 결과 더 정확한 이해와 응답을 낳는다 [30]. 이 과정은 더 나은 이해를 위해 사람이 질문을 바꾸어 표현해 모호성을 줄이는 것과 유사하다. 또한 RaR의 2단계 변형이 도입된다. 이 변형에서 LLM은 먼저 질문을 다시 표현한 뒤, 원래 버전과 다시 표현한 버전을 모두 별도의 응답 LLM에 전달한다 [192]. 이 접근법은 추가적인 검증 및 정제 계층을 도입하여 응답 정확도를 더욱 향상한다.

9.7.1. 작동 원리

재구성 후 응답(Rephrase and Respond, RaR) 프롬프팅은 일반적으로 다음 단계로 구성된다:

9.7.2. 재구성 후 응답(RaR) 프롬프팅의 예시

RaR 프롬프팅은 입력을 다듬는 것이 응답의 정확성과 관련성을 향상시키는 다음과 같은 다양한 작업에 적용할 수 있다:

그림 24. GPT-4가 해석한 “[인물]은 짝수 달에 태어났는가?”라는 질문의 모호성 예시. “짝수 달”에 대한 서로 다른 해석으로 인해 서로 다른 응답이 제공되며, 이는 RaR 프롬프팅과 같은 기법의 필요성을 부각한다 [26].

이러한 재구성은 지나치게 단순화되거나 오해를 불러일으키는 답변을 방지한다 [195].

9.7.3. 재구성 후 응답(RaR) 프롬프팅의 장점 RaR 프롬프팅은 다음과 같은 몇 가지 핵심 이점을 제공한다:

재구성된 버전. 이는 사용자가 LLM이 어떻게 답변에 도달했는지 이해하고 잠재적인 오해를 식별하는 데 도움이 될 수 있다 [45].

9.7.4. 재구성 후 응답(RaR) 프롬프팅의 한계

장점에도 불구하고 RaR 프롬프팅에는 몇 가지 한계가 있다:

9.8. 한 걸음 물러서기 프롬프팅

한 걸음 물러서기 프롬프팅은 대규모 언어 모델(LLM)을 위한 프롬프팅 기법으로, 먼저 LLM이 특정 질문에서 “한 걸음 물러서” 고수준 개념, 원리 또는 관련 사실을 도출하도록 프롬프트한 다음, 이 추상화된 정보를 사용하여 원래 질문에 대한 답변을 안내함으로써 추론을 강화한다. 이 2단계 과정에는 LLM이 원래 질의와 관련된 더 광범위하고 일반적인 “한 걸음 물러선 질문”을 생성하고 답하는 추상화 단계가 포함되며, 그 뒤에는 LLM이 추상화된 정보를 활용하여 초기의 구체적 질문에 더 효과적이고 정확하게 답하는 추론 단계가 이어진다. 이 접근법은 세부 사항에 뛰어들기 전에 더 큰 그림을 고려하도록 모델을 장려함으로써 인간의 문제 해결을 모방하며, 이를 통해 초점을 개선하고 오류를 줄이며 관련 고수준 지식에 추론의 근거를 둔다.

9.8.1. 작동 원리

그림 25에 나타난 것처럼, 한 걸음 물러서기 프롬프팅은 일반적으로 다음 단계를 포함한다:

기본 개념 또는 원리를 대상으로 하는 “한 걸음 물러선 질문”이 생성된다. 그림 25는 각 예시의 “한 걸음 물러선 질문”을 통해 이를 명확히 보여 준다.

9.8.2. 한 걸음 물러서기 프롬프팅의 예시

한 걸음 물러서기 프롬프팅은 입력을 명확히 하면 더 나은 응답으로 이어질 수 있는 다음과 같은 다양한 작업에 적용할 수 있다:

그림 25. 표준 Chain-of-Thought와 비교한 Step-Back 프롬프팅의 예시. 왼쪽은 표준 Chain-of-Thought의 잘못된 결과를 보여준다. 오른쪽은 Step-Back 과정, 즉 (1) 더 높은 수준의 질문으로 추상화, (2) 추상 질문에 답변, (3) 추상 답변을 사용하여 원래 질문에 대한 추론을 안내하는 과정을 보여준다. 이 그림은 [205]의 정보를 바탕으로 작성하였다.

원래 질의를 단순화하는 스텝백 질문을 생성하도록 프롬프트된다. 이 추상 질문은 원래 질문과 함께 관련 정보를 검색하는 데 사용된다(RAG를 사용하는 경우). 핵심 아이디어는 복잡한 추론 과정을 초기 추상화 단계와 그 추상화에 근거한 후속 추론으로 분해하면 다중 홉 추론을 더 관리하기 쉽고 오류가 덜 발생하게 만든다는 것이다.

9.8.3. 한 걸음 물러서기 프롬프팅의 장점

9.8.4. 한 걸음 물러서기 프롬프팅의 한계

9.9. 텍스트-이미지 생성용 프롬프트 엔지니어링

LLM으로 좋은 원하는 이미지를 생성하려면 사용자는 흔히 반복적인 개선이 필요하다. 이미지의 일부나 특성이 사용자에게 바람직하지 않을 때 사용자는 원하는 개선 사항을 언급하며 다시 요청해야 한다 [211]. 또한 좋은 결과를 위해 프롬프트는 상세하고 이해하기 쉬우며 간결해야 한다 [78]. 그림 1의 이미지 생성 과정은 프롬프트 엔지니어링을 통해 원하는 이미지를 생성하는 예시이다. 연구자들은 이미지 생성에도 RAG를 사용하고 있다. 사슴에는 서로 다른 유형이 존재하므로, 다른 많은 객체도 서로 다른 이미지를 가질 수 있다. 예를 들어, "차 안의 강아지"는 사용자가 선호하지 않는 특별한 유형의 차를 생성할 수 있다. 원하는 차의 이미지를 제공하면

생성된 이미지를 사용자가 더 수용할 수 있게 된다 [212].

10. 프롬프트 엔지니어링 기법의 정성적 비교

프롬프트 엔지니어링은 다양한 기법을 포괄하며, 각 기법은 뚜렷한 장점, 한계 및 최적의 적용 분야를 지닌다. 다양한 작업에서 대규모 언어 모델의 성능을 극대화하려면 적절한 기법을 선택하는 것이 중요하다. 이 절에서는 주요 프롬프팅 방법을 정성적으로 비교하고, 구현 용이성, 계산 효율성 및 다양한 도메인에서의 효과를 평가한다. 표 6은 이러한 기법을 요약하여 장점, 제약 사항 및 일반적인 사용 사례를 제시한다.

이러한 기법을 더 잘 이해하기 위해 단순성 대 복잡성, 정확도와 제어, 지식 통합 등 여러 핵심 차원을 기준으로 분류할 수 있다. 아래에서는 프롬프트 엔지니어링에서 단순성과 복잡성 간의 상충 관계부터 시작해 이러한 차원을 자세히 살펴본다.

표 6
기법 비교: 장점, 한계 및 사용 사례.

기법 장점 한계 사용 사례
Zero-Shot 프롬프팅 유연성 작업별 학습 불필요 신속한 배포 일반화 테스트 Few-Shot보다 낮은 성능 사전 학습 지식 의존 성능 변동성 분류 번역 생성 분석
Few-Shot 프롬프팅 향상된 정확도 더 나은 적응성 출력에 대한 더 많은 제어 예시 민감성 토큰 사용량 증가 항상 최적은 아님 텍스트 분류 번역 코드 생성 질의응답
Chain-of-Thought (CoT) 프롬프팅 향상된 추론 더 나은 해석 가능성 토큰 사용량 증가 품질 의존성 수학 문제 해결 논리적 추론 상식적 추론
자동 CoT (Auto-CoT) 향상된 정확도 일반화 불필요함 수학적 추론 논리적 연역
자동 CoT (LogiCoT) 자동화 향상된 일반화 잘못된 추론 가능성 계산 비용 증가 데이터 품질 의존성 사실 기반 질의응답 수학적 논리 연역적 추론
논리적 CoT (LogiCoT) 향상된 논리적 추론 정확도 향상 해석 가능성 향상 지식 통합 복잡성 계산 비용 지식 의존성 제약 조건 기반 추론
Self-Consistency 향상된 정확도 견고성 다목적성 해석 가능성 계산 비용 다양성 의존성 다단계 산술 상식 추론 기호 추론
Retrieval Augmented Generation (RAG) 향상된 정확도 지식 접근성 검색 품질 계산 비용 편향 및 잡음 개방형 도메인 QA 지식 집약적 추론 사실 검증
ReAct 동적 문제 해결 지식 습득 향상된 정확도 설명 가능성 복잡성 계산 비용 안전성 우려 대화형 문제 해결 지식 기반 QA 불확실성을 고려한 의사 결정
Chain-of-Verification (CoVe) 향상된 정확도 감소한 환각 계산 비용 검증 효과성 질의응답 요약 코드 생성
Automatic Prompt Engineer (APE) 향상된 신뢰성 적응성 자동화 효율성 적응성 성능 향상 제한된 범위 평가 과제 계산 비용 편향 및 일반화 질의응답 텍스트 요약 코드 생성 대화 생성

10.1. 평가 지표

프롬프트 효과성은 일반적으로 다운스트림 작업 정확도(예: GSM8K, MMLU)를 사용하여 측정된다. 그러나 사소한 프롬프트 변형도 추론 성능에 상당한 영향을 미치므로 정확도만으로는 추론 안정성이나 견고성을 포착할 수 없다 [218]. 향후 평가에는 안정성, 토큰 효율성 및 일관성 지표가 포함되어야 한다.

10.2. 견고성 및 재현성

견고성이란 작은 프롬프트 교란에도 출력이 안정적으로 유지되는 것을 의미한다. 실증 연구는 프롬프트의 순서와 표현 방식에 대한 높은 민감도를 보여준다 [219]. 확률적 디코딩과 문서화되지 않은 하이퍼파라미터는 재현성에도 영향을 미치므로 표준화된 보고 프로토콜이 필요하다.

11. 프롬프트 엔지니어링 기법의 응용 기반 분류체계

프롬프트 엔지니어링은 대규모 언어 모델(LLM)의 성능을 최적화하는 핵심 분야로 빠르게 부상했다. 프롬프팅 기법의 다양성은 다양한 응용 영역에서 뚜렷한 장점을 제공하며, 각 기법은 특정한 계산 및 추론 요구를 충족한다. 이러한 방법론의 체계적인 분류는 연구자와 실무자의 정보에 기반한 의사 결정을 촉진하여 각자의 작업에 가장 효과적인 접근법을 선택할 수 있게 한다. 표 7은 프롬프트의 체계적인 분류체계를 제시한다

표 7
프롬프트 엔지니어링의 기술적 지형.

구현 영역 효율적인 프롬프팅 전략
자동화된 텍스트 분류 Zero-Shot Prompting, Few-Shot Prompting
신경망 기계 번역 (NMT) Zero-Shot Prompting, Few-Shot Prompting
콘텐츠 생성 및 확장 Zero-Shot Prompting, Few-Shot Prompting, Tree-of-Thoughts (ToT)
데이터 해석 및 요약 Zero-Shot Prompting
수학적 모델 추론 Chain-of-Thought (CoT), Auto-CoT, Chain-of-Note (CoN), Active-Prompt
기호 및 논리적 연역 Chain-of-Thought (CoT), Auto-CoT, Logical CoT (LogiCoT), Chain-of-Note (CoN), Active-Prompt
상식적 의사 결정 Chain-of-Thought (CoT), Self-Consistency, Thread-of-Thought (ThoT), Active-Prompt
다단계 계산 추론 Self-Consistency
전략적 게임 계획 Tree-of-Thoughts (ToT)
AI 지원 코드 합성 Few-Shot Prompting, Tree-of-Thoughts (ToT), Chain-of-Verification (CoVe), Auto Prompt Engineer (APE)
인지적 의사 결정 최적화 System 2 Attention
복잡한 질의응답 (QA) Chain-of-Verification (CoVe)
구조화된 데이터 분석 Chain-of-Table
QA를 위한 정보 검색 Retrieval Augmented Generation (RAG)
작업 지향적 문제 해결 ReAct
계산 정리 증명 Chain-of-Note (CoN)
과학 지식 종합 Chain-of-Knowledge (CoK)

엔지니어링 전략을 최적의 사용 사례에 매핑한다. 이러한 분류는 각 기법의 기능적 범위를 명확하게 이해하도록 하여, 더욱 효율적이고 맥락적으로 적합한 NLP 솔루션 개발을 돕는다. Zero-Shot 및 Few-Shot Prompting과 같은 기본 접근법은 사전 맥락화가 거의 필요하지 않은 분류 및 번역 작업에서 뛰어난 효능을 보인다 [1,5]. 더 복잡한 문제 해결 시나리오에서는 Chain-of-Thought (CoT) [220], Logical CoT (LogiCoT) [213], Active-Prompt [152]와 같은 구조화된 방법론이 추론 정확도를 크게 향상한다. 이러한 기법은 복잡한 질의를 중간 인지 단계로 분해하여 인간의 분석 과정을 모방한다. LogiCoT는 연역적 추론을 강화하기 위해 논리적 제약을 통합하고, Active-Prompt는 응답을 동적으로 정제한다

반복적 피드백 메커니즘을 통해 대화형 애플리케이션에서 효과적임이 입증된다.

Tree-of-Thoughts (ToT) [105] 및 Graph-of-Thought (GoT) [109]와 같은 최첨단 프롬프팅 패러다임은 창의성, 과학적 추론, 협업 지능이 요구되는 분야에서 핵심적인 역할을 한다. Retrieval-Augmented Generation (RAG)은 외부 지식 소스를 통합하여 개방형 질의에 대한 응답을 혁신했으며, Chain-of-Verification (CoVe)는 요약 및 코드 생성에서 사실적 일관성을 향상한다. 이러한 기법은 LLM의 추론 역량을 크게 증대하여 다양한 애플리케이션 전반에서 더 정밀하고 맥락 인식적이며 신뢰할 수 있는 출력을 가능하게 한다. 또한 구조화된 데이터 분석은 표 형식 및 기호 데이터에 대한 논리 연산을 용이하게 하는 Chain-of-Table [133] 및 Chain-of-Symbol (CoS) [104]과 같은 전문 프레임워크의 이점을 얻는다. 불확실한 환경의 의사결정 모델은 추론과 실시간 행동 수행을 원활하게 통합하는 ReAct [42]와 같은 방법론을 활용한다. 이러한 발전은 종합적으로 LLM을 더 높은 적응성, 정밀성 및 맥락 이해로 이끌며, 광범위한 계산 작업 전반에 적용할 수 있음을 강화했다. 이러한 기법을 체계적으로 분류함으로써 연구자와 실무자는 효율성, 해석 가능성 및 도메인별 정확도의 균형을 맞추면서 성능을 극대화하는 프롬프팅 방법론을 전략적으로 배포할 수 있다. 구조화된 참고를 위해 표 7은 기법을 각 도메인에 매핑하여 언어 모델 성능 최적화를 위한 의사결정을 돕는다. 이 표는 Chain-of-Thought, Retrieval-Augmented Generation 및 Tree-of-Thoughts와 같은 기법이 추론, 생성 및 문제 해결을 어떻게 향상하는지 강조하며, 계산 도메인 전반에서 더 효율적이고 정확한 LLM 배포에 기여한다. 각 방법의 강점과 한계를 이해함으로써 사용자는 효율성, 해석 가능성 및 정확성의 균형을 맞춰 다양한 NLP 작업에 맞는 프롬프트 선택을 최적화할 수 있다.

12. 비판적 종합 및 절충

프롬프팅 기법은 구조가 서로 다르지만, 그 효과는 추론 제어, 견고성, 계산 비용이라는 세 가지 핵심 요인에 의해 좌우된다.

Zero-shot 프롬프팅은 신속한 배포를 가능하게 하지만 다단계 추론 작업에서 불안정성을 보인다 [27]. Few-shot 프롬프팅은 시연을 통해 작업 정렬을 개선하지만 토큰 오버헤드를 증가시키며 예시 선택에 여전히 민감하다 [5,100].

Chain-of-Thought (CoT)는 중간 단계를 유도하여 추론 정확도를 크게 향상한다 [2]. 그러나 오류 전파 위험과 추론 지연 시간 증가를 초래한다. Self-consistency는 여러 추론 체인을 집계하여 단일 경로 추론 오류를 완화하지만 [97], 계산 비용이 상당히 더 높다.

Tree-of-Thoughts는 추론을 구조화된 탐색 공간으로 확장하여 계획 집약적 작업의 성능을 개선한다 [105]. 그럼에도 확장성 및 메모리 제약은 실제 배포를 제한한다.

전반적으로 어떤 단일 프롬프팅 패러다임도 보편적으로 최적은 아니다. 프롬프트 설계는 작업 복잡도와 자원 제약에 따라 해석 가능성, 안정성 및 효율성의 균형을 요구한다.

12.1. 자동화된 프롬프트 최적화

수동 프롬프트 설계는 휴리스틱적이며 불안정하다. Automatic Prompt Engineer (APE)와 같은 자동화 방법은 모델 기반 탐색을 통해 프롬프트를 생성하고 정제한다 [157]. 강화 학습 접근법은 작업별 목표에 맞춰 프롬프트를 추가로 최적화한다. 그러나 이러한 방법은 여전히 계산 비용이 높고 이론적 안정성 보장이 없다.

13. 결론 및 연구 의제

이 조사는 기초 프롬프팅(zero-shot, few-shot), 추론 중심 방법(CoT, Self-Consistency, ToT, GoT)을 아우르는 구조화된 분류 체계를 통해 프롬프트 및 컨텍스트 엔지니어링을 종합했다.

검증 기반 프레임워크(CoVe) 및 시스템 수준의 컨텍스트 오케스트레이션(RAG, ReAct, 메모리 증강 시스템).

GSM8K, MMLU 및 지식 집약적 QA와 같은 벤치마크 전반의 증거는 추론 구조화 프롬프팅(예: CoT, Self-Consistency, ToT)이 다단계 추론 정확도를 일관되게 개선함을 보여준다. 그러나 이러한 이득에는 토큰 소비 증가, 추론 지연 시간 및 프롬프트 문구에 대한 민감성이 수반된다. 검색 기반 방법은 외부 지식에 생성을 근거화하여 환각을 줄이지만, 검색 잡음, 순위 불안정성 및 컨텍스트 윈도우 포화 문제를 초래한다.

문헌의 핵심 공백은 표준화된 평가 프로토콜의 부재이다. 현재 연구는 주로 작업 수준 정확도를 보고하는 반면, 프롬프트 교란에 대한 견고성, 토큰 효율성, 디코딩 전략 전반의 재현성 및 장기 상호작용에서의 배포 안정성을 간과한다. 따라서 안정성, 효율성 및 사실적 일관성 지표를 통합한 벤치마크 표준을 수립하는 것이 필수적이다.

프롬프트 엔지니어링의 궤적은 자동화와 시스템 수준 오케스트레이션으로 이동하고 있다. 자동화된 프롬프트 최적화, 검색 근거화 파이프라인 및 에이전트형 추론 프레임워크는 수동 언어 정제에서 구조화된 제어 아키텍처로의 전환을 나타낸다. 그러나 자동화는 계산 오버헤드, 평가 잡음, 프롬프트 인젝션 및 탈옥 공격과 같은 보안 취약성을 포함한 새로운 제약을 도입한다.

배포 관점에서 컨텍스트 윈도우 제한, 추론 비용, 검색 지연 시간 및 정렬 안전장치와 같은 실용적 제약은 통제된 벤치마킹 환경에서 여전히 충분히 연구되지 않았다. 이 격차를 해소하려면 고립된 프롬프트-출력 테스트가 아니라 실제 파이프라인 제약을 반영하는 평가 환경이 필요하다.

제안된 분류 체계에 맞춰 향후 연구는 다음에 초점을 맞춰야 한다: (i) 견고성 인식 프롬프팅 전략, (ii) 토큰 효율적 추론 메커니즘, (iii) 표준화된 교차 모델 벤치마킹 프레임워크, (iv) 안전한 컨텍스트 관리, (v) 이론적 보장에 기반한 확장 가능한 자동화 방법.

프롬프트 엔지니어링은 입력 수준의 지시 조정에서 전체 컨텍스트 수명 주기 오케스트레이션으로 진화하고 있다. 그 다음 단계는 개선된 추론 기법뿐 아니라 원칙에 기반한 표준화, 재현 가능한 평가 및 배포 인식 시스템 설계에도 달려 있다.

이해관계 충돌 선언

저자들은 본 논문에 보고된 연구에 영향을 미친 것으로 보일 수 있는 알려진 경쟁적 재정적 이해관계 또는 개인적 관계가 없음을 선언한다. 저자는 이 저널의 편집위원/편집장/부편집장/객원 편집자이며, 본 논문의 편집 검토 또는 게재 결정에 관여하지 않았다.

데이터 가용성

본 논문에서 설명한 연구에는 데이터가 사용되지 않았다.

참고문헌

  1. [1] A. Radford, J. Wu, R. Child, D. Luan, D. Amodei, I. Sutskever, et al., Language models are unsupervised multitask learners, OpenAI blog 1 (8) (2019) 9.
  2. [2] J. Wei, X. Wang, D. Schuurmans, M. Bosma, F. Xia, E. Chi, Q.V. Le, D. Zhou, et al., Chain-of-thought prompting elicits reasoning in large language models, Adv. Neural Inf. Process. Syst. 35 (2022) 24824–24837.
  3. [3] F. Eskandari, Z. Roozbahani, A review of prompt engineering methods in large language models, Eng. Manag. Soft Comput. 10 (2) (2025) 1–35.
  4. [4] J. Wang, Z. Liu, L. Zhao, Z. Wu, C. Ma, S. Yu, H. Dai, Q. Yang, Y. Liu, S. Zhang, et al., Review of large vision models and visual prompt engineering, Meta-Radiol. 1 (3) (2023) 100047.
  5. [5] T. Brown, B. Mann, N. Ryder, M. Subbiah, J.D. Kaplan, P. Dhariwal, A. Neelakantan, P. Shyam, G. Sastry, A. Askell, et al., Language models are few-shot learners, Adv. Neural Inf. Process. Syst. 33 (2020) 1877–1901.
  6. [6] J. Huang, K.C.C. Chang, Towards reasoning in large language models: a survey, in: Findings of the Association for Computational Linguistics: ACL 2023, 2023, pp. 1049–1065.

[64] I.W. Syahputri, E.K. Budiardjo, P.O.H. Putra, 소프트웨어 엔지니어링에서 프롬프트 엔지니어링 패러다임의 잠재력 실현: 체계적 문헌 검토, AI 6 (9) (2025) 206.

[65] H. Zhou, C. Hu, D. Yuan, Y. Yuan, D. Wu, X. Chen, H. Tabassum, X. Liu, 무선 네트워크를 위한 대규모 언어 모델: 프롬프트 엔지니어링 관점에서의 개요, IEEE Wirel. Commun. 32 (4) (2025) 98–106, https://doi.org/10.1109/MWC.001.2400384

[66] K. Ronanki, S. Arvidsson, J. Axell, 요구사항 엔지니어링에서 대규모 언어 모델 사용을 위한 프롬프트 엔지니어링 지침, in: Euromicro Conference on Software Engineering and Advanced Applications , Springer, 2025, pp. 245–262.

[67] A. Singh, N.K. Chatta, A. Ehtesham, S. Kumar, G.K. Gupta, T.T. Khoei, 프롬프트 엔지니어링 기법의 SWOT 분석에 관한 체계적 문헌 검토, IEEE Trans. Artif. Intell. 7 (5) (2026) 2447–2461, https://doi.org/10.1109/TAI.2025.3626467

[68] M. Naser, 대규모 언어 모델을 위한 프롬프트 엔지니어링 기법 검토, Int. J. Hum.-comput. Interact. (2025) 1–35.

[69] J. Liu, D. Zhu, Z. Bai, Y. He, H. Liao, H. Que, Z. Wang, C. Zhang, G. Zhang, J. Zhang, et al., 장문맥 언어 모델링에 관한 포괄적 설문, arxiv:2503.17407 , 2025.

[70] L. Reynolds, K. McDonell, 대규모 언어 모델을 위한 프롬프트 프로그래밍: 퓨샷 패러다임을 넘어, in: Extended Abstracts of the 2021 CHI Conference on Human Factors in Computing Systems , 2021, pp. 1–7.

[71] B. Lester, R. Al-Rfou, N. Constant, 매개변수 효율적 프롬프트 튜닝을 위한 규모의 힘, in: Proceedings of the 2021 Conference on Empirical Methods in Natural Language Processing , 2021, pp. 3045–3059.

[72] X. Zhao, M. Li, W. Lu, C. Weber, J.H. Lee, K. Chu, S. Wermter, 논리를 통한 대규모 언어 모델의 제로샷 사고 연쇄 추론 향상, in: Proceedings of the 2024 Joint International Conference on Computational Linguistics, Language Resources and Evaluation (LREC-COLING 2024) , 2024, pp. 6144–6166.

[73] J. Wei, M. Bosma, V.Y. Zhao, K. Guu, A.W. Yu, B. Lester, N. Du, A.M. Dai, Q.V. Le, 미세 조정된 언어 모델은 제로샷 학습자이다, arXiv preprint arXiv:210901652 , 2021.

[74] I. Beltagy, A. Cohan, R. Logan IV, S. Min, S. Singh, 사전 학습된 언어 모델을 이용한 제로샷 및 퓨샷 NLP, in: Proceedings of the 60th Annual Meeting of the Association for Computational Linguistics: Tutorial Abstracts , 2022, pp. 32–37.

[75] E. Perez, D. Kiela, K. Cho, 언어 모델을 활용한 진정한 퓨샷 학습, Adv. Neural Inf. Process. Syst. 34 (2021) 11054–11070.

[76] Y. Zhang, Z. Yu, Y. Huang, J. Tang, Climfs: 퓨샷 개체명 인식을 위한 대조 학습으로 향상된 대규모 언어 모델 프레임워크, arXiv preprint arXiv:240812834 , 2024.

[77] S. Yu-Te Lee, A. Bahukhandi, D. Liu, K.L. Ma, 대규모 언어 모델 프롬프트에서 텍스트 요약의 데이터셋 규모 및 특성 지향 평가를 향하여, IEEE Trans. Vis. Comput. Graph. 31 (1) (2024) 481–491.

[78] Y. Hao, Z. Chi, L. Dong, F. Wei, 텍스트-이미지 생성을 위한 프롬프트 최적화, Adv. Neural Inf. Process. Syst. 36 (2023) 66923–66939.

[79] J. Sun, S. Lapuschkin, W. Samek, Y. Zhao, N.M. Cheung, A. Binder, 교차 도메인 퓨샷 분류를 위한 설명 유도 학습, in: 2020 25th International Conference on Pattern Recognition (ICPR) , IEEE, 2021, pp. 7609–7616.

[80] Y. Zhang, C. Radishian, S. Brunswicker, D. Whitenack, D.W. Linna Jr, 프롬프트 엔지니어링 하에서 LLM의 공감 언어: 법률 분야의 비교 연구, Procedia Comput. Sci. 244 (2024) 308–317.

[81] D. Trautmann, A. Petrova, F. Schilder, 다국어 법률 판결 예측을 위한 법률 프롬프트 엔지니어링, arXiv preprint arXiv:221202199 , 2022.

[82] F. Yu, L. Quartey, F. Schilder, 법률 추론 과업을 위한 프롬프트 엔지니어링의 효과성 탐색, in: Findings of the Association for Computational Linguistics: ACL 2023 , 2023, pp. 13582–13596.

[83] T.L. Ahlgren, H.F. Sunde, K.K. Kemell, A. Nguyen-Duc, LLM을 활용한 초기 단계 소프트웨어 스타트업 지원: 효과적인 프롬프트 엔지니어링 및 시스템 지시문 설계, Inf. Softw. Technol. (2025) 107832.

[84] X. Liang, X. Li, F. Li, J. Jiang, Q. Dong, W. Wang, K. Wang, S. Dong, G. Luo, S. Li, Medfilip: 의료 세분화 언어-이미지 사전 학습, IEEE J. Biomed. Health Inform. 29 (5) (2025) 3587–3597.

[85] L. Buess, M. Keicher, N. Navab, A. Maier, S. Tayebi Arasteh, 대규모 언어 모델에서 멀티모달 AI까지: 의학에서 생성형 AI의 잠재력에 관한 범위 검토, Biomed. Eng. Lett. 15 (5) (2025) 845–863.

[86] Y. Kobayashi, T. Uchida, T. Inoue, Y. Iwasaki, R. Ito, K. Saito, H. Akiyama, K. Tsuda, K. Yoshida, 자연어 처리와 생성형 AI를 활용한 50년간 건강식품 연구 동향 분석, Procedia Comput. Sci. 246 (2024) 1875–1884.

[87] F. Naghdy, 공학 연구 설계에서 GenAI와의 협업, Data Knowl. Eng. 159 (2025) 102445.

[88] F. Luo, J. Zhang, Q. Wang, C. Yang, 화학 연구 가속화를 위한 대규모 언어 모델에서의 프롬프트 엔지니어링 활용, ACS Cent. Sci. 11 (4) (2025) 511–519.

[89] Z. Zhang, A. Zhang, M. Li, A. Smola, 대규모 언어 모델에서의 자동 사고 연쇄 프롬프팅, arXiv preprint arXiv:221003493 , 2022.

[90] S. Huang, L. Dong, W. Wang, Y. Hao, S. Singhal, S. Ma, T. Lv, L. Cui, O.K. Mohammed, B. Patra, et al., 언어만으로는 충분하지 않다: 지각을 언어 모델과 정렬하기, Adv. Neural Inf. Process. Syst. 36 (2023) 72096–72109.

[91] A. Lewkowycz, A. Andreassen, D. Dohan, E. Dyer, H. Michalewski, V. Ramasesh, A. Slone, C. Anil, I. Schlag, T. Gutman-Solo, et al., 언어 모델로 정량적 추론 문제 해결하기, Adv. Neural Inf. Process. Syst. 35 (2022) 3843–3857.

[92] H. Zhou, A. Nova, H. Larochelle, A. Courville, B. Neyshabur, H. Sedghi, 인컨텍스트 학습을 통한 알고리즘적 추론 교육, arXiv 사전출판물 arXiv:221109066 , 2022.

[93] K. Shum, S. Diao, T. Zhang, 레이블 데이터의 사고 사슬을 활용한 자동 프롬프트 증강 및 선택, 수록: 전산언어학협회 연구 결과: EMNLP 2023 , 2023, pp. 12113–12139.

[94] N. Reimers, I. Gurevych, Sentence-BERT: 샴 BERT 네트워크를 사용한 문장 임베딩, 수록: 2019 자연어 처리 경험적 방법 학회 및 제9회 자연어 처리 국제 공동 학회(EMNLP-LJCNLP) 논문집 , 2019, pp. 3982–3992.

[95] Z. Zhang, A. Zhang, M. Li, H. Zhao, G. Karypis, A. Smola, 언어 모델의 멀티모달 사고 사슬 추론, arXiv 사전출판물 arXiv:230200923 , 2023.

[96] B. Wang, S. Min, X. Deng, J. Shen, Y. Wu, L. Zettlemoyer, H. Sun, 사고 사슬 프롬프팅 이해를 향하여: 무엇이 중요한지에 관한 실증 연구, 수록: 제61회 전산언어학협회 연례 학회 논문집(제1권: 장문 논문) , 2023, pp. 2717–2739.

[97] X. Wang, J. Wei, D. Schuurmans, Q. Le, E. Chi, S. Narang, A. Chowdhery, D. Zhou, 자기 일관성은 언어 모델의 사고 사슬 추론을 향상시킨다, arXiv 사전출판물 arXiv:220311171 , 2022.

[98] A. Saparov, H. He, 언어 모델은 탐욕적 추론자다: 사고 사슬의 체계적 형식 분석, arXiv 사전출판물 arXiv:221001240 , 2022.

[99] M. Khalifa, L. Logeswaran, M. Lee, H. Lee, L. Wang, Grace: 판별기 유도 사고 사슬 추론, 수록: 전산언어학협회 연구 결과: EMNLP 2023 , 2023, pp. 15299–15328.

[100] A. Liu, Z. Wu, J. Michael, A. Suhr, P. West, A. Koller, S. Swayamdipta, N.A. Smith, Y. Choi, 언어 모델은 모호성을 모델링하지 않는 것이 두렵다, 수록: 2023 자연어 처리 경험적 방법 학회 논문집 , 2023, pp. 790–807.

[101] F. Zeng, W. Gao, 일관성을 유지하라는 프롬프트가 자기 일관성보다 나은가? 사전학습 언어 모델을 사용한 퓨샷 및 제로샷 사실 검증, 수록: 전산언어학협회 연구 결과: ACL 2023 , 2023, pp. 4555–4569.

[102] M. Liu, J. Fang, 자기 일관성 기반 환각 탐지로 대규모 언어 모델의 수학적 추론 강화, arXiv 사전출판물 arXiv:250409440 , 2025.

[103] T. Liu, W. Xu, W. Huang, Y. Zeng, J. Wang, X. Wang, H. Yang, J. Li, Logic-of-thought: 대규모 언어 모델의 완전한 추론을 위해 맥락에 논리를 주입하기, 수록: 전산언어학협회 미주 지역 지부 2025 학회: 인간 언어 기술(제1권: 장문 논문) 논문집 , 2025, pp. 10168–10185.

[104] H. Hu, H. Lu, H. Zhang, Y.Z. Song, W. Lam, Y. Zhang, 기호 사슬 프롬프팅은 대규모 언어 모델에서 계획 수립을 이끌어 낸다, arXiv 사전출판물 arXiv:230510276 , 2023.

[105] S. Yao, D. Yu, J. Zhao, I. Shafran, T. Griffiths, Y. Cao, K. Narasimhan, 사고의 나무: 대규모 언어 모델을 활용한 신중한 문제 해결, 수록: A. Oh, T. Naumann, A. Globerson, K. Saenko, M. Hardt, S. Levine (Eds.)

[121] F. Shi, X. Chen, K. Misra, N. Scales, D. Dohan, E.H. Chi, N. Schärli, D. Zhou, 대규모 언어 모델은 관련 없는 맥락에 쉽게 주의가 분산될 수 있다, 수록: 기계학습 국제 학회, PMLR, 2023, pp. 31210–31227.

[122] R. Jia, P. Liang, 독해 시스템 평가를 위한 적대적 예제, 수록: 2017 자연어 처리 경험적 방법 학회 논문집, 2017, pp. 2021–2031.

[123] S. Sukhbaatar, A. szlam, J. Weston, R. Fergus, 종단간 메모리 네트워크, 수록: C. Cortes, N. Lawrence, D. Lee, M. Sugiyama, R. Garnett (Eds.), 신경 정보 처리 시스템의 발전 , vol. 28, Curran Associates, Inc., 2015, pp. 1–9, https://proceedings.neurips.cc/paper_files/paper/2015/file/8fb21ee7a2207526da55a679f0332de2-Paper.pdf .

[124] Z.Z. Li, D. Zhang, M.L. Zhang, J. Zhang, Z. Liu, Y. Yao, H. Xu, J. Zheng, P.J. Wang, X. Chen, et al., 시스템 1에서 시스템 2로: 추론 대규모 언어 모델에 관한 설문, arXiv 사전출판물 arXiv:250217419, 2025.

[125] D. Zhou, N. Schärli, L. Hou, J. Wei, N. Scales, X. Wang, D. Schuurmans, C. Cui, O. Bousquet, Q. Le, et al., 최소에서 최대로의 프롬프팅은 대규모 언어 모델의 복잡한 추론을 가능하게 한다, arXiv 사전출판물 arXiv:220510625, 2022.

[126] J. Wei, D. Huang, Y. Lu, D. Zhou, Q.V. Le, 단순한 합성 데이터는 대규모 언어 모델의 아첨 성향을 줄인다, arXiv 사전출판물 arXiv:230803958, 2023.

[127] S. Welleck, I. Kulikov, S. Roller, E. Dinan, K. Cho, J. Weston, 비우도 학습을 사용한 신경 텍스트 생성, arXiv 사전출판물 arXiv:190804319, 2019.

[128] N. Shinn, F. Cassano, A. Gopinath, K. Narasimhan, S. Yao, Reflexion: 언어적 강화학습을 사용하는 언어 에이전트, Adv. Neural Inf. Process. Syst. 36 (2023) 8634–8652.

[129] S. Dhuliawala, M. Komelii, J. Xu, R. Raileanu, X. Li, A. Celikyilmaz, J. Weston, 검증 사슬은 대규모 언어 모델의 환각을 줄인다, 수록: 전산언어학협회 연구 결과: ACL 2024, 2024, pp. 3563–3578.

[130] M. Nye, A.J. Andreassen, G. Gur-Ari, H. Michalewski, J. Austin, D. Bieber, D. Dohan, A. Lewkowycz, M. Bosma, D. Luan, C. Sutton, A. Odena, 작업을 보여줘: 언어 모델을 사용한 중간 계산용 스크래치패드, 2022. https://openreview.net/forum?id=iedYJm92o0a .

[131] J. Shi, Q. Guo, Y. Liao, S. Liang, LegalGPT: 법률 대규모 언어 모델 다중 에이전트 프레임워크를 위한 법률 사고 사슬, 수록: 지능 컴퓨팅 국제 학회, Springer, 2024, pp. 25–37.

[132] E. Zelikman, Y. Wu, J. Mu, N. Goodman, Star: 추론으로 추론 부트스트래핑하기, Adv. Neural Inf. Process. Syst. 35 (2022) 15476–15488.

[133] Z. Wang, H. Zhang, C.L. Li, J.M. Eisenschlos, V. Perot, Z. Wang, L. Miculicich, Y. Fujii, J. Shang, C.Y. Lee, et al., Chain-of-table: 테이블 이해를 위한 추론 사슬에서 테이블 진화시키기, arXiv 사전출판물 arXiv:240104398, 2024.

[134] J. Jiang, K. Zhou, Z. Dong, K. Ye, W.X. Zhao, J.R. Wen, StructGPT: 대규모 언어 모델이 구조화된 데이터를 추론하기 위한 일반 프레임워크, 수록: 2023 자연어 처리 경험적 방법 학회 논문집, 2023, pp. 9237–9251.

[135] Y. Hao, Y. Sun, L. Dong, Z. Han, Y. Gu, F. Wei, 구조화 프롬프팅: 인컨텍스트 학습을 1, 000개 예제로 확장하기, arXiv 사전출판물 arXiv:221206713, 2022.

[136] C. Wang, X. Li, H. Liu, X. Wu, W. He, 프로그램 유도 학습을 통한 대규모 언어 모델의 효율적인 논리 추론, Authorea Prepr. (2024).

[137] J. Kaddour, J. Harris, M. Mozes, H. Bradley, R. Raileanu, R. McHardy, 대규모 언어 모델의 과제와 응용, arXiv 사전출판물 arXiv:230710169, 2023.

[138] G.V. Aher, R.I. Arriaga, A.T. Kalai, 대규모 언어 모델을 사용하여 다수의 인간을 시뮬레이션하고 인간 대상 연구를 재현하기, 수록: 기계학습 국제 학회, PMLR, 2023, pp. 337–371.

[139] G. Izacard, E. Grave, 개방 도메인 질의응답을 위한 생성 모델의 구절 검색 활용, 수록: 전산언어학협회 유럽 지부 제16회 학회 논문집: 본권, 2021, pp. 874–880.

[140] K. Shuster, S. Poff, M. Chen, D. Kiela, J. Weston, 검색 증강은 대화에서 환각을 줄인다, 수록: 전산언어학협회 연구 결과: EMNLP 2021, 2021, pp. 3784–3803.

[141] H. Tan, Q. Luo, L. Jiang, Z. Zhan, J. Li, H. Zhang, Y. Zhang, 다중 검색 증강 생성을 통한 프롬프트 기반 코드 완성, ACM Trans. Softw. Eng. Methodol. 35 (1) (2025) 1–28.

[142] B.J. Chan, C.T. Chen, J.H. Cheng, H.H. Huang, RAG를 하지 마라: 지식 작업에 캐시 증강 생성만으로 충분할 때, 수록: ACM 웹 학회 2025 동반 논문집, 2025, pp. 893–897.

[143] D. Edge, H. Trinh, N. Cheng, J. Bradley, A. Chao, A. Mody, S. Truitt, D. Metropolitansky, R.O. Ness, J. Larson, 지역에서 전역으로: 질의 중심 요약을 위한 그래프 RAG 접근법, arXiv 사전출판물 arXiv:240416130, 2024.

[144] C. Mavromatis, G. Karypis, GNN-RAG: 대규모 언어 모델 추론을 위한 그래프 신경 검색, arXiv 사전출판물 arXiv:240520139, 2024.

[145] A. Singh, A. Ehtesham, S. Kumar, T.T. Khoei, 에이전틱 검색 증강 생성: 에이전틱 RAG에 관한 설문, arXiv 사전출판물 arXiv:250109136, 2025.

[146] Z. Yang, L. Li, J. Wang, K. Lin, E. Azarnasab, F. Ahmed, Z. Liu, C. Liu, M. Zeng, L. Wang, Mm-react: 멀티모달 추론과 행동을 위해 ChatGPT 프롬프팅하기, arXiv 사전출판물 arXiv:230311381, 2023.

[147] W. Wang, L. Dong, H. Cheng, X. Liu, X. Yan, J. Gao, F. Wei, 장기 기억으로 언어 모델 증강하기, Adv. Neural Inf. Process. Syst. 36 (2023) 74530–74543.

[148] D. Anh-Hoang, V. Tran, L.M. Nguyen, 대규모 언어 모델의 환각에 관한 설문과 분석: 프롬프팅 전략 또는 모델 행동에의 귀속, Front. Artif. Intell. 8 (2025) 1622292.

[149] L.C. Magister, J. Mallinson, J. Adamek, E. Malmi, A. Severyn, 소규모 언어 모델에 추론 가르치기, 수록: 제61회 전산언어학협회 연례 학회 논문집(제2권: 단문 논문), 2023, pp. 1773–1781.

[150] L. Beurer-Kellner, M. Fischer, M. Vechev, 프롬프팅은 프로그래밍이다: 대규모 언어 모델을 위한 질의 언어, Proc. ACM Program. Lang. 7 (PLDI) (2023) 1946–1969.

[151] Q. Lyu, S. Havaldar, A. Stein, L. Zhang, D. Rao, E. Wong, M. Apidianaki, C. Callison-Burch, 충실한 사고 사슬 추론, 수록: 제13회 자연어 처리 국제 공동 학회 및 전산언어학협회 아시아태평양 지부 제3회 학회(제1권: 장문 논문) 논문집, 2023, pp. 305–329.

[152] S. Diao, P. Wang, Y. Lin, R. Pan, X. Liu, T. Zhang, 대규모 언어 모델을 위한 사고 사슬 기반 능동 프롬프팅, 수록: 제62회 전산언어학협회 연례 학회 논문집(제1권: 장문 논문), 2024, pp. 1330–1350.

[153] H.D. Kabir, S.K. Mondal, S. Khanam, A. Khosravi, S. Rahman, M.R.C. Qazani, R. Alizadehsani, H. Asadi, S. Mohamed, S. Nahavandi, et al., 유사성과 민감도로부터의 불확실성 인식 신경망, Appl. Soft Comput. 149 (2023) 111027.

[154] B. Settles, 능동 학습 문헌 설문, 컴퓨터 과학 기술 보고서 1648, 위스콘신-매디슨 대학교, 2009.

[155] Y. Gal, Z. Ghahramani, 베이지안 근사로서의 드롭아웃: 딥러닝에서 모델 불확실성 표현하기, 수록: 기계학습 국제 학회, PMLR, 2016, pp. 1050–1059.

[156] M. Georgieva, I. Patias, P. Totev, 학술 과정에서 대규모 언어 모델을 평가하기 위한 프롬프트 엔지니어링 방법론, 수록: 2025 제9회 다학제 연구 및 혁신 기술 국제 심포지엄(ISMSIT), IEEE, 2025, pp. 1–6.

[157] Y. Zhou, A.I. Muresanu, Z. Han, K. Paster, S. Pitis, H. Chan, J. Ba, 대규모 언어 모델은 인간 수준의 프롬프트 엔지니어다.(2022), arXiv 사전출판물 arXiv:221101910, 2022.

[158] P. Liu, W. Yuan, J. Fu, Z. Jiang, H. Hayashi, G. Neubig, 사전학습, 프롬프트, 예측: 자연어 처리의 프롬프팅 방법에 관한 체계적 설문, ACM Comput. Surv. 55 (9) (2023) 1–35.

[159] T. Mikolov, K. Chen, G. Corrado, J. Dean, 벡터 공간에서 단어 표현의 효율적 추정, arXiv 사전출판물 arXiv:13013781, 2013.

[160] U. Khandelwal, H. He, P. Qi, D. Jurafsky, 가까이는 선명하고 멀리는 흐릿하다: 신경 언어 모델이 맥락을 사용하는 방식, 수록: 제56회 전산언어학협회 연례 학회 논문집(제1권: 장문 논문), 2018, pp. 284–294.

[161] A. See, P.J. Liu, C.D. Manning, 핵심으로 가기: 포인터-생성기 네트워크를 사용한 요약, 수록: 제55회 전산언어학협회 연례 학회 논문집(제1권: 장문 논문), 2017, pp. 1073–1083.

[162] A. Conneau, K. Khandelwal, N. Goyal, V. Chaudhary, G. Wenzek, F. Guzmán, E. Grave, M. Ott, L. Zettlemoyer, V. Stoyanov, 비지도 교차

[178] B. Felbo, A. Mislove, A. Søgaard, I. Rahwan, S. Lehmann, 감정, 정서 및 풍자 탐지를 위한 모든 도메인 표현 학습에 수백만 건의 이모지 출현 활용하기, 수록: 2017 자연어 처리 경험적 방법 학회 논문집, 2017, pp. 1615–1625.

[179] W. Chen, X. Ma, X. Wang, W.W. Cohen, 사고 프로그램 프롬프팅: 수치 추론 작업에서 계산과 추론 분리하기, arXiv 사전출판물 arXiv:221112588, 2022.

[180] C. Li, J. Liang, A. Zeng, X. Chen, K. Hausman, D. Sadigh, S. Levine, L. Fei-Fei, F. Xia, B. Ichter, 코드 사슬: 언어 모델 증강 코드 에뮬레이터로 추론하기, arXiv 사전출판물 arXiv:231204474, 2023.

[181] V. Tereshchenko, V. Martsinkevich, N. Aminov, A. Dukhanov, 미세 조정 및 프롬프트 엔지니어링 방법을 사용하여 학위 논문 텍스트에서 목표와 목적을 식별하기 위한 LLM의 사용, 수록: 2025 인공지능, 컴퓨터, 데이터 과학 및 응용 국제 학회(ACDSA), IEEE, 2025, pp. 1–5.

[182] H. Luo, J. Wu, J. Liu, M.F. Antwi-Afari, 건설 조립 로봇 제어를 위한 대규모 언어 모델 기반 코드 생성: 계층적 생성 접근법, Dev. Built Environ. 19 (2024) 100488.

[183] X. Xu, H. Zhao, V. Vineet, S.N. Lim, A. Torralba, Mtformer: 트랜스포머와 작업 간 추론을 통한 다중 작업 학습, 수록: 유럽 컴퓨터 비전 학회, Springer, 2022, pp. 304–321.

[184] D. Yang, T. Liu, D. Zhang, A. Simoulin, X. Liu, Y. Cao, Z. Teng, X. Qian, G. Yang, J. Luo, et al., 생각하기 위한 코드, 코딩하기 위한 사고: LLM의 코드 강화 추론 및 추론 주도 코드 지능에 관한 설문, 수록: 2025 자연어 처리 경험적 방법 학회 논문집, 2025, pp. 2586–2616.

[185] S. Krause, F. Stolzenburg, 대규모 언어 모델을 사용한 상식 추론과 설명 가능한 인공지능, 수록: 유럽 인공지능 학회, Springer, 2023, pp. 302–319.

[186] J. Roh, V. Gandhi, S. Anilkumar, A. Garg, 코드 사슬 붕괴: 코드 생성에서 적대적 프롬프팅을 통한 LLM의 추론 실패, arXiv 사전출판물 arXiv:250606971, 2025.

[187] K.V. Bodla, H. Yang, Protocode: LLM의 코드 생성을 위한 프로토타입 주도 해석 가능성, arXiv 사전출판물 arXiv:250925247, 2025.

[188] C. Yang, X. Wang, Y. Lu, H. Liu, Q.V. Le, D. Zhou, X. Chen, 최적화 도구로서의 대규모 언어 모델, 수록: 학습 표현 국제 학회, vol. 2024, 2024, pp. 12028–12068.

[189] C. Yang, X. Wang, Y. Lu, H. Liu, Q.V. Le, D. Zhou, X. Chen, 최적화 도구로서의 대규모 언어 모델, 수록: 제12회 학습 표현 국제 학회, 2023, pp. 1–41.

[190] D. Huang, S. Shi, C.Y. Lin, J. Yin, W.Y. Ma, 컴퓨터는 수학 문장제 문제를 얼마나 잘 푸는가? 대규모 데이터셋 구축 및 평가, 수록: 제54회 전산언어학협회 연례 학회 논문집(제1권: 장문 논문), 2016, pp. 887–896.

[191] M. Suzgun, N. Scales, N. Schärli, S. Gehrmann, Y. Tay, H.W. Chung, A. Chowdhery, Q. Le, E. Chi, D. Zhou, et al., 도전적인 BIG-bench 과제와 사고 사슬이 이를 해결할 수 있는지, 수록: 전산언어학협회 연구 결과: ACL 2023, 2023, pp. 13003–13051.

[192] D. Baldelli, J. Jiang, A. Aizawa, P. Torroni, TWOLAR: 구절 재순위화를 위한 2단계 LLM 증강 증류 방법, 수록: 유럽 정보 검색 학회, Springer, 2024, pp. 470–485.

[193] D. Refai, M.S. Al-Shaibani, I. Ahmad, 이것이 최고의 프롬프트인가? LLM 전반의 아랍어 NLP용 프롬프트 점수화, IEEE Access 13 (2025) 171468–171492, https://doi.org/10.1109/ACCESS.2025.3616181

[194] E.M. Bender, T. Gebru, A. McMillan-Major, S. Shmitchell, 확률적 앵무새의 위험에 대하여: 언어 모델은 너무 커질 수 있는가? 수록: 2021 ACM 공정성, 책임성 및 투명성 학회 논문집, 2021, pp. 610–623.

[195] N.F. Rajani, B. McCann, C. Xiong, R. Socher, 스스로 설명하라! 상식 추론을 위한 언어 모델 활용, 수록: 제57회 전산언어학협회 연례 학회 논문집, 2019, pp. 4932–4942.

[196] S. Koneru, M. Exel, M. Huck, J. Niehues, 번역의 맥락적 정제: 문장 및 문서 수준 후편집을 위한 대규모 언어 모델, 수록: 전산언어학협회 북미 지부 2024 학회: 인간 언어 기술(제1권: 장문 논문) 논문집, 2024, pp. 2711–2725.

[197] S.K. Pandey, S. Chand, J. Horkoff, M. Staron, M. Ochodek, D. Durisic, 디자인 패턴 인식: 대규모 언어 모델 연구, Empir. Softw. Eng. 30 (3) (2025) 69.

[198] D. Panas, A. Payani, V. Belle, LLM 추론의 비합리적 효율성: 시간적 질의응답에 관한 이중의 경고적 이야기, Trans. Mach. Learn. Res. (2025).

[199] I.B. Schlicht, Z. Zhao, B. Sayin, L. Flek, P. Rosso, LLM은 언어 전반의 건강 관련 질문에 일관된 답변을 제공하는가? 수록: 유럽 정보 검색 학회, Springer, 2025, pp. 314–322.

[200] J. Li, Y. Deng, Q. Sun, J. Zhu, Y. Tian, J. Li, T. Zhu, 근거 기반 의학에서 대규모 언어 모델 벤치마킹, IEEE J. Biomed. Health Inform. 29 (9) (2024) 6143–6156.

[201] J. Lin, Z. Han, D.R. Thomas, A. Gurung, S. Gupta, V. Aleven, K.R. Koedinger, 어떻게 하면 올바르게 할 수 있을까? GPT를 사용하여 부정확한 훈련생 응답을 바꾸어 표현하기, Int. J. Artif. Intell. Educ. 35 (2) (2025) 482–508.

[202] K. Zhu, J. Wang, J. Zhou, Z. Wang, H. Chen, Y. Wang, L. Yang, W. Ye, Y. Zhang, N. Gong, et al., Promptrobust: 적대적 프롬프트에서 대규모 언어 모델의 견고성 평가를 향하여, 수록: 개인정보 보호 및 안전 분석을 갖춘 대규모 AI 시스템 및 모델 제1회 ACM 워크숍 논문집, 2023, pp. 57–68.

[203] A. Tang, L. Soulier, V. Guigue, 모호성 명료화: 명료화 생성 프롬프팅 방법에서 모호성 유형의 역할에 대하여, 수록: 정보 검색 연구 및 개발에 관한 제48회 국제 ACM SIGIR 학회 논문집, 2025, pp. 20–30.

[204] P. Maini, S. Seto, R. Bai, D. Grangier, Y. Zhang, N. Jaitly, 웹 바꾸어 표현하기: 계산 및 데이터 효율적인 언어 모델링을 위한 방법, 수록: 제62회 전산언어학협회 연례 학회 논문집(제1권: 장문 논문), 2024, pp. 14044–14072.

[205] H.S. Zheng, S. Mishra, X. Chen, H.T. Cheng, E.H. Chi, Q.V. Le, D. Zhou, 한 걸음 물러서기: 대규모 언어 모델에서 추상화를 통한 추론 유발, 수록: 제12회 학습 표현 국제 학회, 2024, pp. 1–38, https://openreview.net/forum?id=3bq3jsvcQ1 .

[206] D. Chen, W.T. Yih, 개방 도메인 질의응답, 수록: 제58회 전산언어학협회 연례 학회 논문집: 튜토리얼 초록, 2020, pp. 34–37.

[207] K. Cobbe, V. Kosaraju, M. Bavarian, M. Chen, H. Jun, L. Kaiser, M. Plappert, J. Tworek, J. Hilton, R. Nakano, et al., 수학 문장제 문제를 풀기 위한 검증기 학습, arXiv 사전출판물 arXiv:211014168, 2021.

[208] T. Khot, H. Trivedi, M. Finlayson, Y. Fu, K. Richardson, P. Clark, A. Sabharwal, 분해된 프롬프팅: 복잡한 작업 해결을 위한 모듈식 접근법, 수록: 제11회 학습 표현 국제 학회, 2023, pp. 1–69, https://openreview.net/forum?id=_nGgzQjzaRy .

[209] J.W. Rae, S. Borgeaud, T. Cai, K. Millican, J. Hoffmann, F. Song, J. Aslanides, S. Henderson, R. Ring, S. Young, et al., 언어 모델 확장: Gopher 학습에서의 방법, 분석 및 통찰, arXiv 사전출판물 arXiv:211211446, 2021.

[210] A. Creswell, M. Shanahan, 대규모 언어 모델을 사용한 충실한 추론, arXiv 사전출판물 arXiv:220814271, 2022.

[211] S. Brade, B. Wang, M. Sousa, S. Oore, T. Grossman, Promptify: 대규모 언어 모델을 사용한 대화형 프롬프트 탐색을 통한 텍스트-이미지 생성, 수록: 제36회 ACM 사용자 인터페이스 소프트웨어 및 기술 심포지엄 논문집, 2023, pp. 1–14.

[212] R. Shalev-Arkushin, R. Gal, A.H. Bermano, O. Fried, ImageRAG: 참조 유도 이미지 생성을 위한 동적 이미지 검색, arXiv 사전출판물 arXiv:250209411, 2025.

[213] H. Liu, Z. Teng, L. Cui, C. Zhang, Q. Zhou, Y. Zhang, Logicot: 논리적 사고 사슬 지시 미세 조정, 수록: 전산언어학협회 연구 결과: EMNLP 2023, 2023, pp. 2908–2921.

[214] X. Yang, R. Zhan, S. Yang, J. Wu, L.S. Chao, D.F. Wong, 대규모 언어 모델에서 프롬프트 기반 편향 완화 재고하기, 수록: 전산언어학협회 연구 결과: ACL 2025, 2025, pp. 26538–26553.

[215] X. Li, R. Zhao, Y.K. Chia, B. Ding, S. Joty, S. Poria, L. Bing, Chain-of-knowledge: 이질적 출처에 걸친 동적 지식 적응을 통해 대규모 언어 모델을 근거화하기, 수록: 학습 표현 국제 학회, vol. 2024, 2024, pp. 9565–9587.

[216] W. Li, X. Wang, W. Li, B. Jin, 한 설문