전체 글(62)
-
리눅스 파티션 추가
이제 파티션이 없는 상태(clean 4TB 디스크)일 테니 이어서 진행하시면 됩니다: bashlsblk /dev/sda파티션이 없는지(sda1이 없는지) 확인하시고, 없으면: bashsudo parted /dev/sda --script mklabel gpt mkpart primary ext4 0% 100%sudo partprobe /dev/sdasudo udevadm settlelsblk /dev/sdasda1이 생겼으면: bashsudo mkfs.ext4 -F /dev/sda1sudo mkdir -p /mnt/disk4tbsudo mount /dev/sda1 /mnt/disk4tbdf -hdf -h에서 /dev/sda1이 /mnt/disk4tb로 3.6T 근처 용량으로 뜨면 완료입니다.
2026.09.05 -
클로드코드 터미널 설치 기초 1
1) 네이티브 설치 (권장)macOS / Linux / WSL: bashcurl -fsSL https://claude.ai/install.sh | bashWindows PowerShell: powershellirm https://claude.ai/install.ps1 | iex2) npm으로 설치 (Node.js 18+ 필요) bashnpm install -g @anthropic-ai/claude-code※ sudo npm install -g 는 권한 문제를 일으키니 쓰지 마세요.3) 실행 & 로그인 bashcd 프로젝트폴더claude처음 실행하면 브라우저가 열리고 Claude 구독 계정 또는 Console API 키로 로그인합니다. 나중에 계정을 바꾸려면 세션 안에서 /login.4) 설치 확인 / 업..
2026.08.25 -
held-out validation 없이, 과거의 지연 라벨·검증기 피드백을 이용하는 prequential 정지 관련 연구
2. 관련 연구2.1 테스트타임 컴퓨트의 한계 수익추론 길이를 늘리면 성능이 오른다는 전제는 최근 정면으로 검토되기 시작했다. Zhou 등은 추가 추론 토큰의 한계효용이 예산 증가에 따라 어떻게 변하는지를 체계적으로 조사해, 높은 예산에서 한계 수익이 크게 감소하며, 확장된 추론이 이미 도달했던 정답을 버리는 "과잉사고" 현상과 연관됨을 보고했다. 또한 최적 사고 길이가 문제 난이도에 따라 달라져 균일한 연산 배분이 준최적임을 지적했다. 유사한 현상은 병렬 탐색 축에서도 관찰되어, 넓은 빔 탐색이 노이즈 있는 채점기 위에서 후보 풀 크기에 비례해 커지는 체계적 과대추정 편향을 유발한다는 분석이 제시되었다. arxiv이들 연구는 곡선의 형태를 사후적으로 특징짓는다. 라벨된 코퍼스 전체를 관측한 뒤 어느 예..
2026.08.02 -
Kolmogorov–Arnold Transformer (Review)
연구 배경 및 동기 기존 트랜스포머의 한계: 현대의 트랜스포머 모델(ViT 등)은 Attention 메커니즘과 MLP(Multi-Layer Perceptron) 레이어로 구성됩니다. 하지만 MLP는 선형 레이어와 단순 비선형 활성화 함수(ReLU 등)의 조합이어서, 주기 함수나 고주파 성분을 학습하는 데 시간이 오래 걸리고 복잡한 함수를 근사하는 데 구조적 한계가 있습니다. KAN의 등장과 실패: 최근 대안으로 등장한 KAN(콜모고로프-아놀드 네트워크)은 고정된 활성화 함수 대신 가중치마다 '학습 가능한 1차원 함수(B-Spline 등)'를 배치하여 이론적으로 매우 뛰어난 파라미터 효율성과 표현력을 보여주었습니다. 하지만 이를 트랜스포머에 그대로 적용(ViT+KAN)했을 때는 심각한 성능 저하와 학습 ..
2026.07.23 -
On the Benefits of Learning to Route in Mixture-of-Experts Models 리뷰
1. 논문의 배경 및 주제배경 (Introduction): 최근 트랜스포머(Transformer) 기반 모델들이 커지면서 성능은 좋아지지만 계산 비용이 너무 비싸지고 있습니다. 이를 해결하기 위해 '조건부 연산(Conditional Compute)' 구조가 등장했습니다. 이는 모든 데이터를 처리할 때 전체 네트워크를 다 쓰는 게 아니라, 일부만 활성화해서 쓰는 방식입니다. 대표적인 예가 MoE (Mixture-of-Experts) 모델입니다.MoE의 핵심 구조: MoE는 여러 개의 '전문가(Experts)' 네트워크와 입력 데이터를 어떤 전문가에게 보낼지 결정하는 **'라우터(Router)'**로 구성됩니다. 2. 연구의 목적 (Abstract)기존 연구들은 MoE가 계산 비용을 늘리지 않고도 모델 크기..
2025.12.15 -
old start 방식의 감독 학습(supervised fine-tuning)ChatGPT
"Old start 방식의 감독 학습(supervised fine-tuning)"은 자연어 처리, 특히 언어 모델(Language Model)*이나 대형 사전 학습 모델(LLM)의 미세조정(fine-tuning) 맥락에서 등장하는 개념입니다. 이 용어는 일반적으로 특정 전략이나 초기화 방식과 관련되며, 최신 방법들과 대비해 초기부터 전통적인 방식으로 미세조정하는 전략을 의미합니다. Old Start 방식의 정의Old start 방식은 다음과 같은 특징을 가집니다:모델의 전(pre-trained) 파라미터를 그대로 유지하고, 초기부터 전체 네트워크 또는 하위 모듈 전체를 동시에 미세조정함학습 초기부터 라벨 데이터를 직접 사용한 감독 학습(Supervised Fine-Tuning; SFT)을 적용초기에는 모..
2025.06.08