GPTAKU BOT · DIGEST

8월 16일, 클코단에서 오간 이야기

08-16 09:00~11:46 발화 116 참여 16 주제 9갈래

옆으로 밀어 시간대별 흐름 보기

09:00
09:55
10:18
10:26
10:40
10:41 · 14건
10:45
10:50
11:46
09:00-10:10

Modal 무료 GPU 글

09:51-09:51

Opus 5 High 속도

10:17-10:18

인세인리뷰 구독 조건

10:19-10:35

플러그인 토큰 소비

10:37-10:42

헤르메스 스킬 장기작업

10:41-10:42

Effort 자동 설정

10:43-10:49

H200 병렬 추론 성능

11:03-11:03

Headroom 프록시 이슈

11:43-11:46

웹디자인 스킬 추천

10:43-10:49도구·라이브러리

H200 병렬 추론 성능

Gemma4에서 TP=2, 병렬 8개, 최대 토큰 64k 설정으로 H200 두 장 사용 시 2500 TPS가 가능하다는 성능 구성이 공유됐다. 실제 대화에서는 약 25~26 TPS라는 언급도 있었고, 모델 밀도·하드웨어·MLX 최적화 여부에 따라 성능 차이가 난다는 의견이 나왔다. H200, B200, B300 같은 GPU 장비와 전력·비용 부담, vLLM 기반 운영 솔루션 사업 가능성도 가볍게 논의됐다.

  • Gemma4 추론에서 TP=2와 병렬 8개, 64k 최대 토큰 설정이 언급됐다.
  • H200 GPU 두 장 사용 시 2500 TPS라는 고성능 구성 사례가 공유됐다.
  • 다른 환경에서는 25~26 TPS 수준이라는 실제 측정 언급이 나왔다.
  • 밀집 모델은 특정 하드웨어에서 느릴 수 있고 MLX 최적화가 덜 됐을 수 있다는 의견이 나왔다.
  • 고성능 GPU의 구매 비용과 전력 제약, vLLM 운영 솔루션 사업화 가능성이 언급됐다.
11:03-11:03질문·트러블슈팅

Headroom 프록시 이슈

Headroom 사용 여부에 따라 컨텍스트가 차는 속도 차이가 크다는 사용 체감이 공유됐다. 다만 Headroom proxy가 RFC 개정에 따라 오염된 응답 코드를 반환하는 문제가 있어 개발자가 수정 중이라는 현황도 언급됐다.

  • Headroom 사용 시 컨텍스트 소모 속도가 크게 달라진다는 체감이 공유됐다.
  • Headroom proxy에서 RFC 개정 관련 응답 코드 문제가 언급됐다.
  • 문제로 인해 오염된 응답 코드가 반환된다고 설명됐다.
  • 개발자가 해당 문제를 수정 중이라는 현황이 공유됐다.
10:19-10:35질문·트러블슈팅

플러그인 토큰 소비

플러그인이 MCP처럼 실제 호출 시점에만 지연 로딩되어 토큰을 쓰는지 질문이 나왔다. 구현마다 로드·노출 시점이 달라 일괄적으로 답할 수 없고, 과거에는 미리 호출돼 컨텍스트를 크게 소비한 경우도 있었다는 의견이 나왔다. 플러그인은 스킬·훅·MCP를 묶은 형태로 보이며, 훅의 pre/post 스크립트가 컨텍스트를 소비할 수 있다는 설명이 덧붙었다.

  • 플러그인 도구 스키마의 지연 로딩과 토큰 소비 시점이 질문됐다.
  • 로드·노출 시점은 플러그인 구현 설계마다 다르다는 의견이 제시됐다.
  • 사전 호출 방식은 컨텍스트 윈도우를 많이 소모할 수 있다는 경험담이 나왔다.
  • pre/post 훅 스크립트가 컨텍스트 사용량에 영향을 줄 수 있다는 설명이 나왔다.
  • 플러그인 호출 뒤 내부 도구 호출 여부를 판단하는 구조라는 견해가 제시됐다.
11:43-11:46도구·라이브러리

웹디자인 스킬 추천

Claude용 홈페이지 제작·디자인 전문 스킬 가운데 높은 평가를 받는 도구를 찾는 질문이 나왔다. 이어 ui-ux-pro-max-skill이 스타 수가 높다는 언급과 함께 GitHub 저장소가 공유됐다. 대화 내에서는 비교 평가나 실제 사용 후기는 이어지지 않았다.

  • Claude용 홈페이지 제작 및 디자인 스킬 추천 요청이 나왔다.
  • ui-ux-pro-max-skill이 높은 스타 수를 가진 도구로 언급됐다.
  • 해당 GitHub 저장소 링크가 공유됐다.
  • 도구의 세부 기능과 다른 스킬 대비 평가는 대화에서 다뤄지지 않았다.
  • https://github.com/nextlevelbuilder/ui-ux-pro-max-skill
09:00-10:10자료·링크 공유

Modal 무료 GPU 글

출석 인사와 함께 Modal 무료 크레딧으로 L40S GPU를 사용하는 매거진 글이 반복 공유됐다. 구체적인 글 내용에 대한 후속 토론은 없었다.

  • Modal 무료 크레딧과 L40S GPU를 다룬 매거진 글이 공유됐다.
  • 여러 출석 메시지에 동일한 링크가 포함됐다.
  • 링크 내용 자체를 분석하거나 검증하는 대화는 이어지지 않았다.
  • https://chat.axwith.com/mag/
10:17-10:18질문·트러블슈팅

인세인리뷰 구독 조건

/insane-review 사용에 ChatGPT Pro 구독이 필요한지 질문이 나왔다. 한 참여자는 플랜과 스킬은 무관하므로 사용할 수 있다고 답했지만, 뒤이어 해당 스킬이 GPT Pro 웹 모델의 리뷰를 받아오는 방식이라는 보충 설명도 나왔다. 플러스에서 GPT Pro 사용은 불가능하다는 언급이 있어 실제 사용 조건은 연결된 모델·구성에 따라 확인이 필요해 보인다.

  • /insane-review의 사용 가능 구독 플랜이 질문됐다.
  • 스킬 자체와 플랜은 별개라는 답변이 나왔다.
  • 해당 스킬이 GPT Pro 웹 모델 기반 리뷰를 받아오는 스킬이라는 설명이 추가됐다.
  • 플러스 플랜에서는 GPT Pro 사용이 불가능하다는 반론성 보충이 있었다.
10:37-10:42워크플로우·방법론

헤르메스 스킬 장기작업

헤르메스에 스킬 제작을 맡긴 뒤 한 시간 넘게 완료 알림이 오지 않는 사례가 공유됐다. 다른 참여자는 스킬 하나 제작에 7시간이 걸린 경험을 언급했고, 장기 작업에는 복잡한 잔가지와 메모리 누적 설정 등이 영향을 줄 수 있다는 흐름이 나왔다. 로컬 모델로 스킬 제작을 시켜 보며 해결 과정을 관찰 중이라는 설명도 있었다.

  • 스킬 제작 에이전트 작업이 한 시간 이상 지속된 사례가 나왔다.
  • 스킬 하나 제작에 7시간이 걸린 경험담이 공유됐다.
  • 작업 시간이 길어지는 이유로 복잡한 세부 작업이 언급됐다.
  • 작업 메모리 누적 설정을 놓쳤다는 점이 언급됐다.
  • 로컬 모델의 문제 해결 과정을 관찰하는 용도로 작업을 맡겼다는 설명이 나왔다.
10:41-10:42AI 모델·프롬프트

Effort 자동 설정

Effort 설정을 auto로 두는 것이 나쁘지는 않지만 고민된다는 의견이 나왔다. 완전히 끄면 결과가 별로라는 체감도 함께 공유됐다. 구체적인 권장값이나 실험 결과는 나오지 않았다.

  • Effort 자동 설정의 품질과 효율이 언급됐다.
  • 자동 설정을 완전히 끄면 결과가 좋지 않다는 체감이 공유됐다.
  • 최적 설정값에 대한 결론은 나지 않았다.
09:51-09:51AI 모델·프롬프트

Opus 5 High 속도

Opus 5 High가 이전보다 빨라진 듯하다는 체감 의견이 나왔다. 벤치마크나 원인 분석은 이어지지 않았다.

  • Opus 5 High의 응답 속도가 빨라졌다는 사용 체감이 언급됐다.
  • 객관적 측정값이나 환경 정보는 공유되지 않았다.
  • 후속 논의 없이 짧게 끝났다.